Login
Back to Blog
РусскийComparison

Claude Opus 5 против GPT-5.6 Luna: 18 проверяемых задач без рейтинга скорости

Сравнение Claude Opus 5 и GPT-5.6 Luna с приоритетом проверяемой точности: математика, физика, алгоритмы, ложные предпосылки, ограничения и инструкции.

C
Crazyrouter Team
July 30, 2026 / 3 views
Share:
Claude Opus 5 против GPT-5.6 Luna: 18 проверяемых задач без рейтинга скорости

Claude Opus 5 против GPT-5.6 Luna: 18 проверяемых задач без рейтинга скорости

Короткий ответ#

В усложнённом раунде Claude Opus 5 получил 17/18 (94,4%), а GPT-5.6 Luna — 16/18 (88,9%). Это преимущество в одну задачу в данной выборке, а не доказательство универсального превосходства. Важнее тип ошибок: Opus сдал все три исполняемых алгоритма, но нарушил контракт строгого JSON; Luna идеально выполнила три форматных инструкции, однако два Python-файла падали уже при импорте.

Почему задачи пришлось усложнить#

Первый раунд из восьми задач не разделил модели: обе набрали 8/8. Поэтому второй раунд включил 18 задач уровней hard, harder и extreme в шести категориях. Требовались точные дроби, многоэтапные физические модели, целые исполняемые файлы, распознавание ложных предпосылок, единственные решения систем ограничений и буквальное соблюдение формата. Красивое объяснение само по себе баллов не давало: решающие утверждения проверялись вычислением, парсером JSON или запуском Python.

Как оценивались 18 задач#

Обе модели получали одинаковые задания, системную инструкцию, temperature и бюджет вывода для каждой задачи. Математика и физика сверялись с точными значениями и допусками. Код сохранялся без правок и импортировался одним скрытым набором тестов. JSON и CSV проверялись как машинные артефакты. Если файл начинает работать только после удаления написанных моделью assert, это объясняет причину сбоя, но не превращает исходную поставку в успешную. Задержка маршрута сохранена только в исходном JSON и не влияет на победителя.

Результаты по шести направлениям#

Точность по шести направлениям

НаправлениеOpus 5GPT-5.6 Luna
Математические рассуждения3/33/3
Сложная физика3/33/3
Готовые алгоритмы3/31/3
Отказ от ложных предпосылок3/33/3
Логика ограничений3/33/3
Соблюдение инструкций2/33/3
Total17/18 (94.4%)16/18 (88.9%)

Разрыв в алгоритмах оказался разрывом в поставке#

В двух неудачных ответах Luna основные функции проходили скрытые тесты после удаления нижнего блока самопроверки. Но собственные assert содержали неверные ожидаемые значения, поэтому исходные файлы выбрасывали AssertionError при импорте. По контракту «готовый Python-файл» это ошибки. Все три файла Opus импортировались и прошли общий harness. Для продакшена вывод прост: правдоподобное тело функции ещё не является готовым артефактом.

Строгий JSON показал преимущество Luna#

Разные ошибки — разные риски в продакшене

Единственная ошибка Opus была зеркальной. Поля и значения JSON оказались правильными, но объект был окружён Markdown-блоком, хотя требовался ровно один JSON-объект без дополнительного текста. Независимый повтор дал тот же результат. Luna прошла все три задачи на соблюдение инструкции. Если ответ сразу поступает в парсер, оболочка — часть корректности, а не вопрос оформления.

Лимит вывода отделён от ошибок интеллекта#

Ранние ответы иногда завершались с finish_reason=length: скрытое рассуждение съедало доступный бюджет. Эти попытки сохранены, но не засчитаны как интеллектуальные ошибки. Перед итоговой оценкой эффективный бюджет одинаково увеличили обеим моделям. Так конфигурация не смешивается с качеством рассуждения, но интеграционный риск остаётся видимым.

Как маршрутизировать запросы в продакшене#

Для строгого JSON, CSV, короткого извлечения и массовой структурированной обработки разумно начинать с Luna, обязательно сохраняя schema-валидацию. Для длинных алгоритмов и защитного инженерного кода — с Opus. В математике, сложной физике, сопротивлении ложным предпосылкам и логике ограничений получилась ничья; здесь полезнее учитывать цену, интерфейс и стиль ответа. Любой результат нужно проверять как артефакт: парсить JSON, сверять числа и запускать код без ручной очистки.

Воспроизведение и исходные данные#

Сценарий запуска: scripts/opus5_vs_luna_hard_benchmark.py. Полный результат: .tmp/opus5-vs-luna-hard-benchmark-results.json. Независимые повторы: .tmp/opus5-hard-failure-retry.json и .tmp/luna-hard-failure-retry.json. Использовался чистый API-адрес https://cn.crazyrouter.com/v1/chat/completions; параметры задержки находятся только в исходных доказательствах.

Частые вопросы#

Означает ли 17/18, что Opus 5 — абсолютный победитель?#

Нет. Это лидерство в одну задачу на конкретном наборе. Здесь не тестировались изображения, инструменты, сверхдлинный контекст и многошаговые агенты.

Почему ошибочные самотесты считаются провалом алгоритма?#

Потому что требовался полный Python-файл. Если исходный файл падает при импорте, система не может использовать его без ручного ремонта.

Почему задержки нет в итоговом решении?#

Она зависит от модели, шлюза, маршрута, нагрузки и состояния канала. Это важная операционная метрика, но не показатель правильности интеллекта.

Итог#

В тесте с приоритетом проверяемой точности Opus 5 выиграл 17/18 против 16/18 благодаря трём готовым алгоритмам. Luna лучше соблюдала строгий формат. Практический итог — не «вечный чемпион», а воспроизводимое правило маршрутизации.

Проверьте обе модели в Crazyrouter на собственных рабочих запросах

Implementation Guides

Topics

Comparison

Related Posts

Claude Opus 5 и GPT-5.6-SOL: проверка точности — обе модели дали 10 из 10 правильных основных ответовComparison

Claude Opus 5 и GPT-5.6-SOL: проверка точности — обе модели дали 10 из 10 правильных основных ответов

Claude Opus 5 и GPT-5.6-SOL прошли 10 проверяемых задач через единый API Crazyrouter. Обе модели дали 10/10 правильных основных ответов; отдельно проверены скрытые тесты кода, полнота инструкций и строгий JSON.

Jul 29
Kimi K3 против Claude Fable 5: точность проверки, обрезка кода и задержка APIComparison

Kimi K3 против Claude Fable 5: точность проверки, обрезка кода и задержка API

Практический API-тест Kimi K3 и Claude Fable 5 на математике, физике, исполняемом Python и логических ограничениях с анализом finish_reason и reasoning tokens.

Jul 17
Достигла ли Kimi K3 уровня Opus 4.8? API-тестирование по семи измерениямComparison

Достигла ли Kimi K3 уровня Opus 4.8? API-тестирование по семи измерениям

Kimi K3 и Claude Opus 4.8: сравнение точности, задержки и эффективности reasoning Token в семи тестах.

Jul 19
GPT-4.1 Mini vs Qwen3 VL Plus: бенчмарк Vision API 2026 для практического выбора моделиComparison

GPT-4.1 Mini vs Qwen3 VL Plus: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gpt-4.1-mini и qwen3-vl-plus в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
Gemini 2.5 Flash Lite vs GPT-4.1 Mini: бенчмарк Vision API 2026 для практического выбора моделиComparison

Gemini 2.5 Flash Lite vs GPT-4.1 Mini: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gemini-2.5-flash-lite и gpt-4.1-mini в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
Gemini 2.5 Flash vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора моделиComparison

Gemini 2.5 Flash vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gemini-2.5-flash и gpt-4.1-nano в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22