Login
Back to Blog
РусскийComparison

Claude Opus 5 против GPT-5.6 Luna: 18 проверяемых задач без рейтинга скорости

Сравнение Claude Opus 5 и GPT-5.6 Luna с приоритетом проверяемой точности: математика, физика, алгоритмы, ложные предпосылки, ограничения и инструкции.

C
Crazyrouter Team
July 30, 2026 / 85 views
Share:
Claude Opus 5 против GPT-5.6 Luna: 18 проверяемых задач без рейтинга скорости

Claude Opus 5 против GPT-5.6 Luna: 18 проверяемых задач без рейтинга скорости

Короткий ответ#

В усложнённом раунде Claude Opus 5 получил 17/18 (94,4%), а GPT-5.6 Luna — 16/18 (88,9%). Это преимущество в одну задачу в данной выборке, а не доказательство универсального превосходства. Важнее тип ошибок: Opus сдал все три исполняемых алгоритма, но нарушил контракт строгого JSON; Luna идеально выполнила три форматных инструкции, однако два Python-файла падали уже при импорте.

Почему задачи пришлось усложнить#

Первый раунд из восьми задач не разделил модели: обе набрали 8/8. Поэтому второй раунд включил 18 задач уровней hard, harder и extreme в шести категориях. Требовались точные дроби, многоэтапные физические модели, целые исполняемые файлы, распознавание ложных предпосылок, единственные решения систем ограничений и буквальное соблюдение формата. Красивое объяснение само по себе баллов не давало: решающие утверждения проверялись вычислением, парсером JSON или запуском Python.

Как оценивались 18 задач#

Обе модели получали одинаковые задания, системную инструкцию, temperature и бюджет вывода для каждой задачи. Математика и физика сверялись с точными значениями и допусками. Код сохранялся без правок и импортировался одним скрытым набором тестов. JSON и CSV проверялись как машинные артефакты. Если файл начинает работать только после удаления написанных моделью assert, это объясняет причину сбоя, но не превращает исходную поставку в успешную. Задержка маршрута сохранена только в исходном JSON и не влияет на победителя.

Результаты по шести направлениям#

Точность по шести направлениям

НаправлениеOpus 5GPT-5.6 Luna
Математические рассуждения3/33/3
Сложная физика3/33/3
Готовые алгоритмы3/31/3
Отказ от ложных предпосылок3/33/3
Логика ограничений3/33/3
Соблюдение инструкций2/33/3
Total17/18 (94.4%)16/18 (88.9%)

Разрыв в алгоритмах оказался разрывом в поставке#

В двух неудачных ответах Luna основные функции проходили скрытые тесты после удаления нижнего блока самопроверки. Но собственные assert содержали неверные ожидаемые значения, поэтому исходные файлы выбрасывали AssertionError при импорте. По контракту «готовый Python-файл» это ошибки. Все три файла Opus импортировались и прошли общий harness. Для продакшена вывод прост: правдоподобное тело функции ещё не является готовым артефактом.

Строгий JSON показал преимущество Luna#

Разные ошибки — разные риски в продакшене

Единственная ошибка Opus была зеркальной. Поля и значения JSON оказались правильными, но объект был окружён Markdown-блоком, хотя требовался ровно один JSON-объект без дополнительного текста. Независимый повтор дал тот же результат. Luna прошла все три задачи на соблюдение инструкции. Если ответ сразу поступает в парсер, оболочка — часть корректности, а не вопрос оформления.

Лимит вывода отделён от ошибок интеллекта#

Ранние ответы иногда завершались с finish_reason=length: скрытое рассуждение съедало доступный бюджет. Эти попытки сохранены, но не засчитаны как интеллектуальные ошибки. Перед итоговой оценкой эффективный бюджет одинаково увеличили обеим моделям. Так конфигурация не смешивается с качеством рассуждения, но интеграционный риск остаётся видимым.

Как маршрутизировать запросы в продакшене#

Для строгого JSON, CSV, короткого извлечения и массовой структурированной обработки разумно начинать с Luna, обязательно сохраняя schema-валидацию. Для длинных алгоритмов и защитного инженерного кода — с Opus. В математике, сложной физике, сопротивлении ложным предпосылкам и логике ограничений получилась ничья; здесь полезнее учитывать цену, интерфейс и стиль ответа. Любой результат нужно проверять как артефакт: парсить JSON, сверять числа и запускать код без ручной очистки.

Воспроизведение и исходные данные#

Сценарий запуска: scripts/opus5_vs_luna_hard_benchmark.py. Полный результат: .tmp/opus5-vs-luna-hard-benchmark-results.json. Независимые повторы: .tmp/opus5-hard-failure-retry.json и .tmp/luna-hard-failure-retry.json. Использовался чистый API-адрес https://cn.crazyrouter.com/v1/chat/completions; параметры задержки находятся только в исходных доказательствах.

Частые вопросы#

Означает ли 17/18, что Opus 5 — абсолютный победитель?#

Нет. Это лидерство в одну задачу на конкретном наборе. Здесь не тестировались изображения, инструменты, сверхдлинный контекст и многошаговые агенты.

Почему ошибочные самотесты считаются провалом алгоритма?#

Потому что требовался полный Python-файл. Если исходный файл падает при импорте, система не может использовать его без ручного ремонта.

Почему задержки нет в итоговом решении?#

Она зависит от модели, шлюза, маршрута, нагрузки и состояния канала. Это важная операционная метрика, но не показатель правильности интеллекта.

Итог#

В тесте с приоритетом проверяемой точности Opus 5 выиграл 17/18 против 16/18 благодаря трём готовым алгоритмам. Luna лучше соблюдала строгий формат. Практический итог — не «вечный чемпион», а воспроизводимое правило маршрутизации.

Проверьте обе модели в Crazyrouter на собственных рабочих запросах

Implementation Guides

Topics

Comparison

Related Posts

Claude Opus 5 и GPT-5.6-SOL: проверка точности — обе модели дали 10 из 10 правильных основных ответовComparison

Claude Opus 5 и GPT-5.6-SOL: проверка точности — обе модели дали 10 из 10 правильных основных ответов

Claude Opus 5 и GPT-5.6-SOL прошли 10 проверяемых задач через единый API Crazyrouter. Обе модели дали 10/10 правильных основных ответов; отдельно проверены скрытые тесты кода, полнота инструкций и строгий JSON.

Jul 29
Claude Opus 5 vs Claude Fable 5: семь задач в реальном API-бенчмарке и рекомендации по production-routingComparison

Claude Opus 5 vs Claude Fable 5: семь задач в реальном API-бенчмарке и рекомендации по production-routing

В одном OpenAI-compatible API, с одинаковыми промптами и параметрами, Claude Opus 5 и Claude Fable 5 сравниваются на задачах по математике, физике, рассуждению с ограничениями, code review, строгому JSON и дизайну экспериментов. Фиксируются delivery rate, content filtering, latency, tokens и результаты повторных запусков.

Jul 25
Gemini 3.5 Flash vs Claude Response-Tier Models: Какую модель выбрать разработчику?Comparison

Gemini 3.5 Flash vs Claude Response-Tier Models: Какую модель выбрать разработчику?

Практическое сравнение Gemini 3.5 Flash с Claude Haiku, Sonnet и Opus-style моделями по метрикам latency, стоимости, кодированию, reasoning и production API routing. Тестирование через cn.crazyrouter.com с рекомендациями по выбору модели для разных задач.

May 21
Qwen3 VL Flash vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора моделиComparison

Qwen3 VL Flash vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения qwen3-vl-flash и gpt-4.1-nano в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
GPT-4.1 Mini vs Qwen3 VL Plus: бенчмарк Vision API 2026 для практического выбора моделиComparison

GPT-4.1 Mini vs Qwen3 VL Plus: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gpt-4.1-mini и qwen3-vl-plus в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
GPT-4.1 Mini vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора моделиComparison

GPT-4.1 Mini vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gpt-4.1-mini и gpt-4.1-nano в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22