Login
Back to Blog
РусскийComparison

GLM-5.3 против GLM-5.2: сложный тест с реальными API-вызовами

Шесть проверяемых задач: GLM-5.3 выиграл по первой попытке 4/6 против 2/6, но GLM-5.2 победил в скрытых тестах исполняемого кода.

C
Crazyrouter Team
August 14, 2026 / 1 views
Share:
GLM-5.3 против GLM-5.2: сложный тест с реальными API-вызовами

GLM-5.3 против GLM-5.2: сложный тест с реальными API-вызовами#

В первом сравнении GLM-5.3 чаще успевал выдать видимый ответ в пределах фиксированного бюджета. В этом раунде сложность была повышена: экстремальная математика, причинный анализ, ограничения, строгий вложенный JSON, многоэтапная физика и исполняемый оптимизационный код.

По первой попытке результат составил 4/6 для GLM-5.3 и 2/6 для GLM-5.2. Однако единственный оптимизатор, прошедший скрытые тесты, был сгенерирован GLM-5.2.

Матрица первой попытки GLM-5.3 и GLM-5.2

Условия теста#

ПараметрЗначение
Base URLhttps://cn.crazyrouter.com
EndpointPOST /v1/chat/completions
Моделиglm-5.3, glm-5.2
Temperature0.2
Инструменты и веботключены
Оценкатолько первая попытка; повторы нужны для диагностики

Перед тестом GET https://cn.crazyrouter.com/v1/models подтвердил наличие обоих точных ID. Во всех 12 первичных ответах returned model совпал с запрошенной моделью.

Результаты первой попытки#

ЗадачаБюджетGLM-5.3GLM-5.2
Coupon collector с разными вероятностями9 000length, пустой ответlength, пустой ответ
Парадокс Simpson и причинность6 000пройденоlength, пустой ответ
Минимальное ядро UNSAT5 000строгий JSON, пройденоlength, пустой ответ
Вложенный региональный JSON4 000пройденопройдено
Блок, шкив, ослабшая нить и пружина14 000пройденоlength, пустой ответ
Оптимизатор с зависимостями16 000length, пустой ответскрытые тесты пройдены

Экстремальная математика остановила обе модели#

Вероятности четырех купонов равны 1/2, 1/4, 1/8, 1/8. Требовалось вывести два точных результата методом включений-исключений:

text
E[T] = 1339/105 ≈ 12.752380952
P(T<=8) = 46179/131072 ≈ 0.352317810

Обе модели израсходовали 9 000 reasoning tokens и не вернули видимый текст. Повтор GLM-5.3 с 20k снова дал пустое тело; запрос GLM-5.2 с 20k превысил таймаут чтения 420 секунд.

Следовательно, увеличение max_tokens само по себе не гарантирует результат. Нужно одновременно проверять finish reason, длину видимого ответа и таймаут.

Где GLM-5.3 оказался сильнее#

В задаче Simpson модель правильно восстановила направление внутри слоев и после стандартизации:

text
Малые камни: A 81/87 > B 234/270
Крупные камни: A 192/263 > B 55/80
Общий итог: A 273/350 < B 289/350
Стандартизация 50/50: A=0.8305, B=0.7771

GLM-5.3 также отметил, что стандартизация не доказывает причинность без рандомизации или достаточного контроля смешения, positivity и оценки неопределенности.

В задаче минимального ядра модель вернула чистый JSON с [1,2,3] и верно доказала конфликт позиций C и D. В многоэтапной физике были получены все контрольные значения: a≈0.847, v1≈1.59, v2≈1.18, x≈0.0835.

Где победил GLM-5.2#

Требовалось реализовать optimize_release_plan с транзитивными зависимостями, дневными ограничениями, максимизацией value, минимизацией risk, лексикографическим tie-break, ошибочными ссылками и циклами.

Файл GLM-5.2 прошел внешний набор скрытых тестов без ручных исправлений. GLM-5.3 не выдал текст при 16k. При 24k он сгенерировал код, но выбрал план стоимостью 24 вместо оптимума 29.

Это показывает, почему сгенерированный код необходимо запускать. Красивое объяснение и большой файл не заменяют тесты.

Пример запроса#

python
import os, requests

r = requests.post(
    "https://cn.crazyrouter.com/v1/chat/completions",
    headers={"Authorization": f"Bearer {os.environ['CRAZYROUTER_API_KEY']}"},
    json={"model": "glm-5.3", "messages": [{"role": "user", "content": "Ваша приемочная задача"}], "temperature": 0.2, "max_tokens": 6000},
    timeout=600,
)
choice = r.json()["choices"][0]
assert choice["finish_reason"] == "stop"
assert choice["message"]["content"].strip()

Практические рекомендации#

  1. Для причинного анализа, ограничений и многоэтапных выводов в этом тесте надежнее GLM-5.3.
  2. Для генерации алгоритмов стоит сохранять GLM-5.2 в пуле и запускать одинаковые тесты.
  3. HTTP 200 с пустым content должен считаться бизнес-ошибкой.
  4. JSON необходимо разбирать и проверять по schema.
  5. Успех первой попытки и успех после повторов должны быть разными метриками.

Итог#

GLM-5.3 выиграл по охвату первой попытки — 4/6 против 2/6. GLM-5.2 дал лучший исполняемый алгоритм. Обоснованная производственная стратегия — маршрутизация по типу задачи с обязательной проверкой, а не автоматическая замена старой версии.

Запустить обе модели через OpenAI-compatible API Crazyrouter

Implementation Guides

Topics

Comparison

Related Posts

"Kimi K3 против GPT-5.6-SOL: жёсткое тестирование по математике, физике и программированию"Comparison

"Kimi K3 против GPT-5.6-SOL: жёсткое тестирование по математике, физике и программированию"

"В рамках одного OpenAI-compatible API и одного и того же промпта проведено сравнение kimi-k3 и gpt-5.6-sol на задачах по времени остановки режима, задаче по физике с моментом инерции на шкиве и задаче по программированию с зависимыми замыканиями; зафиксированы ко

Jul 18
Claude Opus 5 vs Claude Fable 5: семь задач в реальном API-бенчмарке и рекомендации по production-routingComparison

Claude Opus 5 vs Claude Fable 5: семь задач в реальном API-бенчмарке и рекомендации по production-routing

В одном OpenAI-compatible API, с одинаковыми промптами и параметрами, Claude Opus 5 и Claude Fable 5 сравниваются на задачах по математике, физике, рассуждению с ограничениями, code review, строгому JSON и дизайну экспериментов. Фиксируются delivery rate, content filtering, latency, tokens и результаты повторных запусков.

Jul 25
Claude Opus 5 против GPT-5.6 Luna: 18 проверяемых задач без рейтинга скоростиComparison

Claude Opus 5 против GPT-5.6 Luna: 18 проверяемых задач без рейтинга скорости

Сравнение Claude Opus 5 и GPT-5.6 Luna с приоритетом проверяемой точности: математика, физика, алгоритмы, ложные предпосылки, ограничения и инструкции.

Jul 30
Gemini 2.5 Flash vs Qwen3 VL Flash: бенчмарк Vision API 2026 для практического выбора моделиComparison

Gemini 2.5 Flash vs Qwen3 VL Flash: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gemini-2.5-flash и qwen3-vl-flash в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
Gemini 2.5 Flash vs Gemini 2.5 Flash Lite: бенчмарк Vision API 2026 для практического выбора моделиComparison

Gemini 2.5 Flash vs Gemini 2.5 Flash Lite: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gemini-2.5-flash и gemini-2.5-flash-lite в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
Gemini 2.5 Flash vs Qwen3 VL Plus: бенчмарк Vision API 2026 для практического выбора моделиComparison

Gemini 2.5 Flash vs Qwen3 VL Plus: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gemini-2.5-flash и qwen3-vl-plus в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22