GLM-5.2 против Claude Fable 5: лимит вывода, reasoning_tokens и коэффициент discount 0.8
Практический тест через OpenAI-compatible API Crazyrouter: glm-5.2 и claude-fable-5 на математике, физике и длинной Canvas-анимации, с учетом текущего discount 0.8 для glm-5.2.

GLM-5.2 против Claude Fable 5: лимит вывода, reasoning_tokens и коэффициент discount 0.8#
Это не универсальный рейтинг моделей. В этом тесте GLM-5.2 справлялась с задачами на рассуждение после увеличения бюджета вывода, но при низком max_tokens видимая часть ответа могла быть пустой. Claude Fable 5 чаще завершала ответ компактно и лучше справилась с длинным HTML-артефактом.

Почему этот тест важен#
В тесте использовался OpenAI-compatible API Crazyrouter, а не чат-интерфейс. Это важно, потому что результат оценивался не только по качеству текста. Каждый ответ проверялся по операционным метаданным:
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
Ключевыми полями были max_tokens, completion_tokens, reasoning_tokens, finish_reason, длина видимого содержимого, то, был ли сгенерированный HTML закрыт, и действительно ли анимация двигалась в браузере.
Что проверялось#
Бенчмарк намеренно смешивал три типа задач:
| Задача | Цель | Эталонный результат |
|---|---|---|
MATH-003 | Рассуждение с математическим ожиданием по состояниям | Ожидаемое число бросков до HH = 6 |
PHYS-003 | Учет импульса и энергии | V = 3.0 m/s, x ≈ 0.148 m |
CODE-003-ANIM | Генерация длинного запускаемого артефакта | Полный HTML с Canvas-анимацией 800x500 |
Первые две задачи измеряли качество рассуждения. Третья задача проверяла, может ли модель создать полный артефакт, а не просто убедительный частичный блок кода.
Наблюдаемые результаты#
| Задача | glm-5.2 | claude-fable-5 |
|---|---|---|
| Математика, исходный бюджет | finish_reason=length, completion_tokens=1601, reasoning_tokens=1600, видимое тело пустое | finish_reason=stop, полный и правильный ответ |
| Математика, повторный тест | Правильно после max_tokens=3200 | Повторный тест не требовался |
| Физика, исходный бюджет | finish_reason=length, видимое тело пустое | Полный и правильный ответ |
| Физика, повторный тест | Правильно после max_tokens=8000 | Повторный тест не требовался |
| Анимация, исходный бюджет | Пустой видимый HTML при max_tokens=3200 | Частичный HTML, обрезан |
| Анимация, повторный тест | Все еще обрезан при max_tokens=8000 | Полный HTML; браузерная валидация пройдена |
Самое важное наблюдение: GLM-5.2 не проваливала само рассуждение. В задачах по математике и физике она выдавала правильные ответы после увеличения бюджета вывода. Проблема была в видимости и завершенности: запрос мог вернуть HTTP 200, но пользовательское содержимое оказывалось пустым или неполным.
Для длинной Canvas-анимации разница была заметнее. GLM-5.2 сгенерировала видимый HTML-фрагмент при max_tokens=8000, но остановилась внутри JavaScript и не закрыла файл. Claude Fable 5 завершила HTML при max_tokens=8000; браузерная валидация показала отсутствие ошибок в консоли, canvas 800x500, элементы управления, слайдер скорости и changedPixels=55090 через 700 ms.
Стоимость и практическая выгода#
На момент публикации pricing API Crazyrouter возвращает для glm-5.2 значение discount: 0.8. Поэтому модель выглядит очень конкурентной по цене, если в вашей интеграции есть контроль reasoning_tokens, finish_reason и достаточного max_tokens.
Практический компромисс выглядит так:
| Нагрузка | Более подходящий вариант по результатам этого теста |
|---|---|
| Короткие задачи на рассуждение при достаточном бюджете вывода | GLM-5.2 может быть экономически эффективным вариантом |
| Ответы на рассуждение с низким бюджетом | Claude Fable 5 была стабильнее |
| Генерация длинного кода в одном файле | Claude Fable 5 в этом прогоне оказалась сильнее |
| Пакетные оценки с логированием метаданных | GLM-5.2 становится проще безопасно эксплуатировать |
Не следует считать множитель 0.8 постоянной универсальной ценой. Это снимок pricing-данных Crazyrouter на момент публикации, и перед крупным внедрением его нужно проверить заново.
Интеграционные заметки#
Минимальный запрос:
curl https://cn.crazyrouter.com/v1/chat/completions \
-H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Solve the HH expected-flips problem with state equations."
}
],
"temperature": 0.2,
"max_tokens": 3200
}'
Чтобы сравнить Claude Fable 5, оставьте тот же payload и измените только модель:
{
"model": "claude-fable-5"
}
Для production-style оценок логируйте такую структуру для каждого запроса:
{
"model": "glm-5.2",
"max_tokens": 3200,
"finish_reason": "length",
"completion_tokens": 3200,
"reasoning_tokens": 3178,
"visible_content_chars": 0,
"html_closed": false,
"browser_validation": "not_run_incomplete_html"
}
API endpoints должны оставаться чистыми. Не добавляйте UTM-параметры к https://cn.crazyrouter.com/v1. Используйте трекинг только в ссылках статьи или регистрации, обращенных к людям.
Тот же OpenAI-compatible запрос можно запустить через Crazyrouter и проверить обе модели на своих задачах.
FAQ#
Провалила ли GLM-5.2 задачи на рассуждение?#
Нет. В этом прогоне GLM-5.2 решила математическую задачу после max_tokens=3200 и физическую задачу после max_tokens=8000. Проблема была в том, что при меньших бюджетах они в основном расходовались на reasoning tokens до появления видимого содержимого.
Почему не считать HTTP 200 успехом?#
Потому что HTTP 200 означает только то, что API-вызов вернулся. Ответ в бенчмарке все равно может быть непригодным, если finish_reason=length, видимое содержимое пустое или сгенерированный код неполный.
Почему была включена задача с анимацией?#
Длинная генерация кода выявляет другой режим отказа. Модель может написать убедительную первую половину файла и все равно не справиться, если HTML или JavaScript обрезаны.
Стоит ли все еще тестировать GLM-5.2?#
Да. Текущий множитель скидки 0.8 делает ее привлекательной для нагрузок, где можно выделить достаточный бюджет вывода и отслеживать метаданные ответа.
Что нужно фиксировать в будущих сравнениях?#
Как минимум: max_tokens, completion_tokens, reasoning_tokens, finish_reason, длину видимого вывода, полноту артефакта и runtime-валидацию.
Final verdict#
Практический вывод: GLM-5.2 интересна по стоимости и способна решать задачи, но требует внимательного контроля бюджета вывода. Claude Fable 5 оказалась стабильнее для коротких ответов и полного HTML-файла.





