GLM-5.2 vs Claude Fable 5: presupuesto de salida, reasoning_tokens y discount 0.8
Comparación práctica con la API compatible con OpenAI de Crazyrouter: glm-5.2 y claude-fable-5 en matemáticas, física y una animación Canvas, con una nota sobre el discount 0.8 actual de glm-5.2.

GLM-5.2 vs Claude Fable 5: presupuesto de salida, reasoning_tokens y discount 0.8#
Este no es un ranking genérico de modelos. En esta prueba real de API, GLM-5.2 resolvió las tareas de razonamiento cuando se aumentó el presupuesto de salida, pero con límites bajos podía devolver HTTP 200 sin contenido visible. Claude Fable 5 fue más estable con presupuestos bajos y más fiable en la tarea de HTML largo.

Por qué importa esta prueba#
La prueba usó la API compatible con OpenAI de Crazyrouter en lugar de una interfaz de chat. Eso importa porque el resultado no se evaluó solo por la calidad de la prosa. Cada respuesta se comprobó con metadatos operativos:
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
Los campos importantes fueron max_tokens, completion_tokens, reasoning_tokens, finish_reason, la longitud del contenido visible, si el HTML generado estaba cerrado y si la animación realmente se movía en un navegador.
Diseño de la prueba#
El benchmark mezcló deliberadamente tres tipos de tareas:
| Tarea | Propósito | Resultado de referencia |
|---|---|---|
MATH-003 | Razonamiento de expectativa basado en estados | Lanzamientos esperados hasta HH = 6 |
PHYS-003 | Conservación de momento más balance de energía | V = 3.0 m/s, x ≈ 0.148 m |
CODE-003-ANIM | Generación de un artefacto ejecutable largo | HTML completo de animación Canvas 800x500 |
Las dos primeras tareas midieron razonamiento. La tercera midió si un modelo puede producir un artefacto completo, no solo un bloque de código parcial convincente.
Resultados observados#
| Tarea | glm-5.2 | claude-fable-5 |
|---|---|---|
| Matemáticas, presupuesto original | finish_reason=length, completion_tokens=1601, reasoning_tokens=1600, cuerpo visible vacío | finish_reason=stop, completo y correcto |
| Matemáticas, nueva prueba | Correcto después de max_tokens=3200 | No hizo falta repetir la prueba |
| Física, presupuesto original | finish_reason=length, cuerpo visible vacío | Completo y correcto |
| Física, nueva prueba | Correcto después de max_tokens=8000 | No hizo falta repetir la prueba |
| Animación, presupuesto original | HTML visible vacío con max_tokens=3200 | HTML parcial, truncado |
| Animación, nueva prueba | Todavía truncado con max_tokens=8000 | HTML completo; validación en navegador superada |
La observación más importante es que GLM-5.2 no estaba fallando en el razonamiento en sí. En las tareas de matemáticas y física, produjo respuestas correctas después de aumentar el presupuesto de salida. El problema estaba en la visibilidad y la finalización: una solicitud podía devolver HTTP 200 mientras el contenido visible para el usuario estaba vacío o incompleto.
Para la animación Canvas larga, la diferencia fue más marcada. GLM-5.2 produjo un fragmento HTML visible con max_tokens=8000, pero se detuvo dentro de JavaScript y no cerró el archivo. Claude Fable 5 completó el HTML con max_tokens=8000; la validación en navegador mostró que no había errores de consola, un canvas de 800x500, controles, un deslizador de velocidad y changedPixels=55090 después de 700 ms.
Lectura de coste-beneficio#
En el momento de escribir, la pricing API de Crazyrouter lista glm-5.2 con discount: 0.8. Eso la vuelve muy interesante en coste si tu aplicación puede asignar más presupuesto de salida y registrar reasoning_tokens correctamente.
Este es el tradeoff práctico:
| Carga de trabajo | Mejor ajuste según esta prueba |
|---|---|
| Razonamiento corto con suficiente presupuesto de salida | GLM-5.2 puede ser una opción rentable |
| Respuestas de razonamiento con bajo presupuesto | Claude Fable 5 fue más estable |
| Generación de código largo en un solo archivo | Claude Fable 5 fue más fuerte en esta ejecución |
| Evaluaciones por lotes donde se registran metadatos | GLM-5.2 se vuelve más fácil de operar de forma segura |
No trates el multiplicador 0.8 como un precio universal permanente. Es una instantánea de datos de precios de Crazyrouter en el momento de publicación y debe volver a comprobarse antes de un despliegue grande.
Notas de integración#
Solicitud mínima:
curl https://cn.crazyrouter.com/v1/chat/completions \
-H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Solve the HH expected-flips problem with state equations."
}
],
"temperature": 0.2,
"max_tokens": 3200
}'
Para comparar Claude Fable 5, conserva el mismo payload y cambia solo el modelo:
{
"model": "claude-fable-5"
}
Para evaluaciones con estilo de producción, registra esta estructura en cada solicitud:
{
"model": "glm-5.2",
"max_tokens": 3200,
"finish_reason": "length",
"completion_tokens": 3200,
"reasoning_tokens": 3178,
"visible_content_chars": 0,
"html_closed": false,
"browser_validation": "not_run_incomplete_html"
}
Los endpoints de API deben mantenerse limpios. No añadas parámetros UTM a https://cn.crazyrouter.com/v1. Usa tracking solo en enlaces de artículo o registro orientados a personas.
Puedes ejecutar la misma solicitud compatible con OpenAI en Crazyrouter y comparar los modelos con tus propios prompts.
FAQ#
¿GLM-5.2 falló en las tareas de razonamiento?#
No. En esta ejecución, GLM-5.2 resolvió la tarea de matemáticas después de max_tokens=3200 y la tarea de física después de max_tokens=8000. El problema fue que los presupuestos más bajos se consumieron en su mayoría en tokens de razonamiento antes de que apareciera contenido visible.
¿Por qué no contar HTTP 200 como éxito?#
Porque HTTP 200 solo significa que la llamada a la API devolvió una respuesta. Una respuesta de benchmark todavía puede ser inutilizable si finish_reason=length, el contenido visible está vacío o el código generado está incompleto.
¿Por qué se incluyó la tarea de animación?#
La generación de código largo expone un modo de fallo diferente. Un modelo puede escribir una primera mitad convincente de un archivo y aun así fallar si el HTML o JavaScript queda cortado.
¿Sigue valiendo la pena probar GLM-5.2?#
Sí. El multiplicador de descuento actual 0.8 lo hace atractivo para cargas de trabajo donde puedes asignar suficiente presupuesto de salida y monitorizar los metadatos de respuesta.
¿Qué debería registrarse en futuras comparaciones?#
Como mínimo: max_tokens, completion_tokens, reasoning_tokens, finish_reason, longitud de la salida visible, completitud del artefacto y validación en tiempo de ejecución.
Final verdict#
La conclusión práctica: GLM-5.2 puede ser muy rentable y razonar bien, pero necesita control estricto de salida. Claude Fable 5 fue más seguro para respuestas compactas y para entregar un HTML completo.





