GLM-5.2 vs Claude Fable 5: orçamento de saída, reasoning_tokens e discount 0.8
Teste prático via API compatível com OpenAI da Crazyrouter, comparando glm-5.2 e claude-fable-5 em matemática, física e uma animação Canvas, com nota sobre o discount 0.8 atual do glm-5.2.

GLM-5.2 vs Claude Fable 5: orçamento de saída, reasoning_tokens e discount 0.8#
Este texto não é um ranking genérico de modelos. No teste real via API, o GLM-5.2 resolveu as tarefas de raciocínio depois que aumentamos o orçamento de saída, mas, com limites baixos, podia retornar HTTP 200 sem conteúdo visível. O Claude Fable 5 foi mais estável em orçamentos menores e melhor na entrega de um HTML longo e executável.

Por que este teste importa#
O teste usou a API compatível com OpenAI da Crazyrouter, e não uma interface de chat. Isso importa porque o resultado não foi avaliado apenas pela qualidade do texto. Cada resposta foi verificada com metadados operacionais:
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
Os campos importantes foram max_tokens, completion_tokens, reasoning_tokens, finish_reason, tamanho do conteúdo visível, se o HTML gerado foi fechado e se a animação realmente se movia no navegador.
Como o teste foi desenhado#
O benchmark combinou deliberadamente três tipos de tarefa:
| Tarefa | Objetivo | Resultado de referência |
|---|---|---|
MATH-003 | Raciocínio de expectativa baseado em estados | Lançamentos esperados até HH = 6 |
PHYS-003 | Conservação de momento mais balanço de energia | V = 3.0 m/s, x ≈ 0.148 m |
CODE-003-ANIM | Geração de artefato longo e executável | HTML completo de animação Canvas 800x500 |
As duas primeiras tarefas mediram raciocínio. A terceira mediu se um modelo consegue produzir um artefato completo, não apenas um bloco de código parcial convincente.
Resultados observados#
| Tarefa | glm-5.2 | claude-fable-5 |
|---|---|---|
| Matemática, orçamento original | finish_reason=length, completion_tokens=1601, reasoning_tokens=1600, corpo visível vazio | finish_reason=stop, completo e correto |
| Matemática, novo teste | Correto após max_tokens=3200 | Novo teste não necessário |
| Física, orçamento original | finish_reason=length, corpo visível vazio | Completo e correto |
| Física, novo teste | Correto após max_tokens=8000 | Novo teste não necessário |
| Animação, orçamento original | HTML visível vazio com max_tokens=3200 | HTML parcial, truncado |
| Animação, novo teste | Ainda truncado com max_tokens=8000 | HTML completo; validação no navegador aprovada |
A observação mais importante é que o GLM-5.2 não estava falhando no raciocínio em si. Nas tarefas de matemática e física, ele produziu respostas corretas depois de um orçamento de saída maior. O problema era visibilidade e conclusão: uma requisição podia retornar HTTP 200 enquanto o conteúdo voltado ao usuário estava vazio ou incompleto.
Para a animação longa em Canvas, a diferença foi mais clara. O GLM-5.2 produziu um fragmento HTML visível com max_tokens=8000, mas parou dentro do JavaScript e não fechou o arquivo. O Claude Fable 5 completou o HTML com max_tokens=8000; a validação no navegador não mostrou erros no console, exibiu um canvas 800x500, controles, um controle deslizante de velocidade e changedPixels=55090 após 700 ms.
Leitura de custo-benefício#
No momento da publicação, a pricing API da Crazyrouter retorna discount: 0.8 para glm-5.2. Isso torna o modelo bem competitivo em custo quando sua aplicação consegue monitorar reasoning_tokens, finish_reason e ajustar max_tokens corretamente.
Este é o trade-off prático:
| Carga de trabalho | Melhor encaixe neste teste |
|---|---|
| Raciocínio curto com orçamento de saída suficiente | GLM-5.2 pode ser uma opção eficiente em custo |
| Respostas de raciocínio com orçamento baixo | Claude Fable 5 foi mais estável |
| Geração de código longo em arquivo único | Claude Fable 5 foi mais forte nesta execução |
| Avaliações em lote com metadados registrados | GLM-5.2 fica mais fácil de operar com segurança |
Não trate o multiplicador 0.8 como um preço universal permanente. Ele é um snapshot dos dados de preço da Crazyrouter no momento da publicação e deve ser verificado novamente antes de uma implantação grande.
Notas de integração#
Requisição mínima:
curl https://cn.crazyrouter.com/v1/chat/completions \
-H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Solve the HH expected-flips problem with state equations."
}
],
"temperature": 0.2,
"max_tokens": 3200
}'
Para comparar com Claude Fable 5, mantenha o mesmo payload e altere apenas o modelo:
{
"model": "claude-fable-5"
}
Para avaliações em estilo de produção, registre este formato para cada requisição:
{
"model": "glm-5.2",
"max_tokens": 3200,
"finish_reason": "length",
"completion_tokens": 3200,
"reasoning_tokens": 3178,
"visible_content_chars": 0,
"html_closed": false,
"browser_validation": "not_run_incomplete_html"
}
Os endpoints de API devem permanecer limpos. Não adicione parâmetros UTM a https://cn.crazyrouter.com/v1. Use rastreamento apenas em links de artigo ou cadastro voltados a pessoas.
Você pode rodar a mesma chamada compatível com OpenAI na Crazyrouter e comparar os modelos nos seus próprios prompts.
FAQ#
O GLM-5.2 falhou nas tarefas de raciocínio?#
Não. Nesta execução, o GLM-5.2 resolveu a tarefa de matemática após max_tokens=3200 e a tarefa de física após max_tokens=8000. O problema foi que orçamentos menores eram consumidos principalmente por tokens de raciocínio antes que o conteúdo visível aparecesse.
Por que não considerar HTTP 200 como sucesso?#
Porque HTTP 200 significa apenas que a chamada de API retornou. Uma resposta de benchmark ainda pode ser inutilizável se finish_reason=length, se o conteúdo visível estiver vazio ou se o código gerado estiver incompleto.
Por que a tarefa de animação foi incluída?#
A geração de código longo expõe um modo de falha diferente. Um modelo pode escrever uma primeira metade convincente de um arquivo e ainda assim falhar se o HTML ou o JavaScript for interrompido.
Ainda vale a pena testar o GLM-5.2?#
Sim. O multiplicador de desconto atual 0.8 o torna atraente para cargas de trabalho em que você consegue alocar orçamento de saída suficiente e monitorar os metadados da resposta.
O que deve ser registrado em comparações futuras?#
No mínimo: max_tokens, completion_tokens, reasoning_tokens, finish_reason, tamanho da saída visível, completude do artefato e validação em tempo de execução.
Veredito final#
Conclusão prática: GLM-5.2 é atraente em custo e pode raciocinar bem, mas exige controle de orçamento de saída. Claude Fable 5 foi mais previsível para respostas curtas e para gerar um HTML completo.





