Voltar ao blog
PortuguêsComparison

GLM-5.2 vs Claude Fable 5: orçamento de saída, reasoning_tokens e discount 0.8

Teste prático via API compatível com OpenAI da Crazyrouter, comparando glm-5.2 e claude-fable-5 em matemática, física e uma animação Canvas, com nota sobre o discount 0.8 atual do glm-5.2.

C
Crazyrouter Team
6 de julho de 2026 / 291 visualizações
Compartilhar:
GLM-5.2 vs Claude Fable 5: orçamento de saída, reasoning_tokens e discount 0.8

GLM-5.2 vs Claude Fable 5: orçamento de saída, reasoning_tokens e discount 0.8#

Este texto não é um ranking genérico de modelos. No teste real via API, o GLM-5.2 resolveu as tarefas de raciocínio depois que aumentamos o orçamento de saída, mas, com limites baixos, podia retornar HTTP 200 sem conteúdo visível. O Claude Fable 5 foi mais estável em orçamentos menores e melhor na entrega de um HTML longo e executável.

Benchmark GLM-5.2 vs Claude Fable 5

Por que este teste importa#

O teste usou a API compatível com OpenAI da Crazyrouter, e não uma interface de chat. Isso importa porque o resultado não foi avaliado apenas pela qualidade do texto. Cada resposta foi verificada com metadados operacionais:

text
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06

Os campos importantes foram max_tokens, completion_tokens, reasoning_tokens, finish_reason, tamanho do conteúdo visível, se o HTML gerado foi fechado e se a animação realmente se movia no navegador.

Como o teste foi desenhado#

O benchmark combinou deliberadamente três tipos de tarefa:

TarefaObjetivoResultado de referência
MATH-003Raciocínio de expectativa baseado em estadosLançamentos esperados até HH = 6
PHYS-003Conservação de momento mais balanço de energiaV = 3.0 m/s, x ≈ 0.148 m
CODE-003-ANIMGeração de artefato longo e executávelHTML completo de animação Canvas 800x500

As duas primeiras tarefas mediram raciocínio. A terceira mediu se um modelo consegue produzir um artefato completo, não apenas um bloco de código parcial convincente.

Resultados observados#

Tarefaglm-5.2claude-fable-5
Matemática, orçamento originalfinish_reason=length, completion_tokens=1601, reasoning_tokens=1600, corpo visível vaziofinish_reason=stop, completo e correto
Matemática, novo testeCorreto após max_tokens=3200Novo teste não necessário
Física, orçamento originalfinish_reason=length, corpo visível vazioCompleto e correto
Física, novo testeCorreto após max_tokens=8000Novo teste não necessário
Animação, orçamento originalHTML visível vazio com max_tokens=3200HTML parcial, truncado
Animação, novo testeAinda truncado com max_tokens=8000HTML completo; validação no navegador aprovada

A observação mais importante é que o GLM-5.2 não estava falhando no raciocínio em si. Nas tarefas de matemática e física, ele produziu respostas corretas depois de um orçamento de saída maior. O problema era visibilidade e conclusão: uma requisição podia retornar HTTP 200 enquanto o conteúdo voltado ao usuário estava vazio ou incompleto.

Para a animação longa em Canvas, a diferença foi mais clara. O GLM-5.2 produziu um fragmento HTML visível com max_tokens=8000, mas parou dentro do JavaScript e não fechou o arquivo. O Claude Fable 5 completou o HTML com max_tokens=8000; a validação no navegador não mostrou erros no console, exibiu um canvas 800x500, controles, um controle deslizante de velocidade e changedPixels=55090 após 700 ms.

Leitura de custo-benefício#

No momento da publicação, a pricing API da Crazyrouter retorna discount: 0.8 para glm-5.2. Isso torna o modelo bem competitivo em custo quando sua aplicação consegue monitorar reasoning_tokens, finish_reason e ajustar max_tokens corretamente.

Este é o trade-off prático:

Carga de trabalhoMelhor encaixe neste teste
Raciocínio curto com orçamento de saída suficienteGLM-5.2 pode ser uma opção eficiente em custo
Respostas de raciocínio com orçamento baixoClaude Fable 5 foi mais estável
Geração de código longo em arquivo únicoClaude Fable 5 foi mais forte nesta execução
Avaliações em lote com metadados registradosGLM-5.2 fica mais fácil de operar com segurança

Não trate o multiplicador 0.8 como um preço universal permanente. Ele é um snapshot dos dados de preço da Crazyrouter no momento da publicação e deve ser verificado novamente antes de uma implantação grande.

Notas de integração#

Requisição mínima:

bash
curl https://cn.crazyrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "Solve the HH expected-flips problem with state equations."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 3200
  }'

Para comparar com Claude Fable 5, mantenha o mesmo payload e altere apenas o modelo:

json
{
  "model": "claude-fable-5"
}

Para avaliações em estilo de produção, registre este formato para cada requisição:

json
{
  "model": "glm-5.2",
  "max_tokens": 3200,
  "finish_reason": "length",
  "completion_tokens": 3200,
  "reasoning_tokens": 3178,
  "visible_content_chars": 0,
  "html_closed": false,
  "browser_validation": "not_run_incomplete_html"
}

Os endpoints de API devem permanecer limpos. Não adicione parâmetros UTM a https://cn.crazyrouter.com/v1. Use rastreamento apenas em links de artigo ou cadastro voltados a pessoas.

Você pode rodar a mesma chamada compatível com OpenAI na Crazyrouter e comparar os modelos nos seus próprios prompts.

https://crazyrouter.com/register?utm_source=crazyrouter_blog&utm_medium=article&utm_campaign=glm52_fable5_budget_cost_20260706&utm_content=crazyrouter_blog_glm-52-vs-claude-fable-5-output-budget-cost-pt_20260706__bottom&utm_term=glm-5.2+claude+fable+5+benchmark

FAQ#

O GLM-5.2 falhou nas tarefas de raciocínio?#

Não. Nesta execução, o GLM-5.2 resolveu a tarefa de matemática após max_tokens=3200 e a tarefa de física após max_tokens=8000. O problema foi que orçamentos menores eram consumidos principalmente por tokens de raciocínio antes que o conteúdo visível aparecesse.

Por que não considerar HTTP 200 como sucesso?#

Porque HTTP 200 significa apenas que a chamada de API retornou. Uma resposta de benchmark ainda pode ser inutilizável se finish_reason=length, se o conteúdo visível estiver vazio ou se o código gerado estiver incompleto.

Por que a tarefa de animação foi incluída?#

A geração de código longo expõe um modo de falha diferente. Um modelo pode escrever uma primeira metade convincente de um arquivo e ainda assim falhar se o HTML ou o JavaScript for interrompido.

Ainda vale a pena testar o GLM-5.2?#

Sim. O multiplicador de desconto atual 0.8 o torna atraente para cargas de trabalho em que você consegue alocar orçamento de saída suficiente e monitorar os metadados da resposta.

O que deve ser registrado em comparações futuras?#

No mínimo: max_tokens, completion_tokens, reasoning_tokens, finish_reason, tamanho da saída visível, completude do artefato e validação em tempo de execução.

Veredito final#

Conclusão prática: GLM-5.2 é atraente em custo e pode raciocinar bem, mas exige controle de orçamento de saída. Claude Fable 5 foi mais previsível para respostas curtas e para gerar um HTML completo.

Implementation Guides

Topics

Comparison

Artigos relacionados

Por que escolher a Crazyrouter em vez do OpenRouter? Três diferenças que realmente importamComparison

Por que escolher a Crazyrouter em vez do OpenRouter? Três diferenças que realmente importam

Os mesmos modelos Claude, GPT e Gemini, mas 35–45% abaixo do preço de tabela e sem taxa de recarga; sem níveis de limite de requisições, RPM personalizado sob demanda; e uma pessoa de verdade acompanhando cada erro até a solução. Comparativo com preços concretos.

17 de set.
Em português, o mimo-v2.6-pro não desenha: 8 provas divertidas contra o gpt-6-astra, zero pelicanos em três e uma injeção de 4.100 tokens reveladaComparison

Em português, o mimo-v2.6-pro não desenha: 8 provas divertidas contra o gpt-6-astra, zero pelicanos em três e uma injeção de 4.100 tokens revelada

Rodada em português de 8 provas divertidas (SVG do pelicano, caixa de doces, letra a em "banana abacaxi laranja", 9,11 vs 9,9, acróstico ROTA) no mimo-v2.6-pro e no gpt-6-astra, 3 execuções cada. Nas provas curtas, empate. No pelicano o mimo fez 0/3: pensou 265 s, queimou 16.000 tokens e devolveu vazio; em inglês desenha 3/3. O gpt fez 3/3, mas a rota injeta ~4.100 tokens por chamada.

22 de set.
GPT-5.6-sol vs GPT-5.6-terra em teste prático: quanto desempenho justifica uma diferença de preço de 2x?Comparison

GPT-5.6-sol vs GPT-5.6-terra em teste prático: quanto desempenho justifica uma diferença de preço de 2x?

Teste real de preço e desempenho com a OpenAI-compatible API da Crazyrouter: quatro tarefas de máquina de estados probabilística, física em múltiplas etapas, agregação de logs e roteamento estável comparam gpt-5.6-sol e gpt-5.6-terra quanto à correção, tempo de resposta, completion tokens, reasoning tokens, testes locais de código e custo estimado por requisição com base nos preços públicos.

13 de jul.
Kimi K3 vs GPT-5.6-SOL: teste prático de alta dificuldade em matemática, física e programaçãoComparison

Kimi K3 vs GPT-5.6-SOL: teste prático de alta dificuldade em matemática, física e programação

Usando a mesma API compatível com OpenAI e os mesmos prompts, este teste compara kimi-k3 e gpt-5.6-sol em tempo de parada por padrão, um problema de física sobre momento de inércia com polia e uma tarefa de programação com closure dependente, registrando acurácia, truncamento, latência e validação local do código.

18 de jul.
Kimi K3 versus Claude Opus 4.8: testes de matemática, física e programação em nível de pós-graduaçãoComparison

Kimi K3 versus Claude Opus 4.8: testes de matemática, física e programação em nível de pós-graduação

Na mesma API compatível com OpenAI da Crazyrouter, comparamos kimi-k3 e claude-opus-4-8 em tempo de primeira passagem de cadeia de Markov em nível de pós-graduação, resposta em frequência de osciladores acoplados com amortecimento e algoritmo de agendamento por dependências, registrando integridade da saída, correção, latência e resultados de validação independente.

19 de jul.
Melhor Gateway de API de IA para Desenvolvedores em 2026: 9 Plataformas TestadasComparison

Melhor Gateway de API de IA para Desenvolvedores em 2026: 9 Plataformas Testadas

Testamos 9 gateways de API de IA para cobertura de modelos, preços, suporte multi-modal e experiência do desenvolvedor.

27 de mar.