Voltar ao blog
PortuguêsComparison

mimo-v2.6-pro vs gpt-6-astra: pelicano de bicicleta, caixa de doces e mais 6 provas divertidas — e um caso flagrado de "emburrecimento" pelo caminho da API

8 provas divertidas (SVG do pelicano, falsa crença da caixa de doces, contagem de letras, acróstico e mais), 3 execuções cada, no mimo-v2.6-pro da Xiaomi e no gpt-6-astra. 7 de 8 empataram. No SVG do pelicano o gpt fez 3/3, o mimo 2/3 com uma saída vazia. Também flagramos a rota padrão do gpt-6-astra injetando ~4.100 tokens por requisição. SVGs originais e logs incluídos.

C
Crazyrouter Team
September 22, 2026 / 0 visualizações
Compartilhar:
mimo-v2.6-pro vs gpt-6-astra: pelicano de bicicleta, caixa de doces e mais 6 provas divertidas — e um caso flagrado de "emburrecimento" pelo caminho da API

Primeiro o veredito; depois, por que o veredito precisa de um desconto.

Resumo#

  • 8 provas divertidas, 3 execuções cada, 48 chamadas avaliadas: mimo-v2.6-pro 23/24, gpt-6-astra 24/24.
  • 7 "pegadinhas clássicas" (caixa de doces / teoria da mente, contar os r, 9.11 vs 9.9, travessia de rio degenerada, irmãs da Alice, acróstico chinês, frase que conta as próprias palavras) foram respondidas corretamente todas as vezes pelos dois modelos. Essas provas já não separam os flagships de 2026.
  • A única diferença foi o SVG do pelicano andando de bicicleta: o gpt-6-astra desenhou 3/3; o mimo 2/3, com uma execução que pensou por 331 segundos, queimou todos os 16.000 tokens em raciocínio e devolveu uma string vazia. A diferença é de estabilidade, não de teto: o melhor desenho do mimo está no nível do gpt.
  • Custo real cobrado: 28 chamadas do gpt-6-astra US0,261,28domimoUS 0,261**, 28 do mimo **US 0,028 — 9,3×. Uma boa parte disso não é preço de modelo; veja o próximo ponto.
  • Aviso: a rota padrão que atendeu o gpt-6-astra injeta cerca de 4.100 tokens de prefixo oculto em cada requisição (um simples "hi" mostrou prompt_tokens=4121), e sua diversidade de amostragem é anormalmente baixa. Todo número de gpt-6-astra aqui descreve "o gpt-6-astra alcançado por esse caminho em 22/09/2026", não a API nativa da OpenAI.

Por que o aviso vem primeiro: o que você testa por uma API nem sempre é o modelo em si#

Antes de comparar qualquer coisa, inspecionamos o roteamento das duas linhas. A maioria dos benchmarks pula essa etapa; é ela que decide quanto os números valem.

mimo-v2.6-progpt-6-astra
Candidatos de rota1: direto para o api.xiaomimimo.com oficial da Xiaomi18 candidatos; a linha terceirizada de maior prioridade venceu naquele dia
Formato do id da respostaUUIDresp_… (upstream é a Responses API, traduzida de volta para chat completions)
prompt_tokens de um "hi" seco84121 (cached_tokens=3968)
Injeção fixa por requisição0~4.100 tokens, idênticos nas 28 chamadas
reasoning_tokens retornadoem toda chamadaem 3 das 8 provas; 5 vieram vazias
Custo real de uma resposta de uma palavraUS$ 0,00002US$ 0,014

Ou seja: toda requisição ao gpt-6-astra nessa linha carrega um system prompt invisível. Isso afeta três coisas: o comportamento do modelo pode ser moldado por um prompt que você não vê; cada chamada paga cerca de US$ 0,013 de custo fixo de entrada; e os campos de usage só são repassados parcialmente. A linha do mimo é uma conexão direta oficial, com zero injeção e usage completo.

Essa é uma forma concreta do que chamam de "emburrecimento pela API": o modelo não piorou, mas o que você chama está atrás de um invólucro entre você e a API oficial. Qualquer gateway, agregador ou linha revendida pode ter isso — inclusive a nossa própria rota padrão. Há exatamente uma forma de verificar: mande "hi" e veja se prompt_tokens tem um só dígito.

Mais duas ressalvas gerais: 3 execuções por prova é uma amostra pequena e só diz se um caminho conseguiu fazer a tarefa de forma confiável naquele dia; as duas famílias usam tokenizadores diferentes, então contagens de tokens não são divisíveis entre famílias — comparamos apenas acerto, caracteres de saída, dólares cobrados e segundos.

Modelos e preços#

ModeloEntrada US$/MSaída US$/MCobrado por 28 chamadas
mimo-v2.6-pro (Xiaomi, contexto de 1M, modelo de raciocínio)0,4350,87US$ 0,028
gpt-6-astra (OpenAI)5,0025,00US$ 0,261

Preços da página de preços da Crazyrouter; valores cobrados vêm do log de uso por token.

Ambiente de teste#

Mesmo endpoint compatível com OpenAI para os dois, sem system prompt, temperatura padrão, sem streaming:

bash
curl https://api.crazyrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.6-pro",
    "messages": [{"role": "user", "content": "Generate an SVG of a pelican riding a bicycle. Output only the SVG code, no explanation, no markdown fences."}],
    "max_tokens": 16000
  }'

Cada chamada registrou id, usage (incluindo reasoning_tokens), finish_reason, tempo de parede e o corpo completo. Os SVGs foram renderizados em PNG de 480px com Playwright para avaliação humana.

As 8 provas e os resultados#

#ProvaO que testamimo-v2.6-progpt-6-astraNotas
1Pelicano andando de bicicleta, em SVGComposição espacial, geração de código, estabilidade em saída longa2/33/3Veja a próxima seção
2Falsa crença da caixa de doces (caixa rotulada "doces" contém lápis; duas perguntas)Raciocínio na perspectiva do outro3/33/3O mimo quebrou a restrição "uma frase cada" com negrito e explicações
3Quantos r em "raspberry cranberry strawberry" (resposta 9)Armadilha de tokenizador3/33/3Os dois gastaram tokens de raciocínio
4Qual é maior, 9.11 ou 9.9Armadilha numérica clássica3/33/3O gpt respondeu sem raciocinar, 7 tokens
5Travessia de rio só com fazendeiro e repolho (resposta 1)Cai no modelo lobo/cabra/repolho?3/33/3Nenhum caiu
6Alice tem 4 irmãos e 2 irmãs; quantas irmãs tem o irmão dela (resposta 3)Contagem que inclui a si mesma3/33/3
7Acróstico chinês: quatro versos de 5 caracteres começando com 路/由/更/快, sem pontuaçãoRestrições rígidas em chinês3/33/3O gpt escreveu quase o mesmo poema 3 vezes; o mimo, três diferentes
8Uma frase em inglês que declara corretamente o próprio número de palavrasConsistência autorreferente3/33/3O gpt repetiu o molde "exactly seven … words" 3 vezes

Algumas amostras.

Acróstico, mimo, três execuções:

text
路远山川阔 / 由来天地长 / 更逢春雨后 / 快马踏花香
路途远且长 / 由山入云间 / 更上一重岭 / 快马踏清风
路远行人稀 / 由来秋意深 / 更向孤村去 / 快马踏寒林

Acróstico, gpt-6-astra, três execuções:

text
路远逐晨光 / 由心向远方 / 更登千仞岭 / 快意任翱翔
路远春风近 / 由心逐晓光 / 更登千仞岭 / 快意览朝阳
路远春风近 / 由心逐晓光 / 更登千里岫 / 快意向朝阳

Frase que se conta — mimo: "This sentence has five words." (5, verdadeira); gpt: "This sentence contains exactly seven English words." (7, verdadeira).

O pelicano: a única prova que os separou#

É o clássico de Simon Willison: pedir ao modelo que escreva o código SVG de "um pelicano andando de bicicleta" sem ver imagem nenhuma. Testa se o modelo consegue expressar a relação espacial entre dois objetos complexos em coordenadas.

mimo-v2.6-pro, três execuções

Execuçãomimo-v2.6-pro
#043 s, 2.893 tokens de saída (111 de raciocínio). O pelicano fica em pé sobre o quadro em vez de sentar no selim; a asa mal alcança o guidão; o bico tem a bolsa laranja. Aceitável
#1331 s, todos os 16.000 tokens queimados em raciocínio, conteúdo vazio, finish_reason=length. O raciocínio tem 41.656 caracteres planejando coordenadas e ordem de camadas ("a asa fica na frente ou atrás do guidão?") e nunca começou a emitir o SVG
#2159 s, 8.870 tokens (5.147 de raciocínio). Nuvens, linhas de velocidade, penas azuis na asa, postura sentada correta — o melhor desenho do mimo

gpt-6-astra, três execuções

Execuçãogpt-6-astra
#088 s, 2.817 tokens. Cena de praia, pelicano no selim, asa no guidão, pernas nos pedais — a composição mais completa
#196 s, 2.970 tokens. Mesma composição, mais um cachecol vermelho
#282 s, 2.616 tokens. Mesma composição, quadro turquesa

Arquivos SVG originais (saída do modelo sem modificação): mimo #0 · mimo #2 · gpt-6-astra #0 · gpt-6-astra #1 · gpt-6-astra #2

Três observações:

  1. Os três desenhos do gpt-6-astra são um único molde com cores diferentes — mesma praia, nuvens, formato de bico e cachecol. Somado aos acrósticos e às frases autorreferentes quase idênticos, a diversidade de amostragem dessa linha é próxima de zero, como se a temperatura estivesse travada pelo invólucro. Se isso é o caminho ou o modelo, esta rodada não consegue separar.
  2. O mimo varia muito entre execuções: no melhor caso empata com o gpt, no pior a chamada inteira se perde. A execução perdida custou US$ 0,0139 — a chamada mais cara do mimo na rodada — e quem chamou recebeu uma string vazia.
  3. Tempo de parede: o gpt ficou estável em 82–96 s; o mimo foi de 43 a 331 s.

Latência#

Provamimo-v2.6-progpt-6-astra
Média das 4 provas de resposta curta3,9 s4,8 s
Caixa de doces8,4 s16,3 s
Acróstico13,7 s9,2 s
Frase que se conta9,9 s4,6 s
SVG do pelicano177,8 s88,6 s

O mimo é um pouco mais rápido em respostas curtas; o gpt é mais estável em saídas longas.

Recomendações para produção#

Se você integrar o mimo-v2.6-pro — ou qualquer modelo de raciocínio — trate o caso "o raciocínio comeu o orçamento":

python
resp = client.chat.completions.create(model="mimo-v2.6-pro", messages=msgs, max_tokens=8000)
choice = resp.choices[0]
if choice.finish_reason == "length" and not choice.message.content:
    # o pensamento esgotou o orçamento e o corpo veio vazio:
    # tente de novo com max_tokens menor ou outro modelo; nunca persista a string vazia como resultado
    ...

Um max_tokens maior não é automaticamente mais seguro: o descontrole do mimo aconteceu justamente porque um orçamento de 16.000 tokens deixou o modelo planejar sem parar. Para tarefas determinísticas, 4.000–8.000 costuma ser mais estável.

Antes de integrar qualquer flagship estrangeiro, rode uma prova "hi": confira se prompt_tokens tem um dígito, se o id está no formato oficial e se o usage está completo. Se qualquer um dos três falhar, há uma camada no meio, e tanto seus benchmarks quanto sua estimativa de custo precisam ser refeitos. O inspetor de roteamento da Crazyrouter mostra em qual canal um modelo cai no momento e quantos candidatos ele tem; depois de criar uma conta, a página de modelos lista endpoints e preços de cada modelo.

Qual usar para cada tarefa#

  • Código ou saída estruturada que precisa vir sempre: gpt-6-astra 3/3 vs mimo 2/3 nesta rodada — vantagem clara de estabilidade.
  • Perguntas e respostas curtas em alto volume, sensível a custo: mesma taxa de acerto, mimo 9× mais barato e um pouco mais rápido.
  • Escrita com restrições em chinês: os dois cumpriram as restrições rígidas; o mimo teve mais variedade.
  • Você precisa de reasoning_tokens para controlar custo: o mimo informa sempre; a linha do gpt-6-astra, só às vezes.

FAQ#

P: Por que provas divertidas em vez de um benchmark padrão? Benchmarks padrão muito provavelmente vazaram para os dados de treino. Provas divertidas — especialmente o SVG do pelicano — obrigam o modelo a codificar relações espaciais em coordenadas na hora; não há o que decorar. O lado ruim é a avaliação subjetiva, por isso todos os arquivos originais estão publicados.

P: A saída vazia do mimo foi problema da plataforma? Não. finish_reason=length, reasoning_tokens=16003 e content="" vieram direto do upstream, numa linha oficial direta com zero injeção. É um risco conhecido de modelos de raciocínio em tarefas abertas de saída longa.

P: O que são os 4.100 tokens injetados no gpt-6-astra? Um prefixo adicionado por uma camada intermediária: 3.968 tokens com acerto de cache, idênticos nas 28 chamadas. Nunca vimos o conteúdo (não vem na resposta); só inferimos pelo prompt_tokens. Para descartar a influência dele é preciso repetir com a rota fixada no canal oficial da OpenAI — fica para a próxima rodada.

P: Quanto da diferença de 9,3× é a injeção? Cerca de 115K tokens de entrada em 28 chamadas, 111K deles acertos de cache (entrada em cache é cobrada a 10% do preço de entrada) — aproximadamente US0,076,ou29 0,076, ou 29% dos US 0,261. O resto é diferença real de preço de modelo.

P: Por que não há teste multimodal? O mimo não é omnimodal? Esta rodada é só texto. Entrada de imagem e vídeo terá plano próprio.

P: 3 execuções bastam? Não para dizer "quem é mais inteligente". Bastam para revelar sinais de estabilidade como "uma linha responde igual três vezes" e "um modelo perde uma execução em três". As próximas rodadas acrescentam perguntas de contexto longo com premissa falsa em 18,7K tokens (6 execuções cada) e questões de raciocínio pesado (13 execuções cada).

Relacionados#

Veredito final#

Em setembro de 2026, nestes dois caminhos específicos: as provas divertidas não separam os modelos em inteligência; separam em estabilidade (gpt estável, mimo sujeito a descontrole) e em custo (mimo uma ordem de grandeza mais barato). A lição mais útil vem antes das duas: mande "hi" antes de fazer benchmark e confira com quem você está falando de verdade.

Próxima rodada: contexto longo e raciocínio pesado para o mesmo par; repetição do gpt-6-astra fixada no canal oficial para testar o "três vezes igual"; depois, conforme o plano, mimo-v2.6-flash vs claude-sonnet-4-6 e kimi-k2.7-code vs claude-opus-5.

Implementation Guides

Topics

Comparison

Artigos relacionados

Por que escolher a Crazyrouter em vez do OpenRouter? Três diferenças que realmente importamComparison

Por que escolher a Crazyrouter em vez do OpenRouter? Três diferenças que realmente importam

Os mesmos modelos Claude, GPT e Gemini, mas 35–45% abaixo do preço de tabela e sem taxa de recarga; sem níveis de limite de requisições, RPM personalizado sob demanda; e uma pessoa de verdade acompanhando cada erro até a solução. Comparativo com preços concretos.

Sep 17
GPT-5.6-sol vs GPT-5.6-terra em teste prático: quanto desempenho justifica uma diferença de preço de 2x?Comparison

GPT-5.6-sol vs GPT-5.6-terra em teste prático: quanto desempenho justifica uma diferença de preço de 2x?

Teste real de preço e desempenho com a OpenAI-compatible API da Crazyrouter: quatro tarefas de máquina de estados probabilística, física em múltiplas etapas, agregação de logs e roteamento estável comparam gpt-5.6-sol e gpt-5.6-terra quanto à correção, tempo de resposta, completion tokens, reasoning tokens, testes locais de código e custo estimado por requisição com base nos preços públicos.

Jul 13
GLM-5.2 vs Claude Fable 5: orçamento de saída, reasoning_tokens e discount 0.8Comparison

GLM-5.2 vs Claude Fable 5: orçamento de saída, reasoning_tokens e discount 0.8

Teste prático via API compatível com OpenAI da Crazyrouter, comparando glm-5.2 e claude-fable-5 em matemática, física e uma animação Canvas, com nota sobre o discount 0.8 atual do glm-5.2.

Jul 6
Kimi K3 vs GPT-5.6-SOL: teste prático de alta dificuldade em matemática, física e programaçãoComparison

Kimi K3 vs GPT-5.6-SOL: teste prático de alta dificuldade em matemática, física e programação

Usando a mesma API compatível com OpenAI e os mesmos prompts, este teste compara kimi-k3 e gpt-5.6-sol em tempo de parada por padrão, um problema de física sobre momento de inércia com polia e uma tarefa de programação com closure dependente, registrando acurácia, truncamento, latência e validação local do código.

Jul 18
Kimi K3 versus Claude Opus 4.8: testes de matemática, física e programação em nível de pós-graduaçãoComparison

Kimi K3 versus Claude Opus 4.8: testes de matemática, física e programação em nível de pós-graduação

Na mesma API compatível com OpenAI da Crazyrouter, comparamos kimi-k3 e claude-opus-4-8 em tempo de primeira passagem de cadeia de Markov em nível de pós-graduação, resposta em frequência de osciladores acoplados com amortecimento e algoritmo de agendamento por dependências, registrando integridade da saída, correção, latência e resultados de validação independente.

Jul 19
Como Acessar o GPT-5 e GPT-5.2 via API - Guia Completo para DesenvolvedoresTutorial

Como Acessar o GPT-5 e GPT-5.2 via API - Guia Completo para Desenvolvedores

Aprenda a acessar os modelos mais recentes da OpenAI — GPT-5, GPT-5.2 e o3-pro — por meio de uma API unificada. Guia passo a passo com exemplos em Python, Node.js e curl.

Jan 23