mimo-v2.6-pro vs gpt-6-astra: pelicano de bicicleta, caixa de doces e mais 6 provas divertidas — e um caso flagrado de "emburrecimento" pelo caminho da API
8 provas divertidas (SVG do pelicano, falsa crença da caixa de doces, contagem de letras, acróstico e mais), 3 execuções cada, no mimo-v2.6-pro da Xiaomi e no gpt-6-astra. 7 de 8 empataram. No SVG do pelicano o gpt fez 3/3, o mimo 2/3 com uma saída vazia. Também flagramos a rota padrão do gpt-6-astra injetando ~4.100 tokens por requisição. SVGs originais e logs incluídos.

Primeiro o veredito; depois, por que o veredito precisa de um desconto.
Resumo#
- 8 provas divertidas, 3 execuções cada, 48 chamadas avaliadas: mimo-v2.6-pro 23/24, gpt-6-astra 24/24.
- 7 "pegadinhas clássicas" (caixa de doces / teoria da mente, contar os r, 9.11 vs 9.9, travessia de rio degenerada, irmãs da Alice, acróstico chinês, frase que conta as próprias palavras) foram respondidas corretamente todas as vezes pelos dois modelos. Essas provas já não separam os flagships de 2026.
- A única diferença foi o SVG do pelicano andando de bicicleta: o gpt-6-astra desenhou 3/3; o mimo 2/3, com uma execução que pensou por 331 segundos, queimou todos os 16.000 tokens em raciocínio e devolveu uma string vazia. A diferença é de estabilidade, não de teto: o melhor desenho do mimo está no nível do gpt.
- Custo real cobrado: 28 chamadas do gpt-6-astra US 0,028 — 9,3×. Uma boa parte disso não é preço de modelo; veja o próximo ponto.
- Aviso: a rota padrão que atendeu o gpt-6-astra injeta cerca de 4.100 tokens de prefixo oculto em cada requisição (um simples "hi" mostrou
prompt_tokens=4121), e sua diversidade de amostragem é anormalmente baixa. Todo número de gpt-6-astra aqui descreve "o gpt-6-astra alcançado por esse caminho em 22/09/2026", não a API nativa da OpenAI.
Por que o aviso vem primeiro: o que você testa por uma API nem sempre é o modelo em si#
Antes de comparar qualquer coisa, inspecionamos o roteamento das duas linhas. A maioria dos benchmarks pula essa etapa; é ela que decide quanto os números valem.
| mimo-v2.6-pro | gpt-6-astra | |
|---|---|---|
| Candidatos de rota | 1: direto para o api.xiaomimimo.com oficial da Xiaomi | 18 candidatos; a linha terceirizada de maior prioridade venceu naquele dia |
| Formato do id da resposta | UUID | resp_… (upstream é a Responses API, traduzida de volta para chat completions) |
prompt_tokens de um "hi" seco | 8 | 4121 (cached_tokens=3968) |
| Injeção fixa por requisição | 0 | ~4.100 tokens, idênticos nas 28 chamadas |
reasoning_tokens retornado | em toda chamada | em 3 das 8 provas; 5 vieram vazias |
| Custo real de uma resposta de uma palavra | US$ 0,00002 | US$ 0,014 |
Ou seja: toda requisição ao gpt-6-astra nessa linha carrega um system prompt invisível. Isso afeta três coisas: o comportamento do modelo pode ser moldado por um prompt que você não vê; cada chamada paga cerca de US$ 0,013 de custo fixo de entrada; e os campos de usage só são repassados parcialmente. A linha do mimo é uma conexão direta oficial, com zero injeção e usage completo.
Essa é uma forma concreta do que chamam de "emburrecimento pela API": o modelo não piorou, mas o que você chama está atrás de um invólucro entre você e a API oficial. Qualquer gateway, agregador ou linha revendida pode ter isso — inclusive a nossa própria rota padrão. Há exatamente uma forma de verificar: mande "hi" e veja se prompt_tokens tem um só dígito.
Mais duas ressalvas gerais: 3 execuções por prova é uma amostra pequena e só diz se um caminho conseguiu fazer a tarefa de forma confiável naquele dia; as duas famílias usam tokenizadores diferentes, então contagens de tokens não são divisíveis entre famílias — comparamos apenas acerto, caracteres de saída, dólares cobrados e segundos.
Modelos e preços#
| Modelo | Entrada US$/M | Saída US$/M | Cobrado por 28 chamadas |
|---|---|---|---|
| mimo-v2.6-pro (Xiaomi, contexto de 1M, modelo de raciocínio) | 0,435 | 0,87 | US$ 0,028 |
| gpt-6-astra (OpenAI) | 5,00 | 25,00 | US$ 0,261 |
Preços da página de preços da Crazyrouter; valores cobrados vêm do log de uso por token.
Ambiente de teste#
Mesmo endpoint compatível com OpenAI para os dois, sem system prompt, temperatura padrão, sem streaming:
curl https://api.crazyrouter.com/v1/chat/completions \
-H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-v2.6-pro",
"messages": [{"role": "user", "content": "Generate an SVG of a pelican riding a bicycle. Output only the SVG code, no explanation, no markdown fences."}],
"max_tokens": 16000
}'
Cada chamada registrou id, usage (incluindo reasoning_tokens), finish_reason, tempo de parede e o corpo completo. Os SVGs foram renderizados em PNG de 480px com Playwright para avaliação humana.
As 8 provas e os resultados#
| # | Prova | O que testa | mimo-v2.6-pro | gpt-6-astra | Notas |
|---|---|---|---|---|---|
| 1 | Pelicano andando de bicicleta, em SVG | Composição espacial, geração de código, estabilidade em saída longa | 2/3 | 3/3 | Veja a próxima seção |
| 2 | Falsa crença da caixa de doces (caixa rotulada "doces" contém lápis; duas perguntas) | Raciocínio na perspectiva do outro | 3/3 | 3/3 | O mimo quebrou a restrição "uma frase cada" com negrito e explicações |
| 3 | Quantos r em "raspberry cranberry strawberry" (resposta 9) | Armadilha de tokenizador | 3/3 | 3/3 | Os dois gastaram tokens de raciocínio |
| 4 | Qual é maior, 9.11 ou 9.9 | Armadilha numérica clássica | 3/3 | 3/3 | O gpt respondeu sem raciocinar, 7 tokens |
| 5 | Travessia de rio só com fazendeiro e repolho (resposta 1) | Cai no modelo lobo/cabra/repolho? | 3/3 | 3/3 | Nenhum caiu |
| 6 | Alice tem 4 irmãos e 2 irmãs; quantas irmãs tem o irmão dela (resposta 3) | Contagem que inclui a si mesma | 3/3 | 3/3 | |
| 7 | Acróstico chinês: quatro versos de 5 caracteres começando com 路/由/更/快, sem pontuação | Restrições rígidas em chinês | 3/3 | 3/3 | O gpt escreveu quase o mesmo poema 3 vezes; o mimo, três diferentes |
| 8 | Uma frase em inglês que declara corretamente o próprio número de palavras | Consistência autorreferente | 3/3 | 3/3 | O gpt repetiu o molde "exactly seven … words" 3 vezes |
Algumas amostras.
Acróstico, mimo, três execuções:
路远山川阔 / 由来天地长 / 更逢春雨后 / 快马踏花香
路途远且长 / 由山入云间 / 更上一重岭 / 快马踏清风
路远行人稀 / 由来秋意深 / 更向孤村去 / 快马踏寒林
Acróstico, gpt-6-astra, três execuções:
路远逐晨光 / 由心向远方 / 更登千仞岭 / 快意任翱翔
路远春风近 / 由心逐晓光 / 更登千仞岭 / 快意览朝阳
路远春风近 / 由心逐晓光 / 更登千里岫 / 快意向朝阳
Frase que se conta — mimo: "This sentence has five words." (5, verdadeira); gpt: "This sentence contains exactly seven English words." (7, verdadeira).
O pelicano: a única prova que os separou#
É o clássico de Simon Willison: pedir ao modelo que escreva o código SVG de "um pelicano andando de bicicleta" sem ver imagem nenhuma. Testa se o modelo consegue expressar a relação espacial entre dois objetos complexos em coordenadas.

| Execução | mimo-v2.6-pro |
|---|---|
| #0 | 43 s, 2.893 tokens de saída (111 de raciocínio). O pelicano fica em pé sobre o quadro em vez de sentar no selim; a asa mal alcança o guidão; o bico tem a bolsa laranja. Aceitável |
| #1 | 331 s, todos os 16.000 tokens queimados em raciocínio, conteúdo vazio, finish_reason=length. O raciocínio tem 41.656 caracteres planejando coordenadas e ordem de camadas ("a asa fica na frente ou atrás do guidão?") e nunca começou a emitir o SVG |
| #2 | 159 s, 8.870 tokens (5.147 de raciocínio). Nuvens, linhas de velocidade, penas azuis na asa, postura sentada correta — o melhor desenho do mimo |

| Execução | gpt-6-astra |
|---|---|
| #0 | 88 s, 2.817 tokens. Cena de praia, pelicano no selim, asa no guidão, pernas nos pedais — a composição mais completa |
| #1 | 96 s, 2.970 tokens. Mesma composição, mais um cachecol vermelho |
| #2 | 82 s, 2.616 tokens. Mesma composição, quadro turquesa |
Arquivos SVG originais (saída do modelo sem modificação): mimo #0 · mimo #2 · gpt-6-astra #0 · gpt-6-astra #1 · gpt-6-astra #2
Três observações:
- Os três desenhos do gpt-6-astra são um único molde com cores diferentes — mesma praia, nuvens, formato de bico e cachecol. Somado aos acrósticos e às frases autorreferentes quase idênticos, a diversidade de amostragem dessa linha é próxima de zero, como se a temperatura estivesse travada pelo invólucro. Se isso é o caminho ou o modelo, esta rodada não consegue separar.
- O mimo varia muito entre execuções: no melhor caso empata com o gpt, no pior a chamada inteira se perde. A execução perdida custou US$ 0,0139 — a chamada mais cara do mimo na rodada — e quem chamou recebeu uma string vazia.
- Tempo de parede: o gpt ficou estável em 82–96 s; o mimo foi de 43 a 331 s.
Latência#
| Prova | mimo-v2.6-pro | gpt-6-astra |
|---|---|---|
| Média das 4 provas de resposta curta | 3,9 s | 4,8 s |
| Caixa de doces | 8,4 s | 16,3 s |
| Acróstico | 13,7 s | 9,2 s |
| Frase que se conta | 9,9 s | 4,6 s |
| SVG do pelicano | 177,8 s | 88,6 s |
O mimo é um pouco mais rápido em respostas curtas; o gpt é mais estável em saídas longas.
Recomendações para produção#
Se você integrar o mimo-v2.6-pro — ou qualquer modelo de raciocínio — trate o caso "o raciocínio comeu o orçamento":
resp = client.chat.completions.create(model="mimo-v2.6-pro", messages=msgs, max_tokens=8000)
choice = resp.choices[0]
if choice.finish_reason == "length" and not choice.message.content:
# o pensamento esgotou o orçamento e o corpo veio vazio:
# tente de novo com max_tokens menor ou outro modelo; nunca persista a string vazia como resultado
...
Um max_tokens maior não é automaticamente mais seguro: o descontrole do mimo aconteceu justamente porque um orçamento de 16.000 tokens deixou o modelo planejar sem parar. Para tarefas determinísticas, 4.000–8.000 costuma ser mais estável.
Antes de integrar qualquer flagship estrangeiro, rode uma prova "hi": confira se prompt_tokens tem um dígito, se o id está no formato oficial e se o usage está completo. Se qualquer um dos três falhar, há uma camada no meio, e tanto seus benchmarks quanto sua estimativa de custo precisam ser refeitos. O inspetor de roteamento da Crazyrouter mostra em qual canal um modelo cai no momento e quantos candidatos ele tem; depois de criar uma conta, a página de modelos lista endpoints e preços de cada modelo.
Qual usar para cada tarefa#
- Código ou saída estruturada que precisa vir sempre: gpt-6-astra 3/3 vs mimo 2/3 nesta rodada — vantagem clara de estabilidade.
- Perguntas e respostas curtas em alto volume, sensível a custo: mesma taxa de acerto, mimo 9× mais barato e um pouco mais rápido.
- Escrita com restrições em chinês: os dois cumpriram as restrições rígidas; o mimo teve mais variedade.
- Você precisa de
reasoning_tokenspara controlar custo: o mimo informa sempre; a linha do gpt-6-astra, só às vezes.
FAQ#
P: Por que provas divertidas em vez de um benchmark padrão? Benchmarks padrão muito provavelmente vazaram para os dados de treino. Provas divertidas — especialmente o SVG do pelicano — obrigam o modelo a codificar relações espaciais em coordenadas na hora; não há o que decorar. O lado ruim é a avaliação subjetiva, por isso todos os arquivos originais estão publicados.
P: A saída vazia do mimo foi problema da plataforma?
Não. finish_reason=length, reasoning_tokens=16003 e content="" vieram direto do upstream, numa linha oficial direta com zero injeção. É um risco conhecido de modelos de raciocínio em tarefas abertas de saída longa.
P: O que são os 4.100 tokens injetados no gpt-6-astra?
Um prefixo adicionado por uma camada intermediária: 3.968 tokens com acerto de cache, idênticos nas 28 chamadas. Nunca vimos o conteúdo (não vem na resposta); só inferimos pelo prompt_tokens. Para descartar a influência dele é preciso repetir com a rota fixada no canal oficial da OpenAI — fica para a próxima rodada.
P: Quanto da diferença de 9,3× é a injeção? Cerca de 115K tokens de entrada em 28 chamadas, 111K deles acertos de cache (entrada em cache é cobrada a 10% do preço de entrada) — aproximadamente US 0,261. O resto é diferença real de preço de modelo.
P: Por que não há teste multimodal? O mimo não é omnimodal? Esta rodada é só texto. Entrada de imagem e vídeo terá plano próprio.
P: 3 execuções bastam? Não para dizer "quem é mais inteligente". Bastam para revelar sinais de estabilidade como "uma linha responde igual três vezes" e "um modelo perde uma execução em três". As próximas rodadas acrescentam perguntas de contexto longo com premissa falsa em 18,7K tokens (6 execuções cada) e questões de raciocínio pesado (13 execuções cada).
Relacionados#
- gpt-6-astra vs Claude Fable 5.1: 60% menos caracteres de saída — mas em parte por responder menos
- Claude Fable 5.1 vs Fable 5: eficiência de saída, acerto e as mudanças incompatíveis que nunca geram erro
- Por que escolher a Crazyrouter em vez do OpenRouter? Três diferenças concretas
- Preços · Documentação
Veredito final#
Em setembro de 2026, nestes dois caminhos específicos: as provas divertidas não separam os modelos em inteligência; separam em estabilidade (gpt estável, mimo sujeito a descontrole) e em custo (mimo uma ordem de grandeza mais barato). A lição mais útil vem antes das duas: mande "hi" antes de fazer benchmark e confira com quem você está falando de verdade.
Próxima rodada: contexto longo e raciocínio pesado para o mesmo par; repetição do gpt-6-astra fixada no canal oficial para testar o "três vezes igual"; depois, conforme o plano, mimo-v2.6-flash vs claude-sonnet-4-6 e kimi-k2.7-code vs claude-opus-5.





