返回博客
中文Comparison

mimo-v2.6-pro 对比 gpt-6-astra:鹈鹕骑车、糖果盒等 8 道趣味探针实测,顺带抓到一次 API 路径"降智"

用鹈鹕骑车 SVG、糖果盒错误信念、字母计数、藏头诗等 8 道趣味探针各跑 3 次,实测小米 mimo-v2.6-pro 与 gpt-6-astra。7 道两边全对;鹈鹕 SVG 上 gpt 3/3、mimo 2/3 且一次正文为空。另抓到 gpt-6-astra 默认路由每次被注入约 4100 token。附 SVG 原件与原始记录。

C
Crazyrouter Team
September 22, 2026 / 3 次浏览
分享:
mimo-v2.6-pro 对比 gpt-6-astra:鹈鹕骑车、糖果盒等 8 道趣味探针实测,顺带抓到一次 API 路径"降智"

先说结论,再说为什么这个结论要打折。

TL;DR#

  • 8 道趣味探针、每题各跑 3 次、共 48 次正式调用:mimo-v2.6-pro 23/24,gpt-6-astra 24/24
  • 7 道"经典陷阱题"(糖果盒心智理论、r 计数、9.11 vs 9.9、退化过河、Alice 姐妹、藏头诗、自指词数句)两边全部答对——这批题已经区分不出 2026 年旗舰的差距。
  • 唯一拉开的是鹈鹕骑自行车 SVG:gpt-6-astra 3/3 稳定出图;mimo 2/3,其中一次思考 331 秒、16000 token 全部烧在 reasoning、正文返回空字符串。差距在稳定性,不在上限——mimo 最好的一张不输 gpt。
  • 实付成本:28 次 gpt-6-astra 0.26128mimo0.261**,28 次 mimo **0.028,9.3 倍。但这 9.3 倍里有相当一部分不是模型价差,见下一条。
  • 必须声明:本次 gpt-6-astra 走的默认路由每个请求被中间层塞进约 4100 token 的前置指令(一句 "hi" 的 prompt_tokens=4121),采样多样性也异常低。文中所有 gpt-6-astra 数据只代表"2026-09-22 经该路径访问到的 gpt-6-astra",不代表 OpenAI 原生 API。

为什么先声明:API 上测到的不一定是模型本体#

做模型对比之前,我们先查了两条线各自的路由。这一步很多评测文章不做,但它决定了后面所有数字的含金量。

mimo-v2.6-progpt-6-astra
路由候选1 条:小米官方 api.xiaomimimo.com 直连18 条候选,当日命中优先级最高的一条第三方线
响应 id 形态UUIDresp_…(上游是 Responses API,再翻译成 chat completions)
一句 "hi" 的 prompt_tokens84121cached_tokens=3968
每次请求固定注入0约 4100 token,28 次全部一致
reasoning_tokens 是否返回每次都返回8 道题里 3 道返回、5 道为空
一个单词回答的实付$0.00002$0.014

也就是说 gpt-6-astra 这条线每个请求都背着一段看不见的系统提示。它会影响三件事:模型行为可能被那段提示改变;每次输入固定多付约 $0.013;usage 透传不完整。mimo 那条线是官方直连、零注入、usage 完整。

这就是大家常说的"API 降智"的一种具体形态:不是模型变笨了,而是你调用到的东西和官方 API 之间隔了一层你看不见的封装。任何网关、聚合站、转售线都可能有这个问题,包括我们自己的默认路由。排查方法只有一个:发一句 "hi",看 prompt_tokens 是不是个位数。

另外两条通用声明:每题只跑 3 次,样本小,只能说明"当天这条路径上能否稳定做对";两族分词器不同,token 数不能跨族相除,本文只比正确率、输出字符数、实付美元和秒数。

测试对象与价格#

模型输入 $/M输出 $/M本轮 28 次实付
mimo-v2.6-pro(小米,1M 上下文,推理模型)0.4350.87$0.028
gpt-6-astra(OpenAI)5.0025.00$0.261

价格来自 Crazyrouter 定价页,实付来自后台按 token 计费的日志。

测试环境#

统一走 OpenAI 兼容端点,无 system prompt,默认温度,非流式:

bash
curl https://api.crazyrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.6-pro",
    "messages": [{"role": "user", "content": "Generate an SVG of a pelican riding a bicycle. Output only the SVG code, no explanation, no markdown fences."}],
    "max_tokens": 16000
  }'

每次调用记录 idusage(含 reasoning_tokens)、finish_reason、耗时和完整正文。SVG 用 Playwright 渲染成 480px PNG 供人工判读。

8 道题与结果#

#题目考什么mimo-v2.6-progpt-6-astra备注
1鹈鹕骑自行车 SVG空间构图、代码生成、长输出稳定性2/33/3见下节
2糖果盒错误信念(标着"糖果"的盒子装铅笔,两问)他人视角推理3/33/3mimo 违反"一句话"约束,加粗+解释
3"raspberry cranberry strawberry" 有几个 r(答案 9)分词陷阱3/33/3两边都用了推理 token
49.11 和 9.9 哪个大经典数值陷阱3/33/3gpt 不推理直接答,7 token
5只有农夫和白菜的过河题(答案 1)是否套"狼羊菜"模板3/33/3均未被带偏
6Alice 有 4 兄 2 姐妹,兄弟有几个姐妹(答案 3)自指计数3/33/3
7藏头五言诗"路由更快",每句恰 5 字无标点中文硬约束3/33/3gpt 三次几乎同一首;mimo 三首各异
8写一句真实陈述自身词数的英文句自指一致性3/33/3gpt 三次同模板 "exactly seven … words"

几个有意思的样本:

藏头诗,mimo 三次:

text
路远山川阔 / 由来天地长 / 更逢春雨后 / 快马踏花香
路途远且长 / 由山入云间 / 更上一重岭 / 快马踏清风
路远行人稀 / 由来秋意深 / 更向孤村去 / 快马踏寒林

藏头诗,gpt-6-astra 三次:

text
路远逐晨光 / 由心向远方 / 更登千仞岭 / 快意任翱翔
路远春风近 / 由心逐晓光 / 更登千仞岭 / 快意览朝阳
路远春风近 / 由心逐晓光 / 更登千里岫 / 快意向朝阳

自指句,mimo:"This sentence has five words."(5,真);gpt:"This sentence contains exactly seven English words."(7,真)。

鹈鹕实验:唯一拉开差距的一题#

这道题来自 Simon Willison 的经典基准:让模型直接写 SVG 代码画"鹈鹕骑自行车",考的是不看图的情况下把两个复杂物体的空间关系用坐标表达出来。

mimo-v2.6-pro 三次结果

mimo-v2.6-pro
#043s,2893 输出 token(111 推理)。鹈鹕在车架上而非坐鞍,翅膀勉强搭到把手;喙有橙色喉囊。及格
#1331s,16000 token 全部烧在 reasoning,正文为空,finish_reason=length。reasoning 长 41,656 字符,一直在规划坐标和图层顺序("翅膀该在把手前还是后"),到预算耗尽也没开始输出
#2159s,8870 token(5147 推理)。云、速度线、蓝色翼羽、坐姿正确,是 mimo 最好的一张

gpt-6-astra 三次结果

gpt-6-astra
#088s,2817 token。海滩场景,鹈鹕坐鞍、翅膀握把、腿踩踏板,构图最完整
#196s,2970 token。同一构图,加了红围巾
#282s,2616 token。同一构图,青色车架

SVG 原件可直接下载(都是模型原始输出,未经修改): mimo #0 · mimo #2 · gpt-6-astra #0 · gpt-6-astra #1 · gpt-6-astra #2

三个观察:

  1. gpt-6-astra 三张图是同一个模板换配色——同样的海滩、云、喙形、围巾。结合藏头诗和自指句的"三次同答",这条线的采样多样性接近零,像是温度被中间层固定了。这是路径问题还是模型特性,本轮无法区分。
  2. mimo 三次差异大:好的时候不输 gpt,坏的时候整次作废。作废那次实付 $0.0139,是 mimo 本轮最贵的一次,而用户拿到的是空字符串
  3. 耗时:gpt 三次 82–96s 稳定;mimo 43–331s,方差极大。

延迟#

mimo-v2.6-progpt-6-astra
短答题 4 道平均3.9s4.8s
糖果盒8.4s16.3s
藏头诗13.7s9.2s
自指句9.9s4.6s
鹈鹕 SVG177.8s88.6s

短答题 mimo 略快;长输出 gpt 更稳。

生产接入建议#

接 mimo-v2.6-pro(以及任何推理模型)必须处理"reasoning 吃光预算"

python
resp = client.chat.completions.create(model="mimo-v2.6-pro", messages=msgs, max_tokens=8000)
choice = resp.choices[0]
if choice.finish_reason == "length" and not choice.message.content:
    # 思考耗尽预算、正文为空——重试时收紧 max_tokens 或换模型,别把空串当结果存下去
    ...

max_tokens 不是越大越安全:mimo 那次失控恰恰是因为给了 16000 的预算让它"想得起"。对确定性任务给 4000–8000 反而更稳。

接任何海外旗舰前,先做一次 "hi" 探针:看 prompt_tokens 是否个位数、id 是不是官方形态、usage 字段是否齐全。这三项任何一项异常,都说明中间隔了一层,你的评测和成本估算都得重算。Crazyrouter 后台的路由检查工具可以直接看到某个模型当前落在哪条渠道、有几条候选,注册后模型页能查到每个模型的可用端点和价格。

什么场景选谁#

  • 代码/结构化生成要稳定出结果:本轮 gpt-6-astra 3/3 vs mimo 2/3,稳定性优势明确。
  • 高频短问答、成本敏感:两边正确率相同,mimo 便宜 9 倍以上且延迟略低。
  • 中文约束写作:两边都满足硬约束,mimo 多样性更好。
  • 需要看 reasoning 用量做成本控制:mimo 每次都回 reasoning_tokens;gpt-6-astra 这条线时有时无。

FAQ#

Q:为什么用这些"趣味题"而不是标准 benchmark? 标准 benchmark 大概率进了训练集,趣味探针(尤其鹈鹕 SVG)需要模型现场把空间关系编成坐标,没法背。缺点是主观判读,所以我们把原件全放出来。

Q:mimo 那次空输出是不是平台的问题? 不是。finish_reason=lengthreasoning_tokens=16003content="" 都是上游原样返回,且是小米官方直连、零注入。这是推理模型在开放式长输出任务上的已知风险。

Q:gpt-6-astra 的 4100 token 注入是什么? 一段中间层加的前置指令,缓存命中 3968 token,28 次恒定。我们没有看到它的内容(它不在响应里),只能从 prompt_tokens 反推。要排除它的影响,需要用 OpenAI 官方渠道钉线复测,这是下一轮的事。

Q:9.3 倍成本差有多少是注入造成的? 28 次里注入部分约 115K prompt token,其中 111K 命中缓存(缓存价为输入价的 10%),折算约 0.076,占0.076,占 0.261 的 29%。剩下的才是模型本身的价差。

Q:为什么不测多模态?mimo 不是全模态吗? 本轮只测纯文本。图片/视频输入另立计划。

Q:3 次够吗? 不够下"谁更强"的结论,够发现"某条线三次同答"和"某模型三次里一次失控"这类稳定性信号。后续会补 18.7K 长上下文假前提题(各 6 次)和重推理题(各 13 次)。

相关文章#

最终判断#

在 2026 年 9 月这个时间点、这两条具体路径上:趣味探针分不出两者的智力差距,分得出的是稳定性(gpt 稳、mimo 有失控风险)和成本(mimo 便宜一个数量级)。而比这两条更值得带走的是:评测之前先发一句 "hi",看看你调用的到底是谁。

下一轮:mimo-v2.6-pro 与 gpt-6-astra 补长上下文和重推理题;gpt-6-astra 换官方渠道钉线复测"三次同答";之后按计划推进 mimo-v2.6-flash vs claude-sonnet-4-6、kimi-k2.7-code vs claude-opus-5。

Implementation Guides

Topics

Comparison

相关文章

Kimi K3 对比 GPT-5.6-SOL:数学、物理与编程高难度实测Comparison

Kimi K3 对比 GPT-5.6-SOL:数学、物理与编程高难度实测

在同一 OpenAI-compatible API 和同一提示词下,对 kimi-k3 与 gpt-5.6-sol 进行模式停止时间、带滑轮转动惯量的物理题和依赖闭包编程题测试,记录正确性、截断、延迟与本地代码验证。

Jul 17
GPT-5.6-sol vs GPT-5.5 实测:数学、物理与双摆动画代码对比Comparison

GPT-5.6-sol vs GPT-5.5 实测:数学、物理与双摆动画代码对比

基于 Crazyrouter OpenAI-compatible API 的真实模型对比测试:用偏置硬币等待 HTHT、实心圆柱滚动压缩弹簧、双摆混沌 Canvas 动画三道较难题,对比 gpt-5.6-sol 与 gpt-5.5 的正确性、finish_reason、reasoning_tokens、可见输出和浏览器验证结果。

Jul 10
Kimi K3 对比 Claude Fable 5:数学、物理、编程与文本推理实测Comparison

Kimi K3 对比 Claude Fable 5:数学、物理、编程与文本推理实测

通过 Crazyrouter OpenAI-compatible API 对 kimi-k3 与 claude-fable-5 做四类高难度任务对比:模式停止时间、碰撞压簧、Python 日志聚合和约束排班,并复测代码输出。

Jul 17
Gemini 2.5 Flash vs GPT 4.1 Mini:图片理解 API 实测对比(Crazyrouter Base URL)Comparison

Gemini 2.5 Flash vs GPT 4.1 Mini:图片理解 API 实测对比(Crazyrouter Base URL)

本文用 Crazyrouter OpenAI 兼容接口实测 gemini-2.5-flash 与 gpt-4.1-mini 的图片理解表现,比较识别准确率、延迟、价格、usage 信号和生产选型建议。

Jun 21
Claude Opus 5 vs GPT-5.6-SOL:10 道智能正确率实测,核心答案打平Comparison

Claude Opus 5 vs GPT-5.6-SOL:10 道智能正确率实测,核心答案打平

使用同一 Crazyrouter OpenAI-compatible API,对 Claude Opus 5 与 GPT-5.6-SOL 进行 10 道数学、物理、逻辑、统计和可执行代码测试。本文不比较受线路影响的响应速度,重点核验核心答案正确率、完整任务通过率、隐藏测试和严格 JSON 指令遵守。

Jul 29
Claude Opus 5 vs Claude Fable 5:7 项真实 API 测试与生产路由建议Comparison

Claude Opus 5 vs Claude Fable 5:7 项真实 API 测试与生产路由建议

在同一 OpenAI-compatible API、相同提示词和参数下,对 Claude Opus 5 与 Claude Fable 5 进行数学、物理、约束推理、代码审查、严格 JSON 和实验设计测试,记录交付率、内容过滤、延迟、token 与重试结果。

Jul 25