Back to Blog
РусскийComparison

mimo-v2.6-pro против gpt-6-astra: пеликан на велосипеде, коробка конфет и ещё 6 проб — плюс пойманное «поглупение» по API

8 забавных проб (SVG пеликана, коробка конфет, подсчёт букв, акростих) по 3 прогона на mimo-v2.6-pro и gpt-6-astra. 7 из 8 — ничья; на SVG пеликана gpt 3/3, mimo 2/3 с одним пустым ответом. Плюс пойманная инъекция ~4100 токенов на маршруте gpt-6-astra. SVG и логи прилагаются.

C
Crazyrouter Team
September 22, 2026 / 2 views
Share:
mimo-v2.6-pro против gpt-6-astra: пеликан на велосипеде, коробка конфет и ещё 6 проб — плюс пойманное «поглупение» по API

Сначала вывод, затем — почему к выводу нужна поправка.

Коротко#

  • 8 забавных проб, по 3 прогона, 48 оценённых вызовов: mimo-v2.6-pro 23/24, gpt-6-astra 24/24.
  • 7 «классических ловушек» (коробка конфет / теория разума, подсчёт букв r, 9.11 против 9.9, вырожденная переправа через реку, сёстры Алисы, китайский акростих, самоописывающее предложение) обе модели решили правильно во всех прогонах. Эти пробы уже не различают флагманы 2026 года.
  • Единственный разрыв — SVG «пеликан едет на велосипеде»: gpt-6-astra нарисовал 3/3; mimo 2/3, причём один прогон думал 331 секунду, сжёг все 16 000 токенов в рассуждении и вернул пустую строку. Разрыв в стабильности, а не в потолке: лучший рисунок mimo не хуже gpt.
  • Реально списано: 28 вызовов gpt-6-astra — 0,261,28вызововmimo0,261**, 28 вызовов mimo — **0,028, в 9,3 раза. Заметная доля этого — не цена модели, см. следующий пункт.
  • Раскрытие: маршрут по умолчанию, на который попал gpt-6-astra, вставляет примерно 4100 скрытых токенов в каждый запрос (на простое «hi» пришло prompt_tokens=4121), а разнообразие сэмплирования аномально низкое. Все числа по gpt-6-astra здесь описывают «gpt-6-astra, доступный через этот путь 22.09.2026», а не нативный API OpenAI.

Почему раскрытие идёт первым: то, что вы тестируете через API, не всегда сама модель#

Прежде чем что-либо сравнивать, мы проверили маршрутизацию обеих линий. Большинство бенчмарков этот шаг пропускают, а именно он определяет, чего стоят цифры.

mimo-v2.6-progpt-6-astra
Кандидаты маршрута1: напрямую в официальный api.xiaomimimo.com18 кандидатов; в тот день победила сторонняя линия с наивысшим приоритетом
Формат id ответаUUIDresp_… (апстрим — Responses API, переведённый обратно в chat completions)
prompt_tokens на голое «hi»84121 (cached_tokens=3968)
Фиксированная вставка на запрос0~4100 токенов, одинаково во всех 28 вызовах
Возвращается ли reasoning_tokensкаждый вызовв 3 пробах из 8, в 5 — пусто
Реальная цена ответа из одного слова$0,00002$0,014

Иначе говоря, каждый запрос к gpt-6-astra на этой линии несёт невидимый системный промпт. Это влияет на три вещи: поведение модели может формировать промпт, которого вы не видите; каждый вызов платит около $0,013 фиксированных входных расходов; поля usage передаются лишь частично. Линия mimo — официальное прямое подключение, ноль вставок, полный usage.

Это одна из конкретных форм того, что называют «поглупением по API»: модель не стала хуже, но между вами и официальным API стоит обёртка. Такое может быть у любого шлюза, агрегатора или перепроданной линии — включая наш собственный маршрут по умолчанию. Проверка ровно одна: отправьте «hi» и посмотрите, однозначное ли число в prompt_tokens.

Ещё две общие оговорки: 3 прогона на пробу — маленькая выборка, она показывает только, могла ли линия стабильно решить задачу в тот день; у двух семейств разные токенизаторы, поэтому число токенов нельзя делить между семействами — мы сравниваем только правильность, символы вывода, списанные доллары и секунды.

Модели и цены#

МодельВход $/MВыход $/MСписано за 28 вызовов
mimo-v2.6-pro (Xiaomi, контекст 1M, рассуждающая модель)0,4350,87$0,028
gpt-6-astra (OpenAI)5,0025,00$0,261

Цены — со страницы тарифов Crazyrouter; списания — из потокенного журнала использования.

Условия теста#

Одна и та же OpenAI-совместимая конечная точка, без системного промпта, температура по умолчанию, без стриминга:

bash
curl https://api.crazyrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.6-pro",
    "messages": [{"role": "user", "content": "Generate an SVG of a pelican riding a bicycle. Output only the SVG code, no explanation, no markdown fences."}],
    "max_tokens": 16000
  }'

Для каждого вызова записывались id, usage (включая reasoning_tokens), finish_reason, время и полный ответ. SVG рендерились в PNG 480px через Playwright для ручной оценки.

8 проб и результаты#

#ПробаЧто проверяетmimo-v2.6-progpt-6-astraПримечание
1Пеликан на велосипеде в виде SVGПространственная композиция, генерация кода, стабильность длинного вывода2/33/3См. следующий раздел
2Ложное убеждение с коробкой конфет (коробка с надписью «конфеты», внутри карандаши; два вопроса)Рассуждение с чужой позиции3/33/3mimo нарушил условие «по одному предложению» — жирный текст и пояснения
3Сколько букв r в «raspberry cranberry strawberry» (ответ 9)Ловушка токенизатора3/33/3Обе потратили токены рассуждения
4Что больше, 9.11 или 9.9Классическая числовая ловушка3/33/3gpt ответил без рассуждения, 7 токенов
5Переправа через реку только с фермером и капустой (ответ 1)Подставляет ли шаблон «волк, коза, капуста»?3/33/3Никто не попался
6У Алисы 4 брата и 2 сестры; сколько сестёр у её брата (ответ 3)Подсчёт с включением себя3/33/3
7Китайский акростих: четыре строки по 5 иероглифов, начинающиеся с 路/由/更/快, без знаков препинанияЖёсткие ограничения на китайском3/33/3gpt написал почти одно и то же стихотворение 3 раза; mimo — три разных
8Английское предложение, правдиво называющее число своих словСамореферентная согласованность3/33/3gpt трижды использовал шаблон «exactly seven … words»

Несколько примеров.

Акростих, mimo, три прогона:

text
路远山川阔 / 由来天地长 / 更逢春雨后 / 快马踏花香
路途远且长 / 由山入云间 / 更上一重岭 / 快马踏清风
路远行人稀 / 由来秋意深 / 更向孤村去 / 快马踏寒林

Акростих, gpt-6-astra, три прогона:

text
路远逐晨光 / 由心向远方 / 更登千仞岭 / 快意任翱翔
路远春风近 / 由心逐晓光 / 更登千仞岭 / 快意览朝阳
路远春风近 / 由心逐晓光 / 更登千里岫 / 快意向朝阳

Самоописывающее предложение — mimo: «This sentence has five words.» (5, верно); gpt: «This sentence contains exactly seven English words.» (7, верно).

Пеликан: единственная проба, которая их разделила#

Это классика Саймона Уиллисона: попросить модель написать SVG-код «пеликан едет на велосипеде», не показывая никакой картинки. Проверяется, способна ли модель выразить пространственные отношения двух сложных объектов в координатах.

mimo-v2.6-pro, три прогона

Прогонmimo-v2.6-pro
#043 с, 2893 токена вывода (111 рассуждения). Пеликан стоит на раме вместо седла; крыло едва дотягивается до руля; у клюва оранжевый мешок. Приемлемо
#1331 с, все 16 000 токенов сгорели в рассуждении, пустой контент, finish_reason=length. Рассуждение — 41 656 символов планирования координат и порядка слоёв («крыло перед рулём или за ним?»), до вывода SVG дело так и не дошло
#2159 с, 8870 токенов (5147 рассуждения). Облака, линии скорости, синие перья, правильная посадка — лучший рисунок mimo

gpt-6-astra, три прогона

Прогонgpt-6-astra
#088 с, 2817 токенов. Пляж, пеликан на седле, крыло на руле, лапы на педалях — самая полная композиция
#196 с, 2970 токенов. Та же композиция плюс красный шарф
#282 с, 2616 токенов. Та же композиция, бирюзовая рама

Исходные SVG (немодифицированный вывод моделей): mimo #0 · mimo #2 · gpt-6-astra #0 · gpt-6-astra #1 · gpt-6-astra #2

Три наблюдения:

  1. Три рисунка gpt-6-astra — один шаблон в разных цветах: тот же пляж, облака, форма клюва, шарф. Вместе с почти идентичными акростихами и самоописывающими предложениями это означает, что разнообразие сэмплирования на этой линии близко к нулю, как будто температура зафиксирована обёрткой. Путь это или модель — в этом раунде не разделить.
  2. mimo сильно варьирует между прогонами: в лучшем случае не уступает gpt, в худшем вызов пропадает целиком. Пропавший прогон стоил $0,0139 — самый дорогой вызов mimo в раунде — и вызывающий получил пустую строку.
  3. Время: gpt стабильно 82–96 с; mimo от 43 до 331 с.

Задержки#

Пробаmimo-v2.6-progpt-6-astra
Среднее по 4 коротким пробам3,9 с4,8 с
Коробка конфет8,4 с16,3 с
Акростих13,7 с9,2 с
Самоописывающее предложение9,9 с4,6 с
SVG пеликана177,8 с88,6 с

На коротких ответах mimo чуть быстрее; на длинных выводах gpt стабильнее.

Рекомендации для продакшена#

Если вы интегрируете mimo-v2.6-pro — или любую рассуждающую модель — обрабатывайте случай «рассуждение съело бюджет»:

python
resp = client.chat.completions.create(model="mimo-v2.6-pro", messages=msgs, max_tokens=8000)
choice = resp.choices[0]
if choice.finish_reason == "length" and not choice.message.content:
    # размышление исчерпало бюджет, тело пустое:
    # повторить с меньшим max_tokens или другой моделью; никогда не сохранять пустую строку как результат
    ...

Больший max_tokens не делает вызов безопаснее автоматически: срыв mimo случился именно потому, что бюджет в 16 000 токенов позволил ей планировать бесконечно. Для детерминированных задач 4000–8000 зачастую стабильнее.

Перед интеграцией любого зарубежного флагмана сделайте одну пробу «hi»: проверьте, что prompt_tokens однозначное, что id в официальном формате и что usage полный. Если хоть что-то не так — между вами есть слой, и бенчмарки вместе с оценкой затрат нужно переделывать. Инспектор маршрутизации Crazyrouter показывает, на какой канал сейчас попадает модель и сколько у неё кандидатов; после регистрации на странице моделей видны конечные точки и цены каждой модели.

Кого выбирать под какую задачу#

  • Код или структурированный вывод, который должен приходить всегда: gpt-6-astra 3/3 против mimo 2/3 в этом раунде — явное преимущество в стабильности.
  • Массовые короткие вопросы-ответы, чувствительность к цене: одинаковая правильность, mimo в 9 раз дешевле и чуть быстрее.
  • Письмо с ограничениями на китайском: обе выполнили жёсткие условия; у mimo больше разнообразия.
  • Нужен reasoning_tokens для контроля затрат: mimo отдаёт его всегда; линия gpt-6-astra — лишь иногда.

FAQ#

В: Почему забавные пробы, а не стандартный бенчмарк? Стандартные бенчмарки почти наверняка попали в обучающие данные. Забавные пробы — особенно SVG пеликана — заставляют модель кодировать пространственные отношения в координаты прямо сейчас; запомнить нечего. Минус — субъективная оценка, поэтому все исходные файлы опубликованы.

В: Пустой вывод mimo — проблема платформы? Нет. finish_reason=length, reasoning_tokens=16003 и content="" пришли напрямую от апстрима по официальной прямой линии без вставок. Это известный риск рассуждающих моделей на открытых задачах с длинным выводом.

В: Что за 4100 вставленных токенов у gpt-6-astra? Префикс, добавляемый промежуточным слоем: 3968 токенов попадают в кэш, одинаково во всех 28 вызовах. Его содержимое мы не видели (в ответе его нет), только вывели из prompt_tokens. Чтобы исключить его влияние, нужен повторный прогон, закреплённый за официальным каналом OpenAI — это следующий раунд.

В: Какая часть разрыва в 9,3 раза — из-за вставки? Около 115K входных токенов за 28 вызовов, из них 111K — попадания в кэш (кэшированный вход тарифицируется как 10% цены входа) — примерно 0,076,или290,076, или 29% от 0,261. Остальное — реальная разница в цене моделей.

В: Почему нет мультимодальных тестов? Разве mimo не омнимодальна? Этот раунд — только текст. Для изображений и видео будет отдельный план.

В: Достаточно ли 3 прогонов? Для вывода «кто умнее» — нет. Для сигналов стабильности вроде «одна линия трижды отвечает одинаково» и «одна модель срывает один прогон из трёх» — да. Дальше добавим длинноконтекстные вопросы с ложной посылкой на 18,7K токенов (по 6 прогонов) и тяжёлые задачи на рассуждение (по 13 прогонов).

Связанные материалы#

Итог#

По состоянию на сентябрь 2026 года, на этих двух конкретных путях: забавные пробы не различают модели по интеллекту; они различают их по стабильности (gpt стабилен, mimo склонна к срыву) и по цене (mimo дешевле на порядок). Но полезнее всего то, что стоит перед обоими выводами: отправьте «hi» перед бенчмарком и проверьте, с кем вы на самом деле разговариваете.

Следующий раунд: длинный контекст и тяжёлое рассуждение для той же пары; повтор gpt-6-astra через официальный канал, чтобы проверить «три одинаковых ответа»; затем по плану — mimo-v2.6-flash против claude-sonnet-4-6 и kimi-k2.7-code против claude-opus-5.

Implementation Guides

Topics

Related Articles

Qwen3 VL Flash vs GPT-4.1 Mini: бенчмарк Vision API 2026 для практического выбора моделиComparison

Qwen3 VL Flash vs GPT-4.1 Mini: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения qwen3-vl-flash и gpt-4.1-mini в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
Qwen3 VL Flash vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора моделиComparison

Qwen3 VL Flash vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения qwen3-vl-flash и gpt-4.1-nano в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
Gemini 2.5 Flash vs GPT-4.1 Mini: бенчмарк Vision API 2026 для практического выбора моделиComparison

Gemini 2.5 Flash vs GPT-4.1 Mini: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gemini-2.5-flash и gpt-4.1-mini в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
Gemini 2.5 Flash Lite vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора моделиComparison

Gemini 2.5 Flash Lite vs GPT-4.1 Nano: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения gemini-2.5-flash-lite и gpt-4.1-nano в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22
Почему стоит выбрать Crazyrouter, а не OpenRouter? Три отличия, которые действительно важныComparison

Почему стоит выбрать Crazyrouter, а не OpenRouter? Три отличия, которые действительно важны

Те же модели Claude, GPT и Gemini, но на 35–45% дешевле официальных цен и без комиссии за пополнение; никаких уровней лимитов — RPM настраивается под вашу нагрузку; живой специалист сопровождает каждую ошибку до решения. Сравнение с конкретными ценами.

Sep 17
Qwen3 VL Flash vs Qwen3 VL Plus: бенчмарк Vision API 2026 для практического выбора моделиComparison

Qwen3 VL Flash vs Qwen3 VL Plus: бенчмарк Vision API 2026 для практического выбора модели

Практический benchmark для сравнения qwen3-vl-flash и qwen3-vl-plus в задачах Vision API: реальная точность распознавания, latency, tail latency, стоимость успешного изображения, usage signals, failure modes и routing recommendations.

Jun 22