Достигла ли Kimi K3 уровня Opus 4.8? API-тестирование по семи измерениям
Kimi K3 и Claude Opus 4.8: сравнение точности, задержки и эффективности reasoning Token в семи тестах.

Достигла ли отечественная Kimi уровня Opus 4.8?#

По итогам последнего цикла тестирования Kimi K3 оставила необычное впечатление: её процесс рассуждений часто оказывается очень длинным, а ожидание — заметно дольше, однако на сложных задачах модель демонстрирует сильные способности к выводу. Claude Opus 4.8, напротив, работает быстрее и лаконичнее, но иногда допускает ошибки на, казалось бы, базовых этапах вычислений или моделирования.
Значит ли это, что Kimi K3 уже достигла — или даже превзошла — Opus 4.8? Мы провели сравнение с одинаковым API, едиными ограничениями и задачами, результаты которых можно проверить.
Как проводилось тестирование#
Обе модели вызывались через один и тот же API-шлюз с единым параметром temperature=1. В промпте требовалось сначала дать итоговый ответ, а затем — не более 10 строк необходимых вычислений, чтобы не принять большую длину вывода за высокий уровень способностей.
В ходе тестов фиксировались:
- общее время ответа;
- время до первого события reasoning;
- время до первого видимого ответа;
- соотношение reasoning Token и видимых Token;
- была ли генерация оборвана лимитом вывода;
- корректность математических и физических результатов, ревью кода и соблюдения формата.
Набор задач включал точные расчёты для цепей Маркова, моделирование двухстепенной колебательной системы, сортировку с ограничениями, статистические задачи с ложными предпосылками, ревью кода, строгое JSON-сжатие и проектирование оценки моделей.
Первый этап: точная математика#
В задаче по цепи Маркова требовалось вычислить первый момент, второй момент и дисперсию времени первого достижения. Эталонный ответ:
E[tau] = 5
E[tau^2] = 43
Var(tau) = 18
Kimi K3 использовала около 2437 reasoning Token; общее время составило 103.7 секунды, а первый видимый ответ появился через 100.1 секунды. Итоговый результат был верным.
Opus 4.8 завершила задачу за 28.4 секунды, первый видимый ответ появился примерно через 23.8 секунды, и результат также оказался правильным.
Эта задача не позволила определить, какая модель «умнее», но хорошо показала разницу в подходах: Kimi K3 тратит больше времени на внутреннюю проверку, тогда как Opus 4.8 быстрее завершает тот же вывод.
Второй этап: физическое моделирование#
В задаче о двухстепенной колебательной системе требовалось одновременно обработать матрицы масс, демпфирования и жёсткости, собственные частоты и комплексную частотную характеристику. Верные эталонные значения:
w1 = 10.0204 rad/s
w2 = 16.2149 rad/s
|X1| = 0.1493 m
|X2| = 0.0717 m
Здесь результаты оказались интереснее.
Kimi K3 рассуждала 211.6 секунды, израсходовала 5997/6000 completion Token и в итоге не выдала видимого ответа: генерация завершилась с length. Возможно, модель выполнила большой объём внутренних расчётов, но для пользователя это всё равно означает отсутствие результата.
Opus 4.8 дала ответ всего за 9.9 секунды, однако вычислила первую собственную частоту как 8.5985 rad/s, а вторую амплитуду — как 0.10391 m, что явно расходится с корректными значениями. Ответ был полным, включая матрицы, но ключевые коэффициенты матрицы уже содержали ошибку.
Это показывает, что «быстро» не значит «надёжно», а «долго думать» не значит «эффективно завершить задачу».
Третий этап: пять дополнительных измерений#

В пяти добавленных тестах Kimi K3 получила максимальный автоматический балл. Среднее общее время составило 43.0 секунды, среднее время до первого видимого ответа — 40.3 секунды, суммарно было использовано 4192 reasoning Token.
Opus 4.8 успешно прошла все четыре задачи на знания и рассуждение: среднее общее время составило 10.4 секунды, среднее время до первого видимого ответа — 8.5 секунды. Единственный потерянный балл пришёлся на задачу со строгим JSON: содержимое JSON было верным, но модель добавила пояснительный текст до и после него, нарушив требование «вывести только один объект JSON».
| Измерение | Kimi K3 | Opus 4.8 |
|---|---|---|
| Выполнение ограничений | Верно, 27.8 секунды | Верно, 8.5 секунды |
| Статистическая задача с ложной предпосылкой | Верно, 50.3 секунды | Верно, 8.7 секунды |
| Ревью кода | Верно, 37.4 секунды | Верно, 22.9 секунды |
| Строгий JSON | Полное соответствие | Содержимое верно, но формат нарушен |
| Калибровка неопределённости | Верно, 61.1 секунды | Верно, 3.7 секунды |
В чём преимущество Kimi K3#
Сильная сторона Kimi K3 не в том, что она быстрее решает каждую задачу, а в её готовности продолжать проверять промежуточные шаги. Для точной математики, рассуждений с ограничениями и задач, где нужно опровергнуть ошибочную предпосылку, такая тенденция может повышать надёжность.
Однако её недостатки столь же заметны:
- Доля внутреннего reasoning слишком велика: даже простые задачи могут требовать десятков секунд ожидания.
- На сложных задачах модель легко расходует весь бюджет на этапе размышлений и не выдаёт видимого ответа.
- Между «много думать» и «стабильно доставлять итоговый результат» пока не хватает надёжного контроля отсечения.
Иными словами, Kimi K3 скорее напоминает перспективную модель глубокого рассуждения, чем высокоскоростную производственную модель, уже доведённую инженерно.
Преимущества и ограничения Opus 4.8#

Главное преимущество Opus 4.8 — скорость ответа и эффективность изложения. Она способна за секунды или десятки секунд выдать структурированный ответ, что хорошо подходит для интерактивных рабочих процессов.
Однако физическая задача в этом цикле выявила проблему, которую необходимо учитывать: модель может быстро написать внешне полное решение, но не заметить ошибку в коэффициентах матрицы жёсткости. Для задач по математике, физике, финансам и коду недостаточно того, что ответ выглядит правдоподобно: по-прежнему необходимы калькулятор, модульные тесты или проверка второй моделью.
Итоговый ответ: достигла ли?#
Если речь о потенциале рассуждений, Kimi K3 уже приблизилась к Opus 4.8 и в отдельных задачах точного вывода может быть даже надёжнее.
Если же говорить о совокупной практической применимости, пока нельзя утверждать, что Kimi K3 всесторонне достигла уровня Opus 4.8.
Этот раунд тестов скорее подтверждает следующий вывод:
Потенциал Kimi K3 высок, но по эффективности она заметно отстаёт; Opus 4.8 лидирует по эффективности доставки результата, но требует защиты от быстрых вычислительных ошибок.
На практике разумнее не выбирать строго одну из двух моделей, а распределять роли:
- для задач, чувствительных к скорости, и непрерывного диалога — в первую очередь Opus 4.8;
- для точной математики, сложных ограничений и задач, требующих многократной проверки, — Kimi K3 с достаточным бюджетом;
- для задач высокого риска — одна модель генерирует решение, другая его проверяет; нельзя полагаться только на единичный финальный ответ.
Ограничения этого тестирования#
Это не окончательный рейтинг моделей. Размер выборки всё ещё ограничен, модели проксировались через единый шлюз, reasoning Token Opus не раскрывались стабильно, а задержки могут зависеть от нагрузки поставщика. Для более строгих выводов нужны многократные серии случайных задач, фиксированный канал, повторные выборки и внешняя проверка исполнения.
Но как минимум одно можно подтвердить:
Kimi K3 — уже не модель, которая лишь наращивает длину размышлений; она действительно способна напрямую соперничать с Opus 4.8. Однако между способностями и эффективностью, а затем между эффективностью и стабильной доставкой результата всё ещё остаётся дистанция.
Читать далее#
- Kimi K3 и Opus 4.8: бенчмарк по математике, физике и программированию уровня магистратуры
- Сравнение Kimi K3 и GPT-5.6-SOL на задачах высокой сложности
- Тест проверяемого рассуждения Kimi K3 и Claude Fable 5
- Тест бюджета вывода Claude Fable 5 и GPT-5.5
- Тесты сложной физики и кода для GPT-5.6-SOL и GPT-5.5
FAQ#
Kimi K3 уже всесторонне превзошла Opus 4.8?#
Нет. Этот раунд показывает лишь то, что Kimi K3 обладает конкурентоспособностью того же уровня в отдельных задачах точного рассуждения, опровержения ложных предпосылок и выполнения ограничений. Скорость первого ответа и общая эффективность доставки результата у Opus 4.8 по-прежнему заметно выше.
Почему Kimi K3 отвечает правильно, но ждать приходится так долго?#
В тестах Kimi K3 расходовала большую часть completion Token на этапе reasoning. В задаче с цепью Маркова около 94.5% сгенерированных Token относились к reasoning, а в сложной физической задаче она не выдала видимого ответа даже после исчерпания 6000 Token.
Почему Opus 4.8 ошиблась в физической задаче?#
При построении матрицы жёсткости и последующего характеристического уравнения модель использовала неверные коэффициенты, из-за чего и собственные частоты, и амплитуды частотной характеристики отклонились от эталонных значений. Такие ошибки показывают, что численные задачи высокого риска по-прежнему требуют внешних вычислений или проверки второй моделью.
Как выбирать между этими моделями в production?#
Для интерактивных задач, чувствительных к скорости, приоритетна Opus 4.8; для задач, допускающих более долгое ожидание и требующих точного вывода, можно использовать Kimi K3. Более надёжный подход — поручить одной модели генерацию, а другой — проверку.
Можно ли воспроизвести этот набор тестов?#
Да. Тестирование использует POST https://cn.crazyrouter.com/v1/chat/completions, модели с ID kimi-k3 и claude-opus-4-8, а также фиксирует finish_reason, время первого видимого ответа, reasoning Token и итоговый ответ.
Как вызывать эти модели через Crazyrouter?#
После регистрации используйте OpenAI-compatible Base URL https://cn.crazyrouter.com/v1 и укажите в запросе соответствующий ID модели. Сам API endpoint не требует UTM-параметров. Создать аккаунт и начать тестирование.




