Login
Back to Blog
日本語Comparison

Claude Opus 5 vs GPT-5.6 Luna:速度順位を使わない18問の正確性ベンチマーク

数学、複雑な物理、実行可能なアルゴリズム、誤前提への耐性、制約推論、指示遵守で Opus 5 と GPT-5.6 Luna を検証しました。

C
Crazyrouter Team
July 30, 2026 / 4 views
Share:
Claude Opus 5 vs GPT-5.6 Luna:速度順位を使わない18問の正確性ベンチマーク

Claude Opus 5 vs GPT-5.6 Luna:速度順位を使わない18問の正確性ベンチマーク

先に結論#

高難度ラウンドでは Claude Opus 5 が 17/18(94.4%)、GPT-5.6 Luna が **16/18(88.9%)**でした。差は1問であり、Opusが常に上という証明ではありません。重要なのは失敗の形です。Opusは3本のアルゴリズムをそのまま実行できる形で納品した一方、厳密JSONで余計な囲みを付けました。Lunaは3つの形式指示をすべて守りましたが、2本のPythonファイルがimport時に停止しました。

なぜ問題を難しくしたのか#

最初の8問は両モデルとも8/8で、差が出ませんでした。そこで第2ラウンドを18問に増やし、6分野それぞれに hard、harder、extreme を配置しました。正確な分数、多段階の物理モデル、完全なPythonファイル、誤った前提の拒否、一意な制約解、文字単位の出力形式を要求しています。説明が巧みかどうかではなく、決定的な主張を計算、JSONパース、Python実行で確認できるかを評価しました。

18問をどう採点したか#

同一の問題文、system指示、temperature、問題別の出力予算を使いました。数学と物理は厳密値または数値許容差で検証し、コードは回答のまま保存して共通のhidden testへimportしました。JSONとCSVは「意味が通る」ではなく、機械入力として合格するかで判定しています。モデル自身のassertを削除すれば動く場合も、原因分析には使いますが初回納品を合格へ変更しません。回線遅延は生JSONにだけ残し、勝敗には一切使っていません。

6分野の結果#

6分野の正解数

評価分野Opus 5GPT-5.6 Luna
数学的推論3/33/3
複雑な物理3/33/3
アルゴリズム納品3/31/3
誤った前提への耐性3/33/3
制約推論3/33/3
指示遵守2/33/3
Total17/18 (94.4%)16/18 (88.9%)

アルゴリズム差は「納品物」の差だった#

Lunaが失敗した2問は、末尾の自己テストを外すと関数本体がhidden testを通過しました。しかし自己テストの期待値が誤っており、元ファイルはimport時にAssertionErrorを起こします。「完全なPythonファイル」という契約では失敗です。Opusの3ファイルは元のままimportと共通テストに通りました。本番では、正しそうな関数と、そのまま利用できる成果物を分けて考える必要があります。

厳密JSONではLunaが優位#

失敗の種類が違えば、本番リスクも違う

Opusの唯一の失敗は逆方向でした。JSONのキーと値は正しいのに、「JSONオブジェクトだけ」という指示に反してMarkdownのコードフェンスを追加しました。独立再試行でも同じです。Lunaは指示遵守3問をすべて通過しました。出力を直接パーサーへ渡す処理では、囲みの有無も正確性の一部です。

出力予算と知能上の誤りを分離#

初期試行の一部は、内部推論が出力予算を使い切りfinish_reason=lengthになりました。これは証拠として保存しましたが、知能の誤りには数えていません。両モデルの有効予算を同条件で増やしてから採点したためです。ただし、長い推論で可視成果物の領域が不足するという統合上のリスクは残ります。

本番ルーティングへの落とし込み#

厳密JSON、CSV、短い抽出、大量の構造化処理はLunaを第一候補にしつつ、schema検証を必須にします。長いアルゴリズム、境界条件、防御的な実装はOpusを第一候補にします。数学、複雑な物理、誤前提、制約推論は本サンプルで同点なので、価格、API互換性、文章量で選ぶ方が合理的です。どちらでもJSONをparseし、数値を照合し、コードを回答のまま実行してください。

再現方法と生データ#

実行スクリプトはscripts/opus5_vs_luna_hard_benchmark.py、全結果は.tmp/opus5-vs-luna-hard-benchmark-results.jsonです。独立再試行は.tmp/opus5-hard-failure-retry.json.tmp/luna-hard-failure-retry.jsonにあります。APIはhttps://cn.crazyrouter.com/v1/chat/completionsを使用し、遅延値は生データでのみ確認できます。

よくある質問#

17/18ならOpus 5が総合勝者ですか?#

いいえ。この18問では1問リードした、という意味です。画像、ツール利用、超長文脈、複数ターンのagentは対象外です。

誤った自己テストをアルゴリズム失敗に含める理由は?#

要求が完全なPythonファイルだからです。元ファイルがimportで落ちるなら、人手で直さずに利用できません。

なぜ速度を結論に入れないのですか?#

遅延はモデルだけでなく、ゲートウェイ、上流負荷、経路状態にも左右されます。運用証拠としては有用でも、知能の正確性とは別です。

最終評価#

検証可能な正確性を優先した本テストでは、アルゴリズム3問を完全納品したOpus 5が 17/18 対 16/18で1問リードしました。一方、厳密な指示遵守はLunaが上です。結論は万能の勝者ではなく、再現可能な失敗傾向に基づく使い分けです。

Crazyrouterで両モデルを実際のプロンプトに通して比較する

Implementation Guides

Topics

Comparison

Related Posts

Kimi K3 と Claude Opus 4.8 の比較:研究生レベルの数学・物理・プログラミング実測Comparison

Kimi K3 と Claude Opus 4.8 の比較:研究生レベルの数学・物理・プログラミング実測

同一の Crazyrouter OpenAI-compatible API 上で、研究生レベルのマルコフ連鎖の初到達時間、減衰付き結合振動子の周波数応答、依存関係スケジューリングアルゴリズムを用いて kimi-k3 と claude-opus-4-8 を比較し、出力の完全性、正確性、レイテンシー、独立検証結果を記録する。

Jul 19
Claude Opus 5 vs Claude Fable 5:7つの実APIベンチマークと本番ルーティングの提案Comparison

Claude Opus 5 vs Claude Fable 5:7つの実APIベンチマークと本番ルーティングの提案

同一のOpenAI-compatible API、同じプロンプトとパラメータをいて、Claude Opus 5とClaude Fable 5を数学、物理、制約推論、コードレビュー、厳密なJSON出力、実験設計の各タスクで検証し、応答成功率、コンテンツフィルリング、latency、トークン数、リトライ結果を記録します。

Jul 25
GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数Comparison

GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数

Crazyrouter の OpenAI 互換 API で glm-5.2 と claude-fable-5 を数学、物理、Canvas アニメーション課題で比較し、glm-5.2 の現在の 0.8 discount も実務目線で整理します。

Jul 6
GPT-4.1 Mini vs GPT-4.1 Nano Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較Comparison

GPT-4.1 Mini vs GPT-4.1 Nano Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較

gpt-4.1-mini と gpt-4.1-nano を Vision API ワークロードで比較する実運用向けベンチマーク。実際の画像認識精度、latency、tail latency、成功画像あたりのコスト、usage signals、failure modes、production routing を整理します。

Jun 22
GPT-4.1 Nano vs Qwen3 VL Plus Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較Comparison

GPT-4.1 Nano vs Qwen3 VL Plus Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較

gpt-4.1-nano と qwen3-vl-plus を Vision API ワークロードで比較する実運用向けベンチマーク。実際の画像認識精度、latency、tail latency、成功画像あたりのコスト、usage signals、failure modes、production routing を整理します。

Jun 22
Gemini 2.5 Flash vs GPT-4.1 Nano Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較Comparison

Gemini 2.5 Flash vs GPT-4.1 Nano Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較

gemini-2.5-flash と gpt-4.1-nano を Vision API ワークロードで比較する実運用向けベンチマーク。実際の画像認識精度、latency、tail latency、成功画像あたりのコスト、usage signals、failure modes、production routing を整理します。

Jun 22