
Claude Opus 5 vs GPT-5.6 Luna:速度順位を使わない18問の正確性ベンチマーク
数学、複雑な物理、実行可能なアルゴリズム、誤前提への耐性、制約推論、指示遵守で Opus 5 と GPT-5.6 Luna を検証しました。
Model updates, integration guides, pricing breakdowns, and tool workflows for developers and teams.

数学、複雑な物理、実行可能なアルゴリズム、誤前提への耐性、制約推論、指示遵守で Opus 5 と GPT-5.6 Luna を検証しました。

Claude Opus 5とGPT-5.6-SOLを同一API・10問で検証。中核回答は両モデルとも10/10。コードの隠しテスト、全要件の完遂度、厳密なJSON形式への準拠を分けて評価します。

同一のOpenAI-compatible API、同じプロンプトとパラメータをいて、Claude Opus 5とClaude Fable 5を数学、物理、制約推論、コードレビュー、厳密なJSON出力、実験設計の各タスクで検証し、応答成功率、コンテンツフィルリング、latency、トークン数、リトライ結果を記録します。

精密な数学、物理モデリング、制約付き推論、統計的反誘導、コードレビュー、厳格な JSON、そして不確実性キャリブレーションの7項目で、Kimi K3 と Claude Opus 4.8 を比較。正答率、最初に見える回答、総遅延、reasoning Token 効率を検証する。

同一の Crazyrouter OpenAI-compatible API 上で、研究生レベルのマルコフ連鎖の初到達時間、減衰付き結合振動子の周波数応答、依存関係スケジューリングアルゴリズムを用いて kimi-k3 と claude-opus-4-8 を比較し、出力の完全性、正確性、レイテンシー、独立検証結果を記録する。

同一の OpenAI-compatible API と同一のプロンプト条件で、Kimi K3 と GPT-5.6-SOL を比較。モード停止時間、滑車の回転慣性を含む物理問題、依存クロージャを使う Python のプログラミング課題をテストし、正答性、途中切れ、遅延、ローカルでのコード検証を記録した。

数学、物理、Python、制約推論の4課題で Kimi K3 と Claude Fable 5 を比較し、finish_reason、reasoning tokens、遅延、コード実行結果を検証します。

Crazyrouter OpenAI-compatible API による実価格・性能テスト。確率状態機械、多段階物理、ログ集約、安定ルーティングの4課題を用いて、gpt-5.6-sol と gpt-5.6-terra の正確性、応答時間、completion tokens、reasoning tokens、ローカルでのコードテスト、および公開単価から算出したリクエスト単位の推定コストを比較します。

Crazyrouter の OpenAI 互換 API で glm-5.2 と claude-fable-5 を数学、物理、Canvas アニメーション課題で比較し、glm-5.2 の現在の 0.8 discount も実務目線で整理します。