ブログに戻る
日本語Comparison

GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数

Crazyrouter の OpenAI 互換 API で glm-5.2 と claude-fable-5 を数学、物理、Canvas アニメーション課題で比較し、glm-5.2 の現在の 0.8 discount も実務目線で整理します。

C
Crazyrouter Team
2026年7月6日 / 342 回閲覧
共有:
GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数

GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数#

この比較は「どちらが絶対に強いか」を決める記事ではありません。実際の API 呼び出しで、GLM-5.2 は出力予算を増やすと数学・物理の推論を正しく返しました。一方で Claude Fable 5 は低い予算でも短く安定し、長い HTML アニメーションではより確実に完走しました。

GLM-5.2 と Claude Fable 5 のベンチマーク

このテストを見る理由#

このテストでは、チャット UI ではなく Crazyrouter の OpenAI 互換 API を使用しました。これは重要です。なぜなら、結果は文章品質だけで判定したわけではないからです。各レスポンスは、運用上のメタデータと照合しました。

text
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06

重要なフィールドは、max_tokens、completion_tokens、reasoning_tokens、finish_reason、表示されるコンテンツの長さ、生成された HTML が閉じられているか、そしてアニメーションが実際にブラウザ上で動くかどうかでした。

テストした課題#

ベンチマークでは、意図的に 3 種類のタスクを混在させました。

タスク目的参照結果
MATH-003状態ベースの期待値推論HH が出るまでの期待回数 = 6
PHYS-003運動量とエネルギー収支V = 3.0 m/s, x ≈ 0.148 m
CODE-003-ANIM実行可能な長い成果物の生成完全な 800x500 Canvas アニメーション HTML

最初の 2 つのタスクは推論力を測定しました。3 つ目のタスクは、モデルが説得力のある部分的なコードブロックではなく、完全な成果物を生成できるかを測定しました。

観測結果#

タスクglm-5.2claude-fable-5
数学、初回予算finish_reason=length, completion_tokens=1601, reasoning_tokens=1600, 表示される本文は空finish_reason=stop, 完全かつ正解
数学、再テストmax_tokens=3200 で正解再テスト不要
物理、初回予算finish_reason=length, 表示される本文は空完全かつ正解
物理、再テストmax_tokens=8000 で正解再テスト不要
アニメーション、初回予算max_tokens=3200 で表示される HTML は空部分的な HTML、途中で切断
アニメーション、再テストmax_tokens=8000 でも途中で切断完全な HTML。ブラウザ検証に合格

最も重要な観測結果は、GLM-5.2 が推論そのものに失敗していたわけではない、という点です。数学と物理のタスクでは、出力予算を増やすと正しい答えを生成しました。問題は可視性と完了性でした。リクエストは HTTP 200 を返していても、ユーザーが目にするコンテンツが空、または不完全な場合がありました。

長い Canvas アニメーションでは、差はより明確でした。GLM-5.2 は max_tokens=8000 で表示可能な HTML 断片を生成しましたが、JavaScript の途中で停止し、ファイルを閉じませんでした。Claude Fable 5 は max_tokens=8000 で HTML を完了しました。ブラウザ検証では、コンソールエラーなし、800x500 の canvas、コントロール、速度スライダーが確認され、700 ms 後の changedPixels=55090 も確認されました。

費用対効果の見方#

執筆時点で Crazyrouter の pricing API は glm-5.2 に discount: 0.8 を返しています。つまり、reasoning_tokens と max_tokens をきちんと監視できる用途では、GLM-5.2 はかなり費用対効果の高い選択肢になります。

実務上のトレードオフは次のとおりです。

ワークロードこのテストでより適していたモデル
十分な出力予算を確保した短い推論GLM-5.2 は費用対効果の高い選択肢になり得る
低予算の推論レスポンスClaude Fable 5 のほうが安定していた
長い単一ファイルのコード生成この実行では Claude Fable 5 のほうが強かった
メタデータを記録するバッチ評価GLM-5.2 は安全に運用しやすくなる

0.8 の乗数を永続的かつ普遍的な価格として扱わないでください。これは公開時点における Crazyrouter の価格データのスナップショットであり、大規模デプロイ前には再確認する必要があります。

実装時の注意#

最小リクエスト:

bash
curl https://cn.crazyrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "Solve the HH expected-flips problem with state equations."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 3200
  }'

Claude Fable 5 と比較するには、同じペイロードを維持し、モデルだけを変更します。

json
{
  "model": "claude-fable-5"
}

本番運用に近い評価では、すべてのリクエストで次の形式を記録します。

json
{
  "model": "glm-5.2",
  "max_tokens": 3200,
  "finish_reason": "length",
  "completion_tokens": 3200,
  "reasoning_tokens": 3178,
  "visible_content_chars": 0,
  "html_closed": false,
  "browser_validation": "not_run_incomplete_html"
}

API エンドポイントはクリーンに保つべきです。https://cn.crazyrouter.com/v1 に UTM パラメータを追加しないでください。トラッキングは、人間が見る記事リンクや登録リンクにのみ使用します。

同じ OpenAI 互換リクエストを Crazyrouter で流し、自分のプロンプトで両モデルを比較できます。

https://crazyrouter.com/register?utm_source=crazyrouter_blog&utm_medium=article&utm_campaign=glm52_fable5_budget_cost_20260706&utm_content=crazyrouter_blog_glm-52-vs-claude-fable-5-output-budget-cost-ja_20260706__bottom&utm_term=glm-5.2+claude+fable+5+benchmark

FAQ#

GLM-5.2 は推論タスクに失敗しましたか?#

いいえ。この実行では、GLM-5.2 は max_tokens=3200 で数学タスクを解き、max_tokens=8000 で物理タスクを解きました。問題は、低い予算では表示されるコンテンツが現れる前に、その大部分が reasoning tokens に消費されていたことです。

HTTP 200 を成功として採点しないのはなぜですか?#

HTTP 200 は API 呼び出しが返ってきたことだけを意味するからです。finish_reason=length、表示されるコンテンツが空、または生成されたコードが不完全であれば、ベンチマークの回答は依然として使えない可能性があります。

なぜアニメーションタスクを含めたのですか?#

長いコード生成では、別の失敗モードが露出します。モデルはファイルの前半を説得力のある形で書けても、HTML や JavaScript が途中で切れていれば失敗です。

GLM-5.2 はまだテストする価値がありますか?#

はい。現在の 0.8 割引乗数により、十分な出力予算を割り当て、レスポンスメタデータを監視できるワークロードでは魅力的です。

今後の比較では何を記録すべきですか?#

最低限、max_tokens、completion_tokens、reasoning_tokens、finish_reason、表示される出力の長さ、成果物の完全性、実行時検証を記録すべきです。

Final verdict#

結論は単純ではありません。GLM-5.2 はコスト面で魅力があり推論も可能ですが、出力予算の管理が必要です。Claude Fable 5 は短い回答と完成した単一 HTML 生成で安定していました。

Implementation Guides

Topics

Comparison

関連記事

Claude Opus 5 vs Claude Fable 5:7つの実APIベンチマークと本番ルーティングの提案Comparison

Claude Opus 5 vs Claude Fable 5:7つの実APIベンチマークと本番ルーティングの提案

同一のOpenAI-compatible API、同じプロンプトとパラメータをいて、Claude Opus 5とClaude Fable 5を数学、物理、制約推論、コードレビュー、厳密なJSON出力、実験設計の各タスクで検証し、応答成功率、コンテンツフィルリング、latency、トークン数、リトライ結果を記録します。

7月25日
GPT-4.1 Mini vs GPT-4.1 Nano Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較Comparison

GPT-4.1 Mini vs GPT-4.1 Nano Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較

gpt-4.1-mini と gpt-4.1-nano を Vision API ワークロードで比較する実運用向けベンチマーク。実際の画像認識精度、latency、tail latency、成功画像あたりのコスト、usage signals、failure modes、production routing を整理します。

6月22日
Qwen3 VL Flash vs GPT-4.1 Nano Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較Comparison

Qwen3 VL Flash vs GPT-4.1 Nano Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較

qwen3-vl-flash と gpt-4.1-nano を Vision API ワークロードで比較する実運用向けベンチマーク。実際の画像認識精度、latency、tail latency、成功画像あたりのコスト、usage signals、failure modes、production routing を整理します。

6月22日
Qwen3 VL Flash vs Qwen3 VL Plus Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較Comparison

Qwen3 VL Flash vs Qwen3 VL Plus Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較

qwen3-vl-flash と qwen3-vl-plus を Vision API ワークロードで比較する実運用向けベンチマーク。実際の画像認識精度、latency、tail latency、成功画像あたりのコスト、usage signals、failure modes、production routing を整理します。

6月22日
Gemini 2.5 Flash Lite vs Qwen3 VL Plus Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較Comparison

Gemini 2.5 Flash Lite vs Qwen3 VL Plus Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較

gemini-2.5-flash-lite と qwen3-vl-plus を Vision API ワークロードで比較する実運用向けベンチマーク。実際の画像認識精度、latency、tail latency、成功画像あたりのコスト、usage signals、failure modes、production routing を整理します。

6月22日
Gemini 2.5 Flash vs Qwen3 VL Flash Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較Comparison

Gemini 2.5 Flash vs Qwen3 VL Flash Vision API ベンチマーク 2026:実運用目線の画像理解モデル比較

gemini-2.5-flash と qwen3-vl-flash を Vision API ワークロードで比較する実運用向けベンチマーク。実際の画像認識精度、latency、tail latency、成功画像あたりのコスト、usage signals、failure modes、production routing を整理します。

6月22日