GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数
Crazyrouter の OpenAI 互換 API で glm-5.2 と claude-fable-5 を数学、物理、Canvas アニメーション課題で比較し、glm-5.2 の現在の 0.8 discount も実務目線で整理します。

GLM-5.2 と Claude Fable 5 を実測比較:出力予算、reasoning_tokens、そして 0.8 価格係数#
この比較は「どちらが絶対に強いか」を決める記事ではありません。実際の API 呼び出しで、GLM-5.2 は出力予算を増やすと数学・物理の推論を正しく返しました。一方で Claude Fable 5 は低い予算でも短く安定し、長い HTML アニメーションではより確実に完走しました。

このテストを見る理由#
このテストでは、チャット UI ではなく Crazyrouter の OpenAI 互換 API を使用しました。これは重要です。なぜなら、結果は文章品質だけで判定したわけではないからです。各レスポンスは、運用上のメタデータと照合しました。
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
重要なフィールドは、max_tokens、completion_tokens、reasoning_tokens、finish_reason、表示されるコンテンツの長さ、生成された HTML が閉じられているか、そしてアニメーションが実際にブラウザ上で動くかどうかでした。
テストした課題#
ベンチマークでは、意図的に 3 種類のタスクを混在させました。
| タスク | 目的 | 参照結果 |
|---|---|---|
MATH-003 | 状態ベースの期待値推論 | HH が出るまでの期待回数 = 6 |
PHYS-003 | 運動量とエネルギー収支 | V = 3.0 m/s, x ≈ 0.148 m |
CODE-003-ANIM | 実行可能な長い成果物の生成 | 完全な 800x500 Canvas アニメーション HTML |
最初の 2 つのタスクは推論力を測定しました。3 つ目のタスクは、モデルが説得力のある部分的なコードブロックではなく、完全な成果物を生成できるかを測定しました。
観測結果#
| タスク | glm-5.2 | claude-fable-5 |
|---|---|---|
| 数学、初回予算 | finish_reason=length, completion_tokens=1601, reasoning_tokens=1600, 表示される本文は空 | finish_reason=stop, 完全かつ正解 |
| 数学、再テスト | max_tokens=3200 で正解 | 再テスト不要 |
| 物理、初回予算 | finish_reason=length, 表示される本文は空 | 完全かつ正解 |
| 物理、再テスト | max_tokens=8000 で正解 | 再テスト不要 |
| アニメーション、初回予算 | max_tokens=3200 で表示される HTML は空 | 部分的な HTML、途中で切断 |
| アニメーション、再テスト | max_tokens=8000 でも途中で切断 | 完全な HTML。ブラウザ検証に合格 |
最も重要な観測結果は、GLM-5.2 が推論そのものに失敗していたわけではない、という点です。数学と物理のタスクでは、出力予算を増やすと正しい答えを生成しました。問題は可視性と完了性でした。リクエストは HTTP 200 を返していても、ユーザーが目にするコンテンツが空、または不完全な場合がありました。
長い Canvas アニメーションでは、差はより明確でした。GLM-5.2 は max_tokens=8000 で表示可能な HTML 断片を生成しましたが、JavaScript の途中で停止し、ファイルを閉じませんでした。Claude Fable 5 は max_tokens=8000 で HTML を完了しました。ブラウザ検証では、コンソールエラーなし、800x500 の canvas、コントロール、速度スライダーが確認され、700 ms 後の changedPixels=55090 も確認されました。
費用対効果の見方#
執筆時点で Crazyrouter の pricing API は glm-5.2 に discount: 0.8 を返しています。つまり、reasoning_tokens と max_tokens をきちんと監視できる用途では、GLM-5.2 はかなり費用対効果の高い選択肢になります。
実務上のトレードオフは次のとおりです。
| ワークロード | このテストでより適していたモデル |
|---|---|
| 十分な出力予算を確保した短い推論 | GLM-5.2 は費用対効果の高い選択肢になり得る |
| 低予算の推論レスポンス | Claude Fable 5 のほうが安定していた |
| 長い単一ファイルのコード生成 | この実行では Claude Fable 5 のほうが強かった |
| メタデータを記録するバッチ評価 | GLM-5.2 は安全に運用しやすくなる |
0.8 の乗数を永続的かつ普遍的な価格として扱わないでください。これは公開時点における Crazyrouter の価格データのスナップショットであり、大規模デプロイ前には再確認する必要があります。
実装時の注意#
最小リクエスト:
curl https://cn.crazyrouter.com/v1/chat/completions \
-H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Solve the HH expected-flips problem with state equations."
}
],
"temperature": 0.2,
"max_tokens": 3200
}'
Claude Fable 5 と比較するには、同じペイロードを維持し、モデルだけを変更します。
{
"model": "claude-fable-5"
}
本番運用に近い評価では、すべてのリクエストで次の形式を記録します。
{
"model": "glm-5.2",
"max_tokens": 3200,
"finish_reason": "length",
"completion_tokens": 3200,
"reasoning_tokens": 3178,
"visible_content_chars": 0,
"html_closed": false,
"browser_validation": "not_run_incomplete_html"
}
API エンドポイントはクリーンに保つべきです。https://cn.crazyrouter.com/v1 に UTM パラメータを追加しないでください。トラッキングは、人間が見る記事リンクや登録リンクにのみ使用します。
同じ OpenAI 互換リクエストを Crazyrouter で流し、自分のプロンプトで両モデルを比較できます。
FAQ#
GLM-5.2 は推論タスクに失敗しましたか?#
いいえ。この実行では、GLM-5.2 は max_tokens=3200 で数学タスクを解き、max_tokens=8000 で物理タスクを解きました。問題は、低い予算では表示されるコンテンツが現れる前に、その大部分が reasoning tokens に消費されていたことです。
HTTP 200 を成功として採点しないのはなぜですか?#
HTTP 200 は API 呼び出しが返ってきたことだけを意味するからです。finish_reason=length、表示されるコンテンツが空、または生成されたコードが不完全であれば、ベンチマークの回答は依然として使えない可能性があります。
なぜアニメーションタスクを含めたのですか?#
長いコード生成では、別の失敗モードが露出します。モデルはファイルの前半を説得力のある形で書けても、HTML や JavaScript が途中で切れていれば失敗です。
GLM-5.2 はまだテストする価値がありますか?#
はい。現在の 0.8 割引乗数により、十分な出力予算を割り当て、レスポンスメタデータを監視できるワークロードでは魅力的です。
今後の比較では何を記録すべきですか?#
最低限、max_tokens、completion_tokens、reasoning_tokens、finish_reason、表示される出力の長さ、成果物の完全性、実行時検証を記録すべきです。
Final verdict#
結論は単純ではありません。GLM-5.2 はコスト面で魅力があり推論も可能ですが、出力予算の管理が必要です。Claude Fable 5 は短い回答と完成した単一 HTML 生成で安定していました。





