Quay lại Blog
Tiếng ViệtComparison

GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8

Bài kiểm thử thực tế qua Crazyrouter OpenAI-compatible API, so sánh glm-5.2 và claude-fable-5 trên bài toán toán học, vật lý và HTML Canvas animation, kèm ghi chú về discount 0.8 hiện tại của glm-5.2.

C
Crazyrouter Team
6 tháng 7, 2026 / 325 lượt xem
Chia sẻ:
GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8

GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8#

Đây không phải là một bảng xếp hạng mô hình chung chung. Trong lần gọi API thực tế này, GLM-5.2 giải đúng các bài suy luận sau khi tăng ngân sách đầu ra, nhưng ở ngân sách thấp, phần nội dung hiển thị có thể rỗng. Claude Fable 5 ổn định hơn với ngân sách thấp và tốt hơn trong bài tạo HTML animation dài.

Benchmark GLM-5.2 vs Claude Fable 5

Vì sao bài test này đáng chú ý#

Bài test sử dụng API tương thích OpenAI của Crazyrouter thay vì giao diện chat. Điều này quan trọng vì kết quả không chỉ được đánh giá bằng chất lượng văn bản. Mỗi phản hồi đều được kiểm tra bằng metadata vận hành:

text
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06

Các trường quan trọng là max_tokens, completion_tokens, reasoning_tokens, finish_reason, độ dài nội dung hiển thị, HTML được tạo có đóng đầy đủ hay không, và animation có thực sự chuyển động trong trình duyệt hay không.

Thiết kế bài test#

Benchmark cố ý kết hợp ba loại tác vụ:

Tác vụMục đíchKết quả tham chiếu
MATH-003Suy luận kỳ vọng dựa trên trạng tháiSố lần tung kỳ vọng cho đến HH = 6
PHYS-003Tính động lượng cộng với hạch toán năng lượngV = 3.0 m/s, x ≈ 0.148 m
CODE-003-ANIMTạo artifact dài có thể chạy đượcHTML animation Canvas 800x500 hoàn chỉnh

Hai tác vụ đầu đo năng lực suy luận. Tác vụ thứ ba đo xem mô hình có thể tạo ra một artifact hoàn chỉnh hay không, thay vì chỉ tạo một đoạn code có vẻ thuyết phục nhưng chưa đầy đủ.

Kết quả quan sát#

Tác vụglm-5.2claude-fable-5
Toán, ngân sách ban đầufinish_reason=length, completion_tokens=1601, reasoning_tokens=1600, phần nội dung hiển thị rỗngfinish_reason=stop, đầy đủ và đúng
Toán, test lạiĐúng sau khi đặt max_tokens=3200Không cần test lại
Vật lý, ngân sách ban đầufinish_reason=length, phần nội dung hiển thị rỗngĐầy đủ và đúng
Vật lý, test lạiĐúng sau khi đặt max_tokens=8000Không cần test lại
Animation, ngân sách ban đầuHTML hiển thị rỗng ở max_tokens=3200HTML một phần, bị cắt ngắn
Animation, test lạiVẫn bị cắt ngắn ở max_tokens=8000HTML hoàn chỉnh; vượt qua kiểm tra trên trình duyệt

Quan sát quan trọng nhất là GLM-5.2 không thất bại ở bản thân phần suy luận. Trong các tác vụ toán và vật lý, nó đưa ra đáp án đúng sau khi được cấp ngân sách đầu ra lớn hơn. Vấn đề nằm ở khả năng hiển thị và mức độ hoàn chỉnh: một request có thể trả về HTTP 200 trong khi nội dung người dùng nhìn thấy lại rỗng hoặc chưa hoàn chỉnh.

Với bài animation Canvas dài, khác biệt rõ hơn. GLM-5.2 tạo ra một đoạn HTML có thể nhìn thấy ở max_tokens=8000, nhưng dừng bên trong JavaScript và không đóng file. Claude Fable 5 hoàn thành HTML ở max_tokens=8000; kiểm tra trên trình duyệt cho thấy không có lỗi console, có canvas 800x500, có controls, có speed slider, và changedPixels=55090 sau 700 ms.

Góc nhìn chi phí#

Tại thời điểm viết bài, pricing API của Crazyrouter trả về discount: 0.8 cho glm-5.2. Vì vậy GLM-5.2 có lợi thế chi phí rõ ràng nếu bạn theo dõi kỹ reasoning_tokens, finish_reason và đặt max_tokens phù hợp.

Đây là đánh đổi thực tế:

Loại workloadPhù hợp hơn theo bài test này
Suy luận ngắn với ngân sách đầu ra đủ lớnGLM-5.2 có thể là một lựa chọn hiệu quả về chi phí
Phản hồi suy luận với ngân sách thấpClaude Fable 5 ổn định hơn
Tạo code dài trong một file duy nhấtClaude Fable 5 mạnh hơn trong lần chạy này
Đánh giá batch có ghi metadataGLM-5.2 dễ vận hành an toàn hơn

Không nên xem hệ số 0.8 là mức giá phổ quát cố định. Đây là snapshot dữ liệu pricing từ Crazyrouter tại thời điểm xuất bản và cần được kiểm tra lại trước khi triển khai quy mô lớn.

Ghi chú tích hợp#

Request tối thiểu:

bash
curl https://cn.crazyrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "Solve the HH expected-flips problem with state equations."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 3200
  }'

Để so sánh Claude Fable 5, giữ nguyên payload và chỉ thay đổi model:

json
{
  "model": "claude-fable-5"
}

Với các bài đánh giá theo kiểu production, hãy log cấu trúc này cho mọi request:

json
{
  "model": "glm-5.2",
  "max_tokens": 3200,
  "finish_reason": "length",
  "completion_tokens": 3200,
  "reasoning_tokens": 3178,
  "visible_content_chars": 0,
  "html_closed": false,
  "browser_validation": "not_run_incomplete_html"
}

API endpoint nên được giữ sạch. Không thêm tham số UTM vào https://cn.crazyrouter.com/v1. Chỉ dùng tracking cho liên kết bài viết hoặc đăng ký dành cho người đọc.

Bạn có thể chạy cùng kiểu request OpenAI-compatible trên Crazyrouter để so sánh hai mô hình bằng prompt thật của mình.

https://crazyrouter.com/register?utm_source=crazyrouter_blog&utm_medium=article&utm_campaign=glm52_fable5_budget_cost_20260706&utm_content=crazyrouter_blog_glm-52-vs-claude-fable-5-output-budget-cost-vi_20260706__bottom&utm_term=glm-5.2+claude+fable+5+benchmark

FAQ#

GLM-5.2 có thất bại ở các tác vụ suy luận không?#

Không. Trong lần chạy này, GLM-5.2 giải được bài toán sau khi đặt max_tokens=3200 và bài vật lý sau khi đặt max_tokens=8000. Vấn đề là ở ngân sách thấp hơn, phần lớn ngân sách bị tiêu thụ bởi reasoning tokens trước khi nội dung hiển thị xuất hiện.

Vì sao không tính HTTP 200 là thành công?#

Vì HTTP 200 chỉ có nghĩa là lệnh gọi API đã trả về. Một câu trả lời benchmark vẫn có thể không dùng được nếu finish_reason=length, nội dung hiển thị rỗng, hoặc code được tạo chưa hoàn chỉnh.

Vì sao đưa tác vụ animation vào bài test?#

Tạo code dài bộc lộ một kiểu lỗi khác. Một mô hình có thể viết nửa đầu của file rất thuyết phục nhưng vẫn thất bại nếu HTML hoặc JavaScript bị cắt ngang.

GLM-5.2 còn đáng để test không?#

Có. Hệ số discount 0.8 hiện tại khiến nó hấp dẫn với các workload mà bạn có thể cấp đủ ngân sách đầu ra và theo dõi metadata phản hồi.

Nên ghi lại những gì trong các lần so sánh sau?#

Tối thiểu: max_tokens, completion_tokens, reasoning_tokens, finish_reason, độ dài đầu ra hiển thị, mức độ hoàn chỉnh của artifact, và kiểm tra runtime.

Final verdict#

Kết luận thực tế: GLM-5.2 hấp dẫn về chi phí và có thể suy luận tốt, nhưng cần kiểm soát ngân sách đầu ra. Claude Fable 5 ổn định hơn cho câu trả lời ngắn và file HTML hoàn chỉnh trong lần thử này.

Implementation Guides

Topics

Comparison

Bài viết liên quan

Tại sao nên chọn Crazyrouter thay vì OpenRouter? Ba khác biệt thực sự đáng kểComparison

Tại sao nên chọn Crazyrouter thay vì OpenRouter? Ba khác biệt thực sự đáng kể

Cùng các model Claude, GPT, Gemini nhưng rẻ hơn giá niêm yết 35–45%, nạp tiền không mất phí; không chia bậc giới hạn tốc độ, RPM tùy chỉnh theo nhu cầu; và có nhân viên hỗ trợ thật theo dõi từng lỗi đến khi xử lý xong. So sánh trực tiếp kèm giá cụ thể.

17 thg 9
Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trìnhComparison

Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trình

Trong cùng một API tương thích OpenAI và cùng một prompt, tiến hành kiểm tra kimi-k3 và gpt-5.6-sol với các bài toán về thời gian dừng ở chế độ, vật lý có mô-men quán tính của ròng rọc và bài lập trình Python dùng closure lồng nhau, đồng thời ghi nhận độ chính xác, hiện tượng cắt ngắn, độ trễ và xác thực mã cục bộ.

18 thg 7
Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?Comparison

Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?

Bài kiểm thử API thực tế trên toán học, vật lý, Python chạy được và suy luận ràng buộc, đồng thời đo finish_reason, reasoning tokens và độ trễ.

17 thg 7
Kimi K3 so với Claude Opus 4.8: Thử nghiệm thực tế về toán, vật lý và lập trình cấp độ sau đại họcComparison

Kimi K3 so với Claude Opus 4.8: Thử nghiệm thực tế về toán, vật lý và lập trình cấp độ sau đại học

Trên cùng một Crazyrouter OpenAI-compatible API, so sánh kimi-k3 và claude-opus-4-8 bằng các bài toán cấp độ sau đại học về thời gian chạm đầu tiên của chuỗi Markov, phổ đáp ứng của dao động tử ghép có suy giảm và thuật toán lập lịch phụ thuộc, đồng thời ghi lại độ đầy đủ của đầu ra, độ chính xác, độ trễ và kết quả thẩm định độc lập.

19 thg 7
Claude Opus 5 vs Claude Fable 5: 7 tác vụ benchmark API thực tế và gợi ý định tuyến productionComparison

Claude Opus 5 vs Claude Fable 5: 7 tác vụ benchmark API thực tế và gợi ý định tuyến production

Trong cùng một OpenAI-compatible API, với cùng prompt và tham số, bài viết so sánh Claude Opus 5 và Claude Fable 5 qua các tác vụ toán học, vật lý, suy luận có ràng buộc, review code, strict JSON và thiết kế thí nghiệm; đồng thời ghi nhận tỷ lệ hoàn thành, filtering, latency, token và kết quả retry.

25 thg 7
Kimi K3 đã đạt tới mức Claude Opus 4.8 chưa? Thử nghiệm API qua 7 chiềuComparison

Kimi K3 đã đạt tới mức Claude Opus 4.8 chưa? Thử nghiệm API qua 7 chiều

So sánh Kimi K3 và Claude Opus 4.8 qua bảy chiều: toán học chính xác, mô hình hóa vật lý, suy luận ràng buộc, chống dẫn dụ thống kê, rà soát mã, JSON nghiêm ngặt và hiệu chuẩn độ bất định; tập trung vào độ đúng, câu trả lời hiển thị đầu tiên, tổng độ trễ và hiệu quả reasoning token.

19 thg 7