GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8
Bài kiểm thử thực tế qua Crazyrouter OpenAI-compatible API, so sánh glm-5.2 và claude-fable-5 trên bài toán toán học, vật lý và HTML Canvas animation, kèm ghi chú về discount 0.8 hiện tại của glm-5.2.

GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8#
Đây không phải là một bảng xếp hạng mô hình chung chung. Trong lần gọi API thực tế này, GLM-5.2 giải đúng các bài suy luận sau khi tăng ngân sách đầu ra, nhưng ở ngân sách thấp, phần nội dung hiển thị có thể rỗng. Claude Fable 5 ổn định hơn với ngân sách thấp và tốt hơn trong bài tạo HTML animation dài.

Vì sao bài test này đáng chú ý#
Bài test sử dụng API tương thích OpenAI của Crazyrouter thay vì giao diện chat. Điều này quan trọng vì kết quả không chỉ được đánh giá bằng chất lượng văn bản. Mỗi phản hồi đều được kiểm tra bằng metadata vận hành:
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
Các trường quan trọng là max_tokens, completion_tokens, reasoning_tokens, finish_reason, độ dài nội dung hiển thị, HTML được tạo có đóng đầy đủ hay không, và animation có thực sự chuyển động trong trình duyệt hay không.
Thiết kế bài test#
Benchmark cố ý kết hợp ba loại tác vụ:
| Tác vụ | Mục đích | Kết quả tham chiếu |
|---|---|---|
MATH-003 | Suy luận kỳ vọng dựa trên trạng thái | Số lần tung kỳ vọng cho đến HH = 6 |
PHYS-003 | Tính động lượng cộng với hạch toán năng lượng | V = 3.0 m/s, x ≈ 0.148 m |
CODE-003-ANIM | Tạo artifact dài có thể chạy được | HTML animation Canvas 800x500 hoàn chỉnh |
Hai tác vụ đầu đo năng lực suy luận. Tác vụ thứ ba đo xem mô hình có thể tạo ra một artifact hoàn chỉnh hay không, thay vì chỉ tạo một đoạn code có vẻ thuyết phục nhưng chưa đầy đủ.
Kết quả quan sát#
| Tác vụ | glm-5.2 | claude-fable-5 |
|---|---|---|
| Toán, ngân sách ban đầu | finish_reason=length, completion_tokens=1601, reasoning_tokens=1600, phần nội dung hiển thị rỗng | finish_reason=stop, đầy đủ và đúng |
| Toán, test lại | Đúng sau khi đặt max_tokens=3200 | Không cần test lại |
| Vật lý, ngân sách ban đầu | finish_reason=length, phần nội dung hiển thị rỗng | Đầy đủ và đúng |
| Vật lý, test lại | Đúng sau khi đặt max_tokens=8000 | Không cần test lại |
| Animation, ngân sách ban đầu | HTML hiển thị rỗng ở max_tokens=3200 | HTML một phần, bị cắt ngắn |
| Animation, test lại | Vẫn bị cắt ngắn ở max_tokens=8000 | HTML hoàn chỉnh; vượt qua kiểm tra trên trình duyệt |
Quan sát quan trọng nhất là GLM-5.2 không thất bại ở bản thân phần suy luận. Trong các tác vụ toán và vật lý, nó đưa ra đáp án đúng sau khi được cấp ngân sách đầu ra lớn hơn. Vấn đề nằm ở khả năng hiển thị và mức độ hoàn chỉnh: một request có thể trả về HTTP 200 trong khi nội dung người dùng nhìn thấy lại rỗng hoặc chưa hoàn chỉnh.
Với bài animation Canvas dài, khác biệt rõ hơn. GLM-5.2 tạo ra một đoạn HTML có thể nhìn thấy ở max_tokens=8000, nhưng dừng bên trong JavaScript và không đóng file. Claude Fable 5 hoàn thành HTML ở max_tokens=8000; kiểm tra trên trình duyệt cho thấy không có lỗi console, có canvas 800x500, có controls, có speed slider, và changedPixels=55090 sau 700 ms.
Góc nhìn chi phí#
Tại thời điểm viết bài, pricing API của Crazyrouter trả về discount: 0.8 cho glm-5.2. Vì vậy GLM-5.2 có lợi thế chi phí rõ ràng nếu bạn theo dõi kỹ reasoning_tokens, finish_reason và đặt max_tokens phù hợp.
Đây là đánh đổi thực tế:
| Loại workload | Phù hợp hơn theo bài test này |
|---|---|
| Suy luận ngắn với ngân sách đầu ra đủ lớn | GLM-5.2 có thể là một lựa chọn hiệu quả về chi phí |
| Phản hồi suy luận với ngân sách thấp | Claude Fable 5 ổn định hơn |
| Tạo code dài trong một file duy nhất | Claude Fable 5 mạnh hơn trong lần chạy này |
| Đánh giá batch có ghi metadata | GLM-5.2 dễ vận hành an toàn hơn |
Không nên xem hệ số 0.8 là mức giá phổ quát cố định. Đây là snapshot dữ liệu pricing từ Crazyrouter tại thời điểm xuất bản và cần được kiểm tra lại trước khi triển khai quy mô lớn.
Ghi chú tích hợp#
Request tối thiểu:
curl https://cn.crazyrouter.com/v1/chat/completions \
-H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Solve the HH expected-flips problem with state equations."
}
],
"temperature": 0.2,
"max_tokens": 3200
}'
Để so sánh Claude Fable 5, giữ nguyên payload và chỉ thay đổi model:
{
"model": "claude-fable-5"
}
Với các bài đánh giá theo kiểu production, hãy log cấu trúc này cho mọi request:
{
"model": "glm-5.2",
"max_tokens": 3200,
"finish_reason": "length",
"completion_tokens": 3200,
"reasoning_tokens": 3178,
"visible_content_chars": 0,
"html_closed": false,
"browser_validation": "not_run_incomplete_html"
}
API endpoint nên được giữ sạch. Không thêm tham số UTM vào https://cn.crazyrouter.com/v1. Chỉ dùng tracking cho liên kết bài viết hoặc đăng ký dành cho người đọc.
Bạn có thể chạy cùng kiểu request OpenAI-compatible trên Crazyrouter để so sánh hai mô hình bằng prompt thật của mình.
FAQ#
GLM-5.2 có thất bại ở các tác vụ suy luận không?#
Không. Trong lần chạy này, GLM-5.2 giải được bài toán sau khi đặt max_tokens=3200 và bài vật lý sau khi đặt max_tokens=8000. Vấn đề là ở ngân sách thấp hơn, phần lớn ngân sách bị tiêu thụ bởi reasoning tokens trước khi nội dung hiển thị xuất hiện.
Vì sao không tính HTTP 200 là thành công?#
Vì HTTP 200 chỉ có nghĩa là lệnh gọi API đã trả về. Một câu trả lời benchmark vẫn có thể không dùng được nếu finish_reason=length, nội dung hiển thị rỗng, hoặc code được tạo chưa hoàn chỉnh.
Vì sao đưa tác vụ animation vào bài test?#
Tạo code dài bộc lộ một kiểu lỗi khác. Một mô hình có thể viết nửa đầu của file rất thuyết phục nhưng vẫn thất bại nếu HTML hoặc JavaScript bị cắt ngang.
GLM-5.2 còn đáng để test không?#
Có. Hệ số discount 0.8 hiện tại khiến nó hấp dẫn với các workload mà bạn có thể cấp đủ ngân sách đầu ra và theo dõi metadata phản hồi.
Nên ghi lại những gì trong các lần so sánh sau?#
Tối thiểu: max_tokens, completion_tokens, reasoning_tokens, finish_reason, độ dài đầu ra hiển thị, mức độ hoàn chỉnh của artifact, và kiểm tra runtime.
Final verdict#
Kết luận thực tế: GLM-5.2 hấp dẫn về chi phí và có thể suy luận tốt, nhưng cần kiểm soát ngân sách đầu ra. Claude Fable 5 ổn định hơn cho câu trả lời ngắn và file HTML hoàn chỉnh trong lần thử này.





