Login
Back to Blog
Tiếng ViệtComparison

GLM-5.3 vs GLM-5.2: benchmark khó bằng các lệnh gọi API thực tế

Sáu bài có thể kiểm chứng: GLM-5.3 dẫn 4/6 so với 2/6 ở lần đầu, nhưng GLM-5.2 thắng bài kiểm thử mã thực thi ẩn.

C
Crazyrouter Team
August 14, 2026 / 1 views
Share:
GLM-5.3 vs GLM-5.2: benchmark khó bằng các lệnh gọi API thực tế

GLM-5.3 vs GLM-5.2: benchmark khó bằng các lệnh gọi API thực tế#

Trong vòng kiểm thử cơ bản, GLM-5.3 thường trả được nội dung nhìn thấy trong giới hạn đầu ra tốt hơn. Lần này độ khó được tăng lên với sáu bài có thể kiểm chứng khách quan: toán cực khó, phân tích nhân quả, suy luận ràng buộc, JSON lồng nhau, vật lý nhiều giai đoạn và mã tối ưu có thể thực thi.

Kết quả lần trả lời đầu là GLM-5.3 đạt 4/6, GLM-5.2 đạt 2/6. Tuy nhiên, GLM-5.2 lại tạo ra chương trình tối ưu duy nhất vượt qua toàn bộ kiểm thử ẩn.

Ma trận kết quả lần trả lời đầu

Môi trường kiểm thử#

TrườngGiá trị
Base URLhttps://cn.crazyrouter.com
EndpointPOST /v1/chat/completions
Modelglm-5.3, glm-5.2
Temperature0.2
Công cụ và webtắt
Chấm điểmchỉ lần trả lời đầu; chạy lại chỉ để chẩn đoán

Trước khi chạy, GET https://cn.crazyrouter.com/v1/models xác nhận cả hai ID chính xác đều tồn tại. Cả 12 phản hồi đầu tiên đều trả đúng model đã yêu cầu.

Kết quả#

BàiNgân sáchGLM-5.3GLM-5.2
Coupon collector xác suất không đều9.000length, nội dung rỗnglength, nội dung rỗng
Nghịch lý Simpson và nhân quả6.000đạtlength, nội dung rỗng
Lõi UNSAT tối thiểu5.000đạt, JSON nghiêm ngặtlength, nội dung rỗng
JSON sự cố theo khu vực4.000đạtđạt
Ròng rọc, dây chùng, ma sát, lò xo14.000đạtlength, nội dung rỗng
Tối ưu kế hoạch có phụ thuộc16.000length, nội dung rỗngqua kiểm thử ẩn

Bài toán cực khó làm cả hai model thất bại#

Bốn loại coupon có xác suất 1/2, 1/4, 1/8, 1/8. Bài yêu cầu hai kết quả chính xác bằng nguyên lý bao hàm-loại trừ:

text
E[T] = 1339/105 ≈ 12.752380952
P(T<=8) = 46179/131072 ≈ 0.352317810

Cả hai model dùng hết 9.000 reasoning tokens nhưng không trả nội dung nhìn thấy. GLM-5.3 vẫn rỗng khi tăng lên 20k; yêu cầu 20k của GLM-5.2 vượt quá thời gian đọc 420 giây.

Điều này cho thấy chỉ tăng max_tokens không phải là cách sửa tổng quát. Hệ thống cần kiểm tra đồng thời finish reason, độ dài nội dung và timeout.

Điểm mạnh của GLM-5.3#

Ở bài Simpson, model xác định đúng sự đảo chiều:

text
Sỏi nhỏ: A 81/87 > B 234/270
Sỏi lớn: A 192/263 > B 55/80
Tổng thô: A 273/350 < B 289/350
Chuẩn hóa 50/50: A=0.8305, B=0.7771

GLM-5.3 cũng phân biệt chuẩn hóa với kết luận nhân quả, nhắc đến ngẫu nhiên hóa, nhiễu chưa đo, positivity và khoảng tin cậy.

Trong bài lõi UNSAT, model trả đúng một JSON với [1,2,3] và chứng minh C, D bị ép vào cùng vị trí. Ở bài vật lý nhiều giai đoạn, model đạt đủ các giá trị a≈0.847, v1≈1.59, v2≈1.18, x≈0.0835.

Điểm GLM-5.2 thắng#

Bài mã yêu cầu optimize_release_plan xử lý phụ thuộc bắc cầu, giới hạn theo ngày, tối đa value, tối thiểu risk, phân xử từ điển, tham chiếu sai và chu trình.

Tệp Python gốc của GLM-5.2 vượt qua bộ kiểm thử ẩn mà không chỉnh sửa. GLM-5.3 không có nội dung ở 16k. Khi chạy lại với 24k, nó sinh được mã nhưng chọn phương án value 24 thay vì tối ưu đúng là 29.

Vì vậy mã do model sinh ra phải được chạy thật. Độ dài mã và cách giải thích không thay thế được kiểm thử.

Ví dụ gọi API#

python
import os, requests

r = requests.post(
    "https://cn.crazyrouter.com/v1/chat/completions",
    headers={"Authorization": f"Bearer {os.environ['CRAZYROUTER_API_KEY']}"},
    json={"model": "glm-5.3", "messages": [{"role": "user", "content": "Bài nghiệm thu thực tế"}], "temperature": 0.2, "max_tokens": 6000},
    timeout=600,
)
choice = r.json()["choices"][0]
assert choice["finish_reason"] == "stop"
assert choice["message"]["content"].strip()

Khuyến nghị vận hành#

  1. Trong lần này, GLM-5.3 phù hợp hơn cho nhân quả, ràng buộc và suy luận vật lý nhiều bước.
  2. Giữ GLM-5.2 trong nhóm ứng viên cho mã thực thi và chạy cùng bộ kiểm thử.
  3. Xem HTTP 200 + content rỗng là lỗi nghiệp vụ.
  4. Parse JSON và kiểm tra schema bắt buộc.
  5. Tách tỷ lệ thành công lần đầu khỏi tỷ lệ thành công sau retry.

Kết luận#

GLM-5.3 dẫn về độ phủ lần đầu với 4/6 so với 2/6. GLM-5.2 tạo ra thuật toán thực thi tốt nhất. Kết luận phù hợp cho production là định tuyến theo loại nhiệm vụ cùng kiểm định nghiêm ngặt, không phải tự động thay thế model cũ.

Chạy hai model qua API tương thích OpenAI của Crazyrouter

Implementation Guides

Topics

Comparison

Related Posts

Claude Opus 5 vs Claude Fable 5: 7 tác vụ benchmark API thực tế và gợi ý định tuyến productionComparison

Claude Opus 5 vs Claude Fable 5: 7 tác vụ benchmark API thực tế và gợi ý định tuyến production

Trong cùng một OpenAI-compatible API, với cùng prompt và tham số, bài viết so sánh Claude Opus 5 và Claude Fable 5 qua các tác vụ toán học, vật lý, suy luận có ràng buộc, review code, strict JSON và thiết kế thí nghiệm; đồng thời ghi nhận tỷ lệ hoàn thành, filtering, latency, token và kết quả retry.

Jul 25
Claude Opus 5 và GPT-5.6-SOL: Kiểm thử độ chính xác qua 10 bài, cả hai đạt 10/10 ở câu trả lời cốt lõiComparison

Claude Opus 5 và GPT-5.6-SOL: Kiểm thử độ chính xác qua 10 bài, cả hai đạt 10/10 ở câu trả lời cốt lõi

Claude Opus 5 và GPT-5.6-SOL được kiểm thử bằng 10 bài có thể xác minh qua cùng API Crazyrouter. Cả hai đạt 10/10 ở câu trả lời cốt lõi; bài viết tách riêng kiểm thử mã ẩn, mức hoàn thành yêu cầu và JSON nghiêm ngặt.

Jul 29
Claude Opus 5 và GPT-5.6 Luna: 18 bài kiểm chứng, không xếp hạng theo tốc độComparison

Claude Opus 5 và GPT-5.6 Luna: 18 bài kiểm chứng, không xếp hạng theo tốc độ

So sánh ưu tiên độ chính xác có thể kiểm chứng trên toán, vật lý phức tạp, thuật toán chạy được, phản biện tiền đề sai, ràng buộc và tuân thủ chỉ dẫn.

Jul 30
Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trìnhComparison

Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trình

Trong cùng một API tương thích OpenAI và cùng một prompt, tiến hành kiểm tra kimi-k3 và gpt-5.6-sol với các bài toán về thời gian dừng ở chế độ, vật lý có mô-men quán tính của ròng rọc và bài lập trình Python dùng closure lồng nhau, đồng thời ghi nhận độ chính xác, hiện tượng cắt ngắn, độ trễ và xác thực mã cục bộ.

Jul 18
GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8Comparison

GLM-5.2 vs Claude Fable 5: ngân sách đầu ra, reasoning_tokens và mức discount 0.8

Bài kiểm thử thực tế qua Crazyrouter OpenAI-compatible API, so sánh glm-5.2 và claude-fable-5 trên bài toán toán học, vật lý và HTML Canvas animation, kèm ghi chú về discount 0.8 hiện tại của glm-5.2.

Jul 6
Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?Comparison

Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?

Bài kiểm thử API thực tế trên toán học, vật lý, Python chạy được và suy luận ràng buộc, đồng thời đo finish_reason, reasoning tokens và độ trễ.

Jul 17