Login
Crazyrouter Blog

Practical notes on AI models, API costs, and production workflows.

Model updates, integration guides, pricing breakdowns, and tool workflows for developers and teams.

GLM-5.3 vs GLM-5.2: benchmark khó bằng các lệnh gọi API thực tế
August 14, 202657 viewsTiếng ViệtComparison

GLM-5.3 vs GLM-5.2: benchmark khó bằng các lệnh gọi API thực tế

Sáu bài có thể kiểm chứng: GLM-5.3 dẫn 4/6 so với 2/6 ở lần đầu, nhưng GLM-5.2 thắng bài kiểm thử mã thực thi ẩn.

Claude Opus 5 và GPT-5.6 Luna: 18 bài kiểm chứng, không xếp hạng theo tốc độ
July 30, 2026116 viewsTiếng ViệtComparison

Claude Opus 5 và GPT-5.6 Luna: 18 bài kiểm chứng, không xếp hạng theo tốc độ

So sánh ưu tiên độ chính xác có thể kiểm chứng trên toán, vật lý phức tạp, thuật toán chạy được, phản biện tiền đề sai, ràng buộc và tuân thủ chỉ dẫn.

Claude Opus 5 và GPT-5.6-SOL: Kiểm thử độ chính xác qua 10 bài, cả hai đạt 10/10 ở câu trả lời cốt lõi
July 29, 2026146 viewsTiếng ViệtComparison

Claude Opus 5 và GPT-5.6-SOL: Kiểm thử độ chính xác qua 10 bài, cả hai đạt 10/10 ở câu trả lời cốt lõi

Claude Opus 5 và GPT-5.6-SOL được kiểm thử bằng 10 bài có thể xác minh qua cùng API Crazyrouter. Cả hai đạt 10/10 ở câu trả lời cốt lõi; bài viết tách riêng kiểm thử mã ẩn, mức hoàn thành yêu cầu và JSON nghiêm ngặt.

Claude Opus 5 vs Claude Fable 5: 7 tác vụ benchmark API thực tế và gợi ý định tuyến production
July 25, 2026174 viewsTiếng ViệtComparison

Claude Opus 5 vs Claude Fable 5: 7 tác vụ benchmark API thực tế và gợi ý định tuyến production

Trong cùng một OpenAI-compatible API, với cùng prompt và tham số, bài viết so sánh Claude Opus 5 và Claude Fable 5 qua các tác vụ toán học, vật lý, suy luận có ràng buộc, review code, strict JSON và thiết kế thí nghiệm; đồng thời ghi nhận tỷ lệ hoàn thành, filtering, latency, token và kết quả retry.

Kimi K3 đã đạt tới mức Claude Opus 4.8 chưa? Thử nghiệm API qua 7 chiều
July 19, 2026157 viewsTiếng ViệtComparison

Kimi K3 đã đạt tới mức Claude Opus 4.8 chưa? Thử nghiệm API qua 7 chiều

So sánh Kimi K3 và Claude Opus 4.8 qua bảy chiều: toán học chính xác, mô hình hóa vật lý, suy luận ràng buộc, chống dẫn dụ thống kê, rà soát mã, JSON nghiêm ngặt và hiệu chuẩn độ bất định; tập trung vào độ đúng, câu trả lời hiển thị đầu tiên, tổng độ trễ và hiệu quả reasoning token.

Kimi K3 so với Claude Opus 4.8: Thử nghiệm thực tế về toán, vật lý và lập trình cấp độ sau đại học
July 19, 2026167 viewsTiếng ViệtComparison

Kimi K3 so với Claude Opus 4.8: Thử nghiệm thực tế về toán, vật lý và lập trình cấp độ sau đại học

Trên cùng một Crazyrouter OpenAI-compatible API, so sánh kimi-k3 và claude-opus-4-8 bằng các bài toán cấp độ sau đại học về thời gian chạm đầu tiên của chuỗi Markov, phổ đáp ứng của dao động tử ghép có suy giảm và thuật toán lập lịch phụ thuộc, đồng thời ghi lại độ đầy đủ của đầu ra, độ chính xác, độ trễ và kết quả thẩm định độc lập.

Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trình
July 18, 2026201 viewsTiếng ViệtComparison

Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trình

Trong cùng một API tương thích OpenAI và cùng một prompt, tiến hành kiểm tra kimi-k3 và gpt-5.6-sol với các bài toán về thời gian dừng ở chế độ, vật lý có mô-men quán tính của ròng rọc và bài lập trình Python dùng closure lồng nhau, đồng thời ghi nhận độ chính xác, hiện tượng cắt ngắn, độ trễ và xác thực mã cục bộ.

Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?
July 17, 2026185 viewsTiếng ViệtComparison

Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?

Bài kiểm thử API thực tế trên toán học, vật lý, Python chạy được và suy luận ràng buộc, đồng thời đo finish_reason, reasoning tokens và độ trễ.