Login
Back to Blog
Tiếng ViệtComparison

Claude Opus 5 và GPT-5.6 Luna: 18 bài kiểm chứng, không xếp hạng theo tốc độ

So sánh ưu tiên độ chính xác có thể kiểm chứng trên toán, vật lý phức tạp, thuật toán chạy được, phản biện tiền đề sai, ràng buộc và tuân thủ chỉ dẫn.

C
Crazyrouter Team
July 30, 2026 / 3 views
Share:
Claude Opus 5 và GPT-5.6 Luna: 18 bài kiểm chứng, không xếp hạng theo tốc độ

Claude Opus 5 và GPT-5.6 Luna: 18 bài kiểm chứng, không xếp hạng theo tốc độ

Kết luận nhanh#

Ở vòng khó, Claude Opus 5 đạt 17/18 (94,4%), còn GPT-5.6 Luna đạt 16/18 (88,9%). Chênh lệch một bài trong mẫu này không chứng minh Opus mạnh hơn toàn diện. Điều đáng chú ý là kiểu lỗi: Opus bàn giao thành công cả ba tệp thuật toán nhưng phá vỡ hợp đồng JSON nghiêm ngặt; Luna làm đúng cả ba yêu cầu định dạng nhưng hai tệp Python bị lỗi ngay khi import.

Vì sao cần tăng độ khó#

Vòng đầu tám bài không tạo khác biệt: cả hai đều 8/8. Vòng hai vì thế tăng lên 18 bài, gồm hard, harder và extreme trong sáu nhóm. Bài kiểm tra yêu cầu phân số chính xác, mô hình vật lý nhiều giai đoạn, tệp mã hoàn chỉnh, khả năng bác bỏ tiền đề sai, nghiệm logic duy nhất và kỷ luật đầu ra đến từng ký tự. Câu trả lời không được điểm chỉ vì nghe thuyết phục; kết luận quyết định phải được xác nhận bằng phép tính, parser JSON hoặc chạy Python.

Cách chấm vòng 18 bài#

Hai mô hình nhận cùng đề, system prompt, temperature và ngân sách đầu ra theo bài. Toán và vật lý được đối chiếu với giá trị chính xác hoặc sai số cho phép. Mã được lưu nguyên trạng rồi import vào cùng bộ hidden test. JSON và CSV được chấm như sản phẩm máy đọc. Nếu phải xóa assert do mô hình tự viết thì tệp mới chạy được, kết quả đó chỉ dùng để tìm nguyên nhân chứ không đổi điểm bàn giao ban đầu. Độ trễ tuyến chỉ nằm trong JSON gốc và hoàn toàn không dùng để chọn bên thắng.

Kết quả trên sáu nhóm năng lực#

Độ chính xác theo sáu nhóm

Nhóm đánh giáOpus 5GPT-5.6 Luna
Suy luận toán học3/33/3
Vật lý phức tạp3/33/3
Bàn giao thuật toán3/31/3
Chống tiền đề sai3/33/3
Suy luận ràng buộc3/33/3
Tuân thủ chỉ dẫn2/33/3
Total17/18 (94.4%)16/18 (88.9%)

Khoảng cách thuật toán nằm ở chất lượng bàn giao#

Hai câu thuật toán Luna thất bại có phần hàm cốt lõi vượt qua hidden test sau khi bỏ các assert ở cuối tệp. Tuy nhiên, chính các assert này chứa kết quả mong đợi sai, khiến tệp gốc ném AssertionError khi import. Với yêu cầu “tệp Python hoàn chỉnh”, đó là lỗi thật. Ba tệp của Opus import và vượt qua cùng một harness mà không cần sửa. Trong production, thân hàm có vẻ đúng chưa đồng nghĩa với sản phẩm có thể triển khai.

JSON nghiêm ngặt lại nghiêng về Luna#

Kiểu lỗi khác nhau tạo rủi ro vận hành khác nhau

Lỗi duy nhất của Opus đi theo hướng ngược lại. Các key và value đều đúng, nhưng mô hình bọc JSON trong code fence Markdown dù đề yêu cầu đúng một object và không có gì khác. Lần chạy lại độc lập tái hiện đúng hành vi này. Luna vượt qua cả ba bài tuân thủ chỉ dẫn. Nếu đầu ra được chuyển thẳng vào parser, lớp bọc cũng là một phần của độ chính xác.

Tách giới hạn đầu ra khỏi lỗi trí tuệ#

Một số lần thử sớm kết thúc với finish_reason=length vì phần suy luận ẩn dùng hết ngân sách đầu ra. Chúng được giữ làm bằng chứng nhưng không bị tính là lỗi trí tuệ. Ngân sách hiệu dụng được tăng giống nhau cho hai mô hình trước khi chấm. Cách làm này không trộn cấu hình với năng lực, đồng thời vẫn cho thấy rủi ro tích hợp: suy luận dài có thể chiếm chỗ của sản phẩm nhìn thấy được.

Áp dụng vào định tuyến thực tế#

Ưu tiên Luna cho JSON nghiêm ngặt, CSV, trích xuất ngắn và xử lý có cấu trúc số lượng lớn, nhưng luôn giữ schema validation. Ưu tiên Opus cho tệp thuật toán dài, kiểm tra biên và kỹ thuật phòng thủ. Toán, vật lý phức tạp, tiền đề sai và suy luận ràng buộc hòa nhau trong mẫu này; khi đó giá, giao diện và phong cách trả lời là tiêu chí hợp lý hơn. Dù dùng mô hình nào, hãy parse JSON, kiểm tra số quan trọng và chạy mã nguyên trạng.

Cách tái hiện và bằng chứng gốc#

Trình chạy là scripts/opus5_vs_luna_hard_benchmark.py. Kết quả đầy đủ nằm ở .tmp/opus5-vs-luna-hard-benchmark-results.json; các lần tái thử độc lập nằm ở .tmp/opus5-hard-failure-retry.json.tmp/luna-hard-failure-retry.json. Endpoint sử dụng là https://cn.crazyrouter.com/v1/chat/completions; dữ liệu độ trễ chỉ được giữ trong bằng chứng gốc.

Câu hỏi thường gặp#

17/18 có nghĩa Opus 5 là bên thắng tuyệt đối không?#

Không. Opus chỉ dẫn một bài trong bộ 18 bài này. Thử nghiệm chưa bao phủ hình ảnh, công cụ, ngữ cảnh cực dài hay agent nhiều lượt.

Vì sao tự kiểm thử sai vẫn tính là lỗi thuật toán?#

Vì sản phẩm được yêu cầu là một tệp Python hoàn chỉnh. Nếu tệp gốc lỗi khi import, hệ thống phía sau không thể dùng nếu không sửa tay.

Vì sao độ trễ không xuất hiện trong kết luận?#

Độ trễ chịu tác động của mô hình, gateway, tải upstream và trạng thái tuyến. Nó hữu ích cho vận hành nhưng không đo độ đúng của trí tuệ.

Kết luận cuối#

Trong bài kiểm tra ưu tiên độ chính xác có thể kiểm chứng, Opus 5 dẫn 17/18 so với 16/18 nhờ bàn giao trọn vẹn ba thuật toán. Luna tốt hơn ở kỷ luật định dạng nghiêm ngặt. Kết luận thực tế là quy tắc định tuyến dựa trên lỗi có thể tái hiện, không phải một nhà vô địch cho mọi tình huống.

Thử cả hai mô hình trên Crazyrouter bằng prompt production của bạn

Implementation Guides

Topics

Comparison

Related Posts

Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trìnhComparison

Kimi K3 so với GPT-5.6-SOL: Thử nghiệm độ khó cao về toán, vật lý và lập trình

Trong cùng một API tương thích OpenAI và cùng một prompt, tiến hành kiểm tra kimi-k3 và gpt-5.6-sol với các bài toán về thời gian dừng ở chế độ, vật lý có mô-men quán tính của ròng rọc và bài lập trình Python dùng closure lồng nhau, đồng thời ghi nhận độ chính xác, hiện tượng cắt ngắn, độ trễ và xác thực mã cục bộ.

Jul 18
Kimi K3 so với Claude Opus 4.8: Thử nghiệm thực tế về toán, vật lý và lập trình cấp độ sau đại họcComparison

Kimi K3 so với Claude Opus 4.8: Thử nghiệm thực tế về toán, vật lý và lập trình cấp độ sau đại học

Trên cùng một Crazyrouter OpenAI-compatible API, so sánh kimi-k3 và claude-opus-4-8 bằng các bài toán cấp độ sau đại học về thời gian chạm đầu tiên của chuỗi Markov, phổ đáp ứng của dao động tử ghép có suy giảm và thuật toán lập lịch phụ thuộc, đồng thời ghi lại độ đầy đủ của đầu ra, độ chính xác, độ trễ và kết quả thẩm định độc lập.

Jul 19
Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?Comparison

Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?

Bài kiểm thử API thực tế trên toán học, vật lý, Python chạy được và suy luận ràng buộc, đồng thời đo finish_reason, reasoning tokens và độ trễ.

Jul 17
Kimi K3 đã đạt tới mức Claude Opus 4.8 chưa? Thử nghiệm API qua 7 chiềuComparison

Kimi K3 đã đạt tới mức Claude Opus 4.8 chưa? Thử nghiệm API qua 7 chiều

So sánh Kimi K3 và Claude Opus 4.8 qua bảy chiều: toán học chính xác, mô hình hóa vật lý, suy luận ràng buộc, chống dẫn dụ thống kê, rà soát mã, JSON nghiêm ngặt và hiệu chuẩn độ bất định; tập trung vào độ đúng, câu trả lời hiển thị đầu tiên, tổng độ trễ và hiệu quả reasoning token.

Jul 19
Claude Opus 5 vs Claude Fable 5: 7 tác vụ benchmark API thực tế và gợi ý định tuyến productionComparison

Claude Opus 5 vs Claude Fable 5: 7 tác vụ benchmark API thực tế và gợi ý định tuyến production

Trong cùng một OpenAI-compatible API, với cùng prompt và tham số, bài viết so sánh Claude Opus 5 và Claude Fable 5 qua các tác vụ toán học, vật lý, suy luận có ràng buộc, review code, strict JSON và thiết kế thí nghiệm; đồng thời ghi nhận tỷ lệ hoàn thành, filtering, latency, token và kết quả retry.

Jul 25
Claude Opus 5 và GPT-5.6-SOL: Kiểm thử độ chính xác qua 10 bài, cả hai đạt 10/10 ở câu trả lời cốt lõiComparison

Claude Opus 5 và GPT-5.6-SOL: Kiểm thử độ chính xác qua 10 bài, cả hai đạt 10/10 ở câu trả lời cốt lõi

Claude Opus 5 và GPT-5.6-SOL được kiểm thử bằng 10 bài có thể xác minh qua cùng API Crazyrouter. Cả hai đạt 10/10 ở câu trả lời cốt lõi; bài viết tách riêng kiểm thử mã ẩn, mức hoàn thành yêu cầu và JSON nghiêm ngặt.

Jul 29