Claude Opus 5 và GPT-5.6 Luna: 18 bài kiểm chứng, không xếp hạng theo tốc độ
So sánh ưu tiên độ chính xác có thể kiểm chứng trên toán, vật lý phức tạp, thuật toán chạy được, phản biện tiền đề sai, ràng buộc và tuân thủ chỉ dẫn.


Kết luận nhanh#
Ở vòng khó, Claude Opus 5 đạt 17/18 (94,4%), còn GPT-5.6 Luna đạt 16/18 (88,9%). Chênh lệch một bài trong mẫu này không chứng minh Opus mạnh hơn toàn diện. Điều đáng chú ý là kiểu lỗi: Opus bàn giao thành công cả ba tệp thuật toán nhưng phá vỡ hợp đồng JSON nghiêm ngặt; Luna làm đúng cả ba yêu cầu định dạng nhưng hai tệp Python bị lỗi ngay khi import.
Vì sao cần tăng độ khó#
Vòng đầu tám bài không tạo khác biệt: cả hai đều 8/8. Vòng hai vì thế tăng lên 18 bài, gồm hard, harder và extreme trong sáu nhóm. Bài kiểm tra yêu cầu phân số chính xác, mô hình vật lý nhiều giai đoạn, tệp mã hoàn chỉnh, khả năng bác bỏ tiền đề sai, nghiệm logic duy nhất và kỷ luật đầu ra đến từng ký tự. Câu trả lời không được điểm chỉ vì nghe thuyết phục; kết luận quyết định phải được xác nhận bằng phép tính, parser JSON hoặc chạy Python.
Cách chấm vòng 18 bài#
Hai mô hình nhận cùng đề, system prompt, temperature và ngân sách đầu ra theo bài. Toán và vật lý được đối chiếu với giá trị chính xác hoặc sai số cho phép. Mã được lưu nguyên trạng rồi import vào cùng bộ hidden test. JSON và CSV được chấm như sản phẩm máy đọc. Nếu phải xóa assert do mô hình tự viết thì tệp mới chạy được, kết quả đó chỉ dùng để tìm nguyên nhân chứ không đổi điểm bàn giao ban đầu. Độ trễ tuyến chỉ nằm trong JSON gốc và hoàn toàn không dùng để chọn bên thắng.
Kết quả trên sáu nhóm năng lực#

| Nhóm đánh giá | Opus 5 | GPT-5.6 Luna |
|---|---|---|
| Suy luận toán học | 3/3 | 3/3 |
| Vật lý phức tạp | 3/3 | 3/3 |
| Bàn giao thuật toán | 3/3 | 1/3 |
| Chống tiền đề sai | 3/3 | 3/3 |
| Suy luận ràng buộc | 3/3 | 3/3 |
| Tuân thủ chỉ dẫn | 2/3 | 3/3 |
| Total | 17/18 (94.4%) | 16/18 (88.9%) |
Khoảng cách thuật toán nằm ở chất lượng bàn giao#
Hai câu thuật toán Luna thất bại có phần hàm cốt lõi vượt qua hidden test sau khi bỏ các assert ở cuối tệp. Tuy nhiên, chính các assert này chứa kết quả mong đợi sai, khiến tệp gốc ném AssertionError khi import. Với yêu cầu “tệp Python hoàn chỉnh”, đó là lỗi thật. Ba tệp của Opus import và vượt qua cùng một harness mà không cần sửa. Trong production, thân hàm có vẻ đúng chưa đồng nghĩa với sản phẩm có thể triển khai.
JSON nghiêm ngặt lại nghiêng về Luna#

Lỗi duy nhất của Opus đi theo hướng ngược lại. Các key và value đều đúng, nhưng mô hình bọc JSON trong code fence Markdown dù đề yêu cầu đúng một object và không có gì khác. Lần chạy lại độc lập tái hiện đúng hành vi này. Luna vượt qua cả ba bài tuân thủ chỉ dẫn. Nếu đầu ra được chuyển thẳng vào parser, lớp bọc cũng là một phần của độ chính xác.
Tách giới hạn đầu ra khỏi lỗi trí tuệ#
Một số lần thử sớm kết thúc với finish_reason=length vì phần suy luận ẩn dùng hết ngân sách đầu ra. Chúng được giữ làm bằng chứng nhưng không bị tính là lỗi trí tuệ. Ngân sách hiệu dụng được tăng giống nhau cho hai mô hình trước khi chấm. Cách làm này không trộn cấu hình với năng lực, đồng thời vẫn cho thấy rủi ro tích hợp: suy luận dài có thể chiếm chỗ của sản phẩm nhìn thấy được.
Áp dụng vào định tuyến thực tế#
Ưu tiên Luna cho JSON nghiêm ngặt, CSV, trích xuất ngắn và xử lý có cấu trúc số lượng lớn, nhưng luôn giữ schema validation. Ưu tiên Opus cho tệp thuật toán dài, kiểm tra biên và kỹ thuật phòng thủ. Toán, vật lý phức tạp, tiền đề sai và suy luận ràng buộc hòa nhau trong mẫu này; khi đó giá, giao diện và phong cách trả lời là tiêu chí hợp lý hơn. Dù dùng mô hình nào, hãy parse JSON, kiểm tra số quan trọng và chạy mã nguyên trạng.
Cách tái hiện và bằng chứng gốc#
Trình chạy là scripts/opus5_vs_luna_hard_benchmark.py. Kết quả đầy đủ nằm ở .tmp/opus5-vs-luna-hard-benchmark-results.json; các lần tái thử độc lập nằm ở .tmp/opus5-hard-failure-retry.json và .tmp/luna-hard-failure-retry.json. Endpoint sử dụng là https://cn.crazyrouter.com/v1/chat/completions; dữ liệu độ trễ chỉ được giữ trong bằng chứng gốc.
Câu hỏi thường gặp#
17/18 có nghĩa Opus 5 là bên thắng tuyệt đối không?#
Không. Opus chỉ dẫn một bài trong bộ 18 bài này. Thử nghiệm chưa bao phủ hình ảnh, công cụ, ngữ cảnh cực dài hay agent nhiều lượt.
Vì sao tự kiểm thử sai vẫn tính là lỗi thuật toán?#
Vì sản phẩm được yêu cầu là một tệp Python hoàn chỉnh. Nếu tệp gốc lỗi khi import, hệ thống phía sau không thể dùng nếu không sửa tay.
Vì sao độ trễ không xuất hiện trong kết luận?#
Độ trễ chịu tác động của mô hình, gateway, tải upstream và trạng thái tuyến. Nó hữu ích cho vận hành nhưng không đo độ đúng của trí tuệ.
Kết luận cuối#
Trong bài kiểm tra ưu tiên độ chính xác có thể kiểm chứng, Opus 5 dẫn 17/18 so với 16/18 nhờ bàn giao trọn vẹn ba thuật toán. Luna tốt hơn ở kỷ luật định dạng nghiêm ngặt. Kết luận thực tế là quy tắc định tuyến dựa trên lỗi có thể tái hiện, không phải một nhà vô địch cho mọi tình huống.
Thử cả hai mô hình trên Crazyrouter bằng prompt production của bạn




