Claude lần này thật sự đã tạo ra khoảng cách lớn trên bảng xếp hạng AI lập trình!
Vừa mới được làm mới trên bảng xếp hạng MirrorCode, Claude Fable 5 một lần nữa đứng đầu với tỷ lệ thành công tuyệt đối 64%.
GPT-5.6 Sol theo sau với điểm số chỉ bằng một phần ba!
Ở vị trí thứ tư, GPT-5.5 còn tệ hơn nữa. Không chỉ đạt điểm 10%, nó còn bị người tiền nhiệm của chính mình là GPT-5.4 đè bẹp.

Điều đáng ngạc nhiên hơn là khi sử dụng các ngôn ngữ tốn tài nguyên cao như Go, tỷ lệ giải được của Fable 5 là 64%; khi chuyển sang ngôn ngữ ít phổ biến Ada, kết quả vẫn đạt tới 61%.
Cần biết rằng, trong thế giới mã nguồn mở, ngữ liệu Python khoảng gấp 230 lần Ada.
Nhưng đến Fable 5, thành tích chỉ giảm 3 phần trăm.

Điều này mới thú vị.
Nếu mô hình chủ yếu dựa vào việc ghi nhớ ngữ pháp và cách viết phổ biến của các ngôn ngữ phổ biến, thì sau khi chuyển sang Ada, thành tích nên giảm xuống.
Nhưng kết quả hiện tại lại hướng đến một khả năng khác—
Mô hình mạnh nhất đã thoát khỏi sự chi phối của dữ liệu cụ thể và bắt đầu học cách xây dựng một dự án phần mềm hoàn chỉnh từ đầu.
Bị kẹt ở mức 100% đường truyền, kiểm tra giới hạn 10 tỷ Token
Cụ thể, MirrorCode đầy đủ bao gồm 25 chương trình mục tiêu, bao phủ các lĩnh vực như công cụ Unix, trình thông dịch, truy vấn dữ liệu, sinh tin học, mật mã học và công cụ nén.
Tại đây, mô hình sẽ được đặt trong môi trường cô lập, không có internet, không thể xem mã nguồn dự án gốc và không thể tải xuống các phụ thuộc bên thứ ba. Nó chỉ có thể truy cập vào tài liệu cấp cao, một phần bài kiểm tra có thể nhìn thấy, cùng với chương trình gốc có thể gọi lại nhiều lần.
Tiếp theo, nó sẽ liên tục nhập dữ liệu vào chương trình gốc, quan sát đầu ra để suy luận logic bên trong, rồi một Nhấp vào Viết một chương trình mới có hành vi nhất quán.
Chọn 15 mục tiêu Medium và Large từ bảng xếp hạng mới nhất. Mỗi mục tiêu sử dụng hai ngôn ngữ triển khai, mỗi ngôn ngữ chạy ba lần.
Hơn nữa, tỷ lệ hoàn thành của cả bài kiểm tra hiển thị và bài kiểm tra ẩn phải đạt 100% mới được coi là vượt qua, 99,9% cũng không được chấp nhận.
Chỉ cần bỏ sót một trường hợp biên, toàn bộ lần chạy vẫn được tính là thất bại.

Để buộc mô hình lấp đầy những khoảng trống cuối cùng, MirrorCode đã tăng ngân sách mỗi lần lên 10 tỷ Token và cho phép chạy liên tục tối đa 7 ngày.
Nhiệm vụ tốn kém nhất trong bài báo nghiên cứu còn nghiêm trọng hơn: mô hình chạy liên tục trong 19 ngày, chi phí cho một lần chạy đạt tới 2.600 USD.
Trong 19 ngày này, mô hình sẽ lặp lại việc chạy chương trình gốc, so sánh kết quả, bổ sung chức năng, rồi chạy lại bài kiểm tra. Nếu xảy ra lỗi, sẽ tìm nguyên nhân; nếu đầu ra không khớp, sẽ thay đổi giả định; khi một phần thành công, sẽ tiếp tục khắc phục khe hở tiếp theo.
Toàn bộ quá trình giống như một cuộc gỡ lỗi kéo dài vài ngày hơn là một lần tạo ra.

Ví dụ của gotree là trực quan nhất.
Công cụ sinh học tính toán này ban đầu có khoảng 16.000 dòng mã Go và hơn 40 lệnh.
Claude Opus 4.7 đã dành 14 giờ và 251 USD để vượt qua 2.000 trong số 2.001 bài kiểm tra, đạt tỷ lệ hoàn thành 99,95%.
Mặc dù đã bỏ sót một biên giới hiếm gặp liên quan đến xử lý ghi chú ngày, khiến nó bị chặn bởi đường giới hạn 100% của MirrorCode, nhưng nó đã giảm khối lượng công việc ban đầu tính theo tuần xuống còn vài chục giờ—
Epoch ước tính rằng, nếu không sử dụng AI, các kỹ sư con người sẽ cần ít nhất từ 2 đến 17 tuần để hoàn thành cùng một nhiệm vụ.
Trong sa mạc dữ liệu, Fable 5 chỉ rơi 3 điểm
Bài luận MirrorCode từng sử dụng bộ dữ liệu huấn luyện công khai của StarCoder làm tham chiếu.
Trong đó, Python chiếm khoảng 8%, Ada chỉ có 0,034%, con số đầu cao hơn khoảng 230 lần so với con số sau.

Tất nhiên, chúng ta không thể biết được mô hình đóng nguồn đã từng thấy bao nhiêu mã Ada. Nhưng lấy hệ sinh thái mở làm chuẩn mực, sự khan hiếm của Ada đã đủ rõ ràng.
Ngôn ngữ này chủ yếu xuất hiện trong các hệ thống hàng không vũ trụ, quốc phòng và các hệ thống quan trọng về an ninh khác. Dù về quy mô cộng đồng, số lượng hướng dẫn hay các dự án mã nguồn mở, nó đều远远 không thể sánh bằng Python, JavaScript hoặc Go.
Và Fable 5 rõ ràng không đang dịch từng dòng mã Go sang Ada.
Nó giống như việc trước tiên tìm hiểu xem chương trình gốc hoạt động như thế nào, sau đó chuyển sang một ngôn ngữ khác để tái tạo lại cùng hành vi đó.

In comparison, other models are not as stable.
GPT-5.6 giảm từ 24% xuống 19%, GPT-5.4 giảm từ 21% xuống 12%, GPT-5.5 thậm chí giảm từ 17% xuống 5%. Khi chuyển ngôn ngữ, khoảng cách lập tức được khuếch đại.
Giao toàn bộ dự án cho AI
Hiện tại, Cursor đã cho phép hàng trăm Agent hợp tác trong gần một tuần để viết từ đầu hơn 1 triệu dòng mã trình duyệt, phân bố trong 1.000 tệp tin.
Anthropic đã cho 16 Claude Agent chạy song song gần 2.000 phiên hội thoại, cuối cùng xây dựng được một trình biên dịch C gồm 100.000 dòng mã, có khả năng biên dịch nhân Linux 6.9.
Trong mẫu người dùng cá nhân của Codex do OpenAI công bố tính đến tháng 5, 70,2% đã ít nhất gửi một nhiệm vụ ước tính vượt quá một giờ công việc của con người; 25,6% đã gửi các nhiệm vụ vượt quá tám giờ.
Đơn vị mà con người giao cho AI đang từ một đoạn mã, một lỗi bug, chuyển thành một buổi chiều, một tuần, thậm chí cả dự án.
64% của MirrorCode chính là một định lượng cho loại "ủy quyền cấp dự án" này.
Nó cho thấy rằng, với mục tiêu đủ rõ ràng và kết quả có thể được xác nhận tự động, các mô hình tiên tiến đã có thể tự thực hiện một phần phần mềm trung và lớn.
Đối với mỗi người đang giao công việc cho AI, sự thay đổi đã ở ngay trước mắt—
Trước đây, bạn cần theo dõi từng đoạn mã, giờ đây, bạn sẽ chỉ kiểm tra xem nó có đi lệch hướng tại các điểm then chốt hay không.
Mã sẽ ngày càng rẻ hơn.
Những người có thể giải thích rõ vấn đề và kiểm chứng kết quả sẽ ngày càng trở nên quý giá.
Tài liệu tham khảo: https://epoch.ai/MirrorCode
Bài viết này đến từ tài khoản WeChat “New Intelligence Yuan”, tác giả: Revelation of ASI; biên tập: Moses
