Claude Fable 5 dẫn đầu bảng xếp hạng mã hóa AI với tỷ lệ thành công 64%

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Claude Fable 5 dẫn đầu các bảng xếp hạng mã hóa AI với tỷ lệ thành công 64% trên MirrorCode, vượt trội hơn GPT-5.6 Sol và GPT-5.5. Nó xử lý được cả các ngôn ngữ phổ biến và chuyên biệt như Go và Ada, với chỉ mức giảm hiệu suất 3% đối với các ngôn ngữ chuyên biệt. MirrorCode yêu cầu độ bao phủ kiểm thử 100% mà không cần truy cập mã nguồn, chứng minh kỹ năng tái cấu trúc logic của Fable 5. Khi các altcoin đáng chú ý thu hút sự quan tâm, chỉ số sợ và tham lam vẫn là chỉ số then chốt dành cho các nhà giao dịch theo dõi tâm lý thị trường.

Claude lần này thật sự đã tạo ra khoảng cách lớn trên bảng xếp hạng AI lập trình!

Vừa mới được làm mới trên bảng xếp hạng MirrorCode, Claude Fable 5 một lần nữa đứng đầu với tỷ lệ thành công tuyệt đối 64%.

GPT-5.6 Sol theo sau với điểm số chỉ bằng một phần ba!

Ở vị trí thứ tư, GPT-5.5 còn tệ hơn nữa. Không chỉ đạt điểm 10%, nó còn bị người tiền nhiệm của chính mình là GPT-5.4 đè bẹp.

Lập trình AI

Điều đáng ngạc nhiên hơn là khi sử dụng các ngôn ngữ tốn tài nguyên cao như Go, tỷ lệ giải được của Fable 5 là 64%; khi chuyển sang ngôn ngữ ít phổ biến Ada, kết quả vẫn đạt tới 61%.

Cần biết rằng, trong thế giới mã nguồn mở, ngữ liệu Python khoảng gấp 230 lần Ada.

Nhưng đến Fable 5, thành tích chỉ giảm 3 phần trăm.

Lập trình AI

Điều này mới thú vị.

Nếu mô hình chủ yếu dựa vào việc ghi nhớ ngữ pháp và cách viết phổ biến của các ngôn ngữ phổ biến, thì sau khi chuyển sang Ada, thành tích nên giảm xuống.

Nhưng kết quả hiện tại lại hướng đến một khả năng khác—

Mô hình mạnh nhất đã thoát khỏi sự chi phối của dữ liệu cụ thể và bắt đầu học cách xây dựng một dự án phần mềm hoàn chỉnh từ đầu.

Bị kẹt ở mức 100% đường truyền, kiểm tra giới hạn 10 tỷ Token

Cụ thể, MirrorCode đầy đủ bao gồm 25 chương trình mục tiêu, bao phủ các lĩnh vực như công cụ Unix, trình thông dịch, truy vấn dữ liệu, sinh tin học, mật mã học và công cụ nén.

Tại đây, mô hình sẽ được đặt trong môi trường cô lập, không có internet, không thể xem mã nguồn dự án gốc và không thể tải xuống các phụ thuộc bên thứ ba. Nó chỉ có thể truy cập vào tài liệu cấp cao, một phần bài kiểm tra có thể nhìn thấy, cùng với chương trình gốc có thể gọi lại nhiều lần.

Tiếp theo, nó sẽ liên tục nhập dữ liệu vào chương trình gốc, quan sát đầu ra để suy luận logic bên trong, rồi một Nhấp vào Viết một chương trình mới có hành vi nhất quán.

Chọn 15 mục tiêu Medium và Large từ bảng xếp hạng mới nhất. Mỗi mục tiêu sử dụng hai ngôn ngữ triển khai, mỗi ngôn ngữ chạy ba lần.

Hơn nữa, tỷ lệ hoàn thành của cả bài kiểm tra hiển thị và bài kiểm tra ẩn phải đạt 100% mới được coi là vượt qua, 99,9% cũng không được chấp nhận.

Chỉ cần bỏ sót một trường hợp biên, toàn bộ lần chạy vẫn được tính là thất bại.

Lập trình AI

Để buộc mô hình lấp đầy những khoảng trống cuối cùng, MirrorCode đã tăng ngân sách mỗi lần lên 10 tỷ Token và cho phép chạy liên tục tối đa 7 ngày.

Nhiệm vụ tốn kém nhất trong bài báo nghiên cứu còn nghiêm trọng hơn: mô hình chạy liên tục trong 19 ngày, chi phí cho một lần chạy đạt tới 2.600 USD.

Trong 19 ngày này, mô hình sẽ lặp lại việc chạy chương trình gốc, so sánh kết quả, bổ sung chức năng, rồi chạy lại bài kiểm tra. Nếu xảy ra lỗi, sẽ tìm nguyên nhân; nếu đầu ra không khớp, sẽ thay đổi giả định; khi một phần thành công, sẽ tiếp tục khắc phục khe hở tiếp theo.

Toàn bộ quá trình giống như một cuộc gỡ lỗi kéo dài vài ngày hơn là một lần tạo ra.

Lập trình AI

Ví dụ của gotree là trực quan nhất.

Công cụ sinh học tính toán này ban đầu có khoảng 16.000 dòng mã Go và hơn 40 lệnh.

Claude Opus 4.7 đã dành 14 giờ và 251 USD để vượt qua 2.000 trong số 2.001 bài kiểm tra, đạt tỷ lệ hoàn thành 99,95%.

Mặc dù đã bỏ sót một biên giới hiếm gặp liên quan đến xử lý ghi chú ngày, khiến nó bị chặn bởi đường giới hạn 100% của MirrorCode, nhưng nó đã giảm khối lượng công việc ban đầu tính theo tuần xuống còn vài chục giờ—

Epoch ước tính rằng, nếu không sử dụng AI, các kỹ sư con người sẽ cần ít nhất từ 2 đến 17 tuần để hoàn thành cùng một nhiệm vụ.

Trong sa mạc dữ liệu, Fable 5 chỉ rơi 3 điểm

Bài luận MirrorCode từng sử dụng bộ dữ liệu huấn luyện công khai của StarCoder làm tham chiếu.

Trong đó, Python chiếm khoảng 8%, Ada chỉ có 0,034%, con số đầu cao hơn khoảng 230 lần so với con số sau.

Lập trình AI

Tất nhiên, chúng ta không thể biết được mô hình đóng nguồn đã từng thấy bao nhiêu mã Ada. Nhưng lấy hệ sinh thái mở làm chuẩn mực, sự khan hiếm của Ada đã đủ rõ ràng.

Ngôn ngữ này chủ yếu xuất hiện trong các hệ thống hàng không vũ trụ, quốc phòng và các hệ thống quan trọng về an ninh khác. Dù về quy mô cộng đồng, số lượng hướng dẫn hay các dự án mã nguồn mở, nó đều远远 không thể sánh bằng Python, JavaScript hoặc Go.

Và Fable 5 rõ ràng không đang dịch từng dòng mã Go sang Ada.

Nó giống như việc trước tiên tìm hiểu xem chương trình gốc hoạt động như thế nào, sau đó chuyển sang một ngôn ngữ khác để tái tạo lại cùng hành vi đó.

Lập trình AI

In comparison, other models are not as stable.

GPT-5.6 giảm từ 24% xuống 19%, GPT-5.4 giảm từ 21% xuống 12%, GPT-5.5 thậm chí giảm từ 17% xuống 5%. Khi chuyển ngôn ngữ, khoảng cách lập tức được khuếch đại.

Giao toàn bộ dự án cho AI

Hiện tại, Cursor đã cho phép hàng trăm Agent hợp tác trong gần một tuần để viết từ đầu hơn 1 triệu dòng mã trình duyệt, phân bố trong 1.000 tệp tin.

Anthropic đã cho 16 Claude Agent chạy song song gần 2.000 phiên hội thoại, cuối cùng xây dựng được một trình biên dịch C gồm 100.000 dòng mã, có khả năng biên dịch nhân Linux 6.9.

Trong mẫu người dùng cá nhân của Codex do OpenAI công bố tính đến tháng 5, 70,2% đã ít nhất gửi một nhiệm vụ ước tính vượt quá một giờ công việc của con người; 25,6% đã gửi các nhiệm vụ vượt quá tám giờ.

Đơn vị mà con người giao cho AI đang từ một đoạn mã, một lỗi bug, chuyển thành một buổi chiều, một tuần, thậm chí cả dự án.

64% của MirrorCode chính là một định lượng cho loại "ủy quyền cấp dự án" này.

Nó cho thấy rằng, với mục tiêu đủ rõ ràng và kết quả có thể được xác nhận tự động, các mô hình tiên tiến đã có thể tự thực hiện một phần phần mềm trung và lớn.

Đối với mỗi người đang giao công việc cho AI, sự thay đổi đã ở ngay trước mắt—

Trước đây, bạn cần theo dõi từng đoạn mã, giờ đây, bạn sẽ chỉ kiểm tra xem nó có đi lệch hướng tại các điểm then chốt hay không.

Mã sẽ ngày càng rẻ hơn.

Những người có thể giải thích rõ vấn đề và kiểm chứng kết quả sẽ ngày càng trở nên quý giá.

Tài liệu tham khảo: https://epoch.ai/MirrorCode

Bài viết này đến từ tài khoản WeChat “New Intelligence Yuan”, tác giả: Revelation of ASI; biên tập: Moses

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.