Bài kiểm tra Ramp SWE-Bench: Claude Fable 5 dẫn đầu với tỷ lệ thành công 87,5%

iconKuCoinFlash
Chia sẻ
AI summary iconTóm tắt
Ramp, một công ty fintech unicorn, đã công bố bộ đánh giá SWE-Bench dành cho các tác nhân mã hóa AI, bao gồm 80 nhiệm vụ backend từ các môi trường sản xuất thực tế. Claude Fable 5 của Anthropic đạt 87,5%, cao nhất trong số 14 mô hình. Tin tức AI + crypto nổi bật về hiệu quả chi phí của Claude Opus 4.8 ở mức 1,09 USD mỗi lần chạy. Các mô hình trong nước Kimi K2.6 và GLM 5.1 lần lượt đạt 72,5% và 71,25%. GPT-5.4 Mini dẫn đầu nhóm mô hình nhẹ với 58,75%. Ramp lưu ý rằng sự đánh đổi giữa hiệu suất, tốc độ và chi phí là yếu tố then chốt khi triển khai. Tin tức về lãi suất vẫn là trọng tâm riêng biệt đối với các nhà giao dịch.
ME AI tin tức, theo giám sát của Beating, công ty công nghệ tài chính kỳ lân Ramp đã công bố bộ đánh giá riêng cho các tác nhân mã hóa AI tiên tiến — Ramp SWE-Bench. Ramp SWE-Bench bao gồm 80 nhiệm vụ phát triển backend được lấy từ môi trường sản xuất thực tế của Ramp, nhằm giải quyết vấn đề rò rỉ dữ liệu và bão hòa chỉ số do mô hình được huấn luyện trước trên các bộ dữ liệu đánh giá công khai. Các nhiệm vụ đánh giá đều được trích xuất từ các pull request (PR) thực tế mà trợ lý mã hóa AI nội bộ của Ramp, Inspect, đã triển khai thành công vào môi trường sản xuất. Mỗi nhiệm vụ tái cấu trúc cơ sở mã trước khi PR được gửi, giữ nguyên mã và bài kiểm tra đã hợp nhất làm tiêu chuẩn vàng, đồng thời trích xuất ý định ban đầu của kỹ sư trong cuộc hội thoại với Inspect làm đầu vào gợi ý. Đánh giá được thực hiện trong môi trường sandbox mini-swe-agent, với tiêu chí đạt yêu cầu là hoàn thành thành công tất cả bài kiểm tra trong một lần chạy duy nhất mà không làm hỏng chức năng hiện có (pass@1). Theo kết quả so sánh 14 mô hình được công bố, Claude Fable 5 mới nhất của Anthropic dẫn đầu với tỷ lệ giải quyết 87,5%. Claude Opus 4.7 và GPT-5.5 đồng hạng hai, cả hai đều đạt 83,75%. Mặc dù Claude Opus 4.8 có tỷ lệ giải quyết là 77,5%, nhưng thời gian chạy trung bình mỗi nhiệm vụ chỉ còn 8 phút 30 giây và chi phí mỗi lần chạy chỉ 1,09 USD — dưới 40% chi phí của Fable 5 — cho thấy hiệu quả chi phí cực kỳ ấn tượng. Dữ liệu đánh giá cũng làm rõ sự đánh đổi giữa giá cả và hiệu năng giữa các mô hình. Các mô hình trong nước Kimi K2.6 và GLM 5.1 có tỷ lệ giải quyết tương đương, lần lượt là 72,5% và 71,25%, nhưng chi phí trung bình của Kimi K2.6 là 0,69 USD — rẻ hơn khoảng 34% so với GLM 5.1. Trong nhóm mô hình nhẹ, GPT-5.4 Mini dẫn đầu với tỷ lệ giải quyết 58,75%, cao hơn Claude Haiku 4.5 khoảng 10 điểm phần trăm, đồng thời chi phí và số bước trung bình đều giảm một nửa. Ramp nhấn mạnh rằng khi các mô hình tiến gần hơn đến ứng dụng thực tế, sự đánh đổi giữa hiệu năng, tốc độ và chi phí đang trở thành yếu tố then chốt trong quá trình triển khai kỹ thuật. (Nguồn: BlockBeats)
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.