Meta AI xác định các thách thức trong học tăng cường để tối ưu hóa tốc độ mã

iconCryptoBriefing
Chia sẻ
AI summary iconTóm tắt
Tin tức AI + tiền mã hóa từ nhóm FAIR của Meta AI cho thấy học tăng cường gặp khó khăn trong tối ưu hóa tốc độ mã do thời gian nhiễu, phần thưởng thưa thớt và không ổn định. Nhóm đã ra mắt DMC-Optim, một tiêu chuẩn đánh giá kết hợp tính chính xác và tốc độ, giúp tăng tỷ lệ vượt qua cho các mô hình như Qwen 2.5 7B và CWM 32B. Việc niêm yết token mới vẫn là trọng tâm chính đối với các nhà giao dịch theo dõi các tiến bộ trong lĩnh vực AI.

Việc dạy AI viết mã hoạt động đã là một chuyện. Nhưng dạy nó viết mã hoạt động nhanh thì rõ ràng là một vấn đề hoàn toàn khác.

Một bài báo mới từ nhóm FAIR của Meta AI, được công bố ngày 29 tháng 7, tiết lộ rằng việc mở rộng học tăng cường từ độ chính xác mã sang tối ưu hóa tốc độ mã chứa đầy những vấn đề mà các phương pháp tiêu chuẩn không thể xử lý. Những nguyên nhân: các phép đo thời gian nhiễu, phần thưởng thưa thớt và các thuật toán sụp đổ khi bạn yêu cầu chúng quan tâm đến hiệu suất, chứ không chỉ độ chính xác.

Vấn đề với tốc độ

Khi bạn đo lường xem mã có cho ra câu trả lời đúng hay không, bạn sẽ nhận được tín hiệu nhị phân rõ ràng. Nhưng việc đo lường tốc độ thực thi của mã lại phức tạp. Chạy cùng một đoạn mã hai lần trên cùng một máy và bạn sẽ nhận được thời gian thực thi khác nhau một chút. Các tiến trình nền, lịch trình CPU, phân bổ bộ nhớ — tất cả đều gây ra nhiễu trong các phép đo thời gian.

Quảng cáo

Đội ngũ Meta phát hiện rằng Tối ưu hóa Chính sách Tăng cường Tổng quát, hay GRPO, một thuật toán tiêu chuẩn trong bộ công cụ học tăng cường, trở nên không ổn định khi cung cấp cho nó những phép đo tốc độ nhiễu loại này.

Sự thưa thớt của phần thưởng làm trầm trọng thêm vấn đề. Hầu hết các tối ưu hóa mã đều mang lại cải thiện tốc độ nhỏ, nghĩa là mô hình hiếm khi nhận được tín hiệu tích cực mạnh mẽ để nói rằng “đúng vậy, thay đổi đó đã làm mọi thứ nhanh hơn.”

DMC-Optim: một tiêu chuẩn mới cho một vấn đề mới

Để giải quyết những thách thức này, các nhà nghiên cứu đã phát triển DMC-Optim, một bộ chuẩn với môi trường sandbox được hiệu chỉnh và quy trình đào tạo chuyên biệt. Hệ thống kết hợp phần thưởng cho cả độ chính xác và tốc độ thực thi trong một trình mô phỏng ngoại tuyến, về cơ bản tạo ra một môi trường kiểm soát nơi tiếng ồn về thời gian có thể được quản lý thay vì bỏ qua.

Kết quả khó có thể tranh cãi. Tỷ lệ đỗ của Qwen 2.5 7B tăng từ 18,0% lên 31,3%, tương đương cải thiện tương đối khoảng 74%. CWM 32B tăng tỷ lệ đỗ từ 30,7% lên 50,4%, đạt mức tăng tương đối 64%. Trên bộ kiểm tra LCB, CWM 32B được huấn luyện theo cách này vượt trội hơn so với các mô hình được huấn luyện bằng học tăng cường tiêu chuẩn từ phần thưởng có thể xác minh trong 83% trường hợp.

Trong điều kiện thời gian suy giảm, nơi mà nhiễu đo lường được khuếch đại chủ ý, chuẩn DMC-Optim cho thấy cải thiện hiệu suất từ 100% đến 200% so với các phương pháp tiêu chuẩn.

Bài báo được viết bởi Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoît Sagot và Gabriel Synnaeve, tất cả đều thuộc Meta AI.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.