Việc dạy AI viết mã hoạt động đã là một chuyện. Nhưng dạy nó viết mã hoạt động nhanh thì rõ ràng là một vấn đề hoàn toàn khác.
Một bài báo mới từ nhóm FAIR của Meta AI, được công bố ngày 29 tháng 7, tiết lộ rằng việc mở rộng học tăng cường từ độ chính xác mã sang tối ưu hóa tốc độ mã chứa đầy những vấn đề mà các phương pháp tiêu chuẩn không thể xử lý. Những nguyên nhân: các phép đo thời gian nhiễu, phần thưởng thưa thớt và các thuật toán sụp đổ khi bạn yêu cầu chúng quan tâm đến hiệu suất, chứ không chỉ độ chính xác.
Vấn đề với tốc độ
Khi bạn đo lường xem mã có cho ra câu trả lời đúng hay không, bạn sẽ nhận được tín hiệu nhị phân rõ ràng. Nhưng việc đo lường tốc độ thực thi của mã lại phức tạp. Chạy cùng một đoạn mã hai lần trên cùng một máy và bạn sẽ nhận được thời gian thực thi khác nhau một chút. Các tiến trình nền, lịch trình CPU, phân bổ bộ nhớ — tất cả đều gây ra nhiễu trong các phép đo thời gian.
Đội ngũ Meta phát hiện rằng Tối ưu hóa Chính sách Tăng cường Tổng quát, hay GRPO, một thuật toán tiêu chuẩn trong bộ công cụ học tăng cường, trở nên không ổn định khi cung cấp cho nó những phép đo tốc độ nhiễu loại này.
Sự thưa thớt của phần thưởng làm trầm trọng thêm vấn đề. Hầu hết các tối ưu hóa mã đều mang lại cải thiện tốc độ nhỏ, nghĩa là mô hình hiếm khi nhận được tín hiệu tích cực mạnh mẽ để nói rằng “đúng vậy, thay đổi đó đã làm mọi thứ nhanh hơn.”
DMC-Optim: một tiêu chuẩn mới cho một vấn đề mới
Để giải quyết những thách thức này, các nhà nghiên cứu đã phát triển DMC-Optim, một bộ chuẩn với môi trường sandbox được hiệu chỉnh và quy trình đào tạo chuyên biệt. Hệ thống kết hợp phần thưởng cho cả độ chính xác và tốc độ thực thi trong một trình mô phỏng ngoại tuyến, về cơ bản tạo ra một môi trường kiểm soát nơi tiếng ồn về thời gian có thể được quản lý thay vì bỏ qua.
Kết quả khó có thể tranh cãi. Tỷ lệ đỗ của Qwen 2.5 7B tăng từ 18,0% lên 31,3%, tương đương cải thiện tương đối khoảng 74%. CWM 32B tăng tỷ lệ đỗ từ 30,7% lên 50,4%, đạt mức tăng tương đối 64%. Trên bộ kiểm tra LCB, CWM 32B được huấn luyện theo cách này vượt trội hơn so với các mô hình được huấn luyện bằng học tăng cường tiêu chuẩn từ phần thưởng có thể xác minh trong 83% trường hợp.
Trong điều kiện thời gian suy giảm, nơi mà nhiễu đo lường được khuếch đại chủ ý, chuẩn DMC-Optim cho thấy cải thiện hiệu suất từ 100% đến 200% so với các phương pháp tiêu chuẩn.
Bài báo được viết bởi Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoît Sagot và Gabriel Synnaeve, tất cả đều thuộc Meta AI.
