source avatarMinty

Chia sẻ

Liệu AI có thể học cách tối ưu hóa từ các ví dụ thay vì chỉ sao chép chúng? Huấn luyện tinh chỉnh có giám sát (SFT) dạy mô hình bằng cách yêu cầu nó bắt chước các câu trả lời của chuyên gia. Một bài báo mới giới thiệu PARED, một phương pháp căn chỉnh nhằm trích xuất phần thưởng có thể tái sử dụng từ chính các ví dụ đó. PARED so sánh các câu trả lời của chuyên gia với phản hồi do chính mô hình tạo ra dựa trên các đặc trưng được chọn như hữu ích, vô hại và chủ đề. Nó sử dụng những khác biệt này để học một phần thưởng rõ ràng, sau đó hướng dẫn quá trình học tăng cường bổ sung sau SFT. Sử dụng 4.000 ví dụ được tạo bởi GPT-5.1, các câu trả lời từ các mô hình được huấn luyện bằng PARED được ưa chuộng hơn so với các câu trả lời từ điểm kiểm tra SFT ban đầu trong 86,2% và 88,4% các phép so sánh không bằng nhau dưới hai cách tiếp cận cập nhật phần thưởng, theo đánh giá của Gemini 2.5 Flash. Các ví dụ có thể trở nên hữu ích không chỉ để bắt chước, mà còn giúp xác định một mục tiêu mà mô hình tiếp tục học hỏi sau SFT.

No.0 picture
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.