Google DeepMind vừa công bố một bài báo có thể thay đổi cách các mô hình ngôn ngữ xử lý văn bản. Kỹ thuật này, được gọi là “recirculation”, lấy các kích hoạt từ các lớp sâu hơn của transformer và trộn chúng trở lại các lớp nông hơn trong quá trình suy luận. Bài báo, được đồng tác giả bởi các nhà nghiên cứu từ Đại học Texas tại Austin, cho thấy kết nối lặp lại nhẹ nhàng này mang lại lợi ích về hiệu suất ngang bằng, và trong một số trường hợp vượt trội so với việc tinh chỉnh toàn bộ. Không cần tái huấn luyện. Không cần can thiệp lớn vào kiến trúc.
Điều mà việc tái lưu thực sự làm
Việc tái lưu thông phá vỡ luồng xử lý một chiều của mô hình transformer. Một phần nhỏ các kích hoạt được tính toán ở các lớp sâu hơn của mô hình được trả lại vào các lớp nông hơn trong quá trình tạo token. Về bản chất, mô hình có thêm một lần duyệt nữa để hiểu các biểu diễn nội tại của chính nó, cho phép nó tinh chỉnh những gì bài báo gọi là “trạng thái niềm tin” qua nhiều bước.
Sự khác biệt chính so với các phương pháp hiện có như gợi ý chuỗi lập luận hoặc kiến trúc transformer lặp lại là recirculation không yêu cầu các token suy luận bổ sung hay tăng độ sâu kiến trúc. Đây là một điều chỉnh thêm vào cách chạy suy luận, chứ không phải là thiết kế lại mô hình itself.
Các con số này khó mà bỏ qua
Đội ngũ DeepMind đã thử nghiệm tái lưu thông trên toàn bộ gia đình mô hình Gemma3, bao gồm các biến thể 1B, 4B và 12B tham số. Việc tái lưu thông cơ bản mang lại mức giảm khoảng 8,5% về độ phức tạp trên chín bộ dữ liệu mô hình ngôn ngữ, với độ trễ tăng thêm bằng không trong quá trình tạo ra.
Việc tái lưu thông thích ứng đã được đẩy xa hơn, đạt mức giảm trung bình 23% về độ khó trên chín bộ dữ liệu cùng đó. Để so sánh, việc tinh chỉnh đầy đủ chỉ đạt được mức giảm 21,6%. Đối với các nhiệm vụ suy luận, chỉ số GSM8K ghi nhận mức tăng 21% về độ chính xác tương đối nhờ tái lưu thông thích ứng.
Có một sự đánh đổi. Quá trình tiền điền, giai đoạn mà mô hình xử lý lời nhắc ban đầu, trở nên tuần tự dưới cơ chế luân chuyển, làm tăng chi phí ban đầu khi xử lý một lời nhắc.
Tại sao cộng đồng AI đang quan tâm
Bài báo, được liệt kê là arXiv:2608.17981, đã được tái tạo độc lập. Các triển khai trên GitHub đã xác nhận sự cải thiện trên các mô hình ngoài họ Gemma, bao gồm Llama 3.2 1B. Các cuộc thảo luận đã lan rộng trong cộng đồng nghiên cứu trên X và các nền tảng truyền thông công nghệ Trung Quốc.
Recirculation hoạt động ở cấp độ kích hoạt, nằm dưới bề mặt tạo token, điều này làm cho nó bổ sung cho các kỹ thuật định hướng như lý luận chuỗi suy nghĩ, thay vì cạnh tranh với chúng, vì các kỹ thuật này tiêu tốn token đầu ra và làm tăng độ trễ.
