Bài báo của Google DeepMind tiết lộ phương pháp tái lưu thông giúp tăng hiệu suất của Transformer

iconCryptoBriefing
Chia sẻ
AI summary iconTóm tắt
Google DeepMind đã công bố một bài báo mới giới thiệu phương pháp được gọi là 'recirculation' để cải thiện các mô hình transformer. Kỹ thuật này gửi các kích hoạt của các lớp sâu hơn trở lại các lớp trước đó trong quá trình suy luận, tăng hiệu suất mà không cần huấn luyện lại. Các báo cáo tin tức trên blockchain cho thấy phương pháp này đã giảm perplexity 23% và cải thiện độ chính xác lập luận 21% trên bộ dữ liệu GSM8K. Tuy nhiên, nó làm tăng chi phí xử lý ban đầu. Các phương tiện truyền thông về tiền điện tử nhấn mạnh tiềm năng của các lợi ích hiệu quả AI trong các ứng dụng blockchain.

Google DeepMind vừa công bố một bài báo có thể thay đổi cách các mô hình ngôn ngữ xử lý văn bản. Kỹ thuật này, được gọi là “recirculation”, lấy các kích hoạt từ các lớp sâu hơn của transformer và trộn chúng trở lại các lớp nông hơn trong quá trình suy luận. Bài báo, được đồng tác giả bởi các nhà nghiên cứu từ Đại học Texas tại Austin, cho thấy kết nối lặp lại nhẹ nhàng này mang lại lợi ích về hiệu suất ngang bằng, và trong một số trường hợp vượt trội so với việc tinh chỉnh toàn bộ. Không cần tái huấn luyện. Không cần can thiệp lớn vào kiến trúc.

Điều mà việc tái lưu thực sự làm

Việc tái lưu thông phá vỡ luồng xử lý một chiều của mô hình transformer. Một phần nhỏ các kích hoạt được tính toán ở các lớp sâu hơn của mô hình được trả lại vào các lớp nông hơn trong quá trình tạo token. Về bản chất, mô hình có thêm một lần duyệt nữa để hiểu các biểu diễn nội tại của chính nó, cho phép nó tinh chỉnh những gì bài báo gọi là “trạng thái niềm tin” qua nhiều bước.

Sự khác biệt chính so với các phương pháp hiện có như gợi ý chuỗi lập luận hoặc kiến trúc transformer lặp lại là recirculation không yêu cầu các token suy luận bổ sung hay tăng độ sâu kiến trúc. Đây là một điều chỉnh thêm vào cách chạy suy luận, chứ không phải là thiết kế lại mô hình itself.

Quảng cáo

Các con số này khó mà bỏ qua

Đội ngũ DeepMind đã thử nghiệm tái lưu thông trên toàn bộ gia đình mô hình Gemma3, bao gồm các biến thể 1B, 4B và 12B tham số. Việc tái lưu thông cơ bản mang lại mức giảm khoảng 8,5% về độ phức tạp trên chín bộ dữ liệu mô hình ngôn ngữ, với độ trễ tăng thêm bằng không trong quá trình tạo ra.

Việc tái lưu thông thích ứng đã được đẩy xa hơn, đạt mức giảm trung bình 23% về độ khó trên chín bộ dữ liệu cùng đó. Để so sánh, việc tinh chỉnh đầy đủ chỉ đạt được mức giảm 21,6%. Đối với các nhiệm vụ suy luận, chỉ số GSM8K ghi nhận mức tăng 21% về độ chính xác tương đối nhờ tái lưu thông thích ứng.

Có một sự đánh đổi. Quá trình tiền điền, giai đoạn mà mô hình xử lý lời nhắc ban đầu, trở nên tuần tự dưới cơ chế luân chuyển, làm tăng chi phí ban đầu khi xử lý một lời nhắc.

Tại sao cộng đồng AI đang quan tâm

Bài báo, được liệt kê là arXiv:2608.17981, đã được tái tạo độc lập. Các triển khai trên GitHub đã xác nhận sự cải thiện trên các mô hình ngoài họ Gemma, bao gồm Llama 3.2 1B. Các cuộc thảo luận đã lan rộng trong cộng đồng nghiên cứu trên X và các nền tảng truyền thông công nghệ Trung Quốc.

Recirculation hoạt động ở cấp độ kích hoạt, nằm dưới bề mặt tạo token, điều này làm cho nó bổ sung cho các kỹ thuật định hướng như lý luận chuỗi suy nghĩ, thay vì cạnh tranh với chúng, vì các kỹ thuật này tiêu tốn token đầu ra và làm tăng độ trễ.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.