OpenAI Astra đã làm điều “đổi mới” này, nhưng ByteDance đã công khai thực hiện rồi năm ngoái. Con đường này được gọi là recurrent depth. Nói đơn giản, thay vì chỉ dựa vào việc sinh ra CoT dài hơn để suy nghĩ thêm, nó cho phép cùng một nhóm block Transformer lặp lại nhiều lần trên hidden state, nhồi thêm nhiều tính toán hơn vào latent space. Câu hỏi khó thì chạy nhiều vòng, câu hỏi đơn giản thì thoát sớm. Thông số không cần tăng theo độ sâu suy luận, và compute tại thời điểm kiểm tra cũng có thể phân bổ linh hoạt hơn. Tháng 10 năm ngoái, ByteDance Seed đã công khai và mở nguồn Ouro — một mô hình ngôn ngữ lặp lại. Ouro-1.4B và 2.6B đã tích hợp trực tiếp iterative latent reasoning trong giai đoạn tiền huấn luyện; 2.6B mặc định thực hiện nhiều vòng tính toán lặp lại, đồng thời hỗ trợ adaptive exit để mỗi câu hỏi tự quyết định cần suy nghĩ bao nhiêu vòng. Năm ngoái, đây mới chỉ là một nhánh nhỏ mà ByteDance dùng mô hình nhỏ để xác minh, nhưng giờ đây OpenAI đã đưa nó vào mô hình tiên tiến nhất. Điều này cho thấy recurrent depth rất có thể không còn chỉ là một thiết kế “hấp dẫn” về mặt học thuật, mà đang bắt đầu trở thành con đường kỹ thuật thực sự cho thế hệ mô hình lớn tiếp theo. Và những vấn đề mà nó mang lại còn phức tạp hơn cả benchmark. Trước đây, khi mở rộng khả năng suy luận của mô hình, nhiều tính toán được ghi lại trong CoT. Mô hình suy nghĩ càng lâu, càng tạo ra nhiều token suy luận. Dù CoT không tương đương với trạng thái nội bộ hoàn chỉnh của mô hình, nhưng ít nhất nó vẫn tạo ra một cửa sổ giám sát an toàn. recurrent depth sẽ tiếp tục di chuyển thêm nhiều tính toán vào latent space. Cùng một nhóm tham số có thể lặp lại nhiều lần trong hidden state — mô hình đã thực hiện rất nhiều tính toán nội bộ, cuối cùng chỉ cần đầu ra một đoạn văn bản ngắn. Từ đó nảy sinh một vấn đề thực tế: Vị trí thực sự mà mô hình hoàn thành suy luận đang dần rời xa ngôn ngữ tự nhiên. Đây cũng chính là điểm khiến các nhà nghiên cứu lo ngại nhất về Astra. Trước đây, OpenAI luôn rất coi trọng việc giám sát Chain-of-Thought, vì khi mô hình chuẩn bị gian lận, hack reward hoặc lách luật, đôi khi chúng sẽ tiết lộ ý định đầu tiên qua CoT. Nhưng nếu ngày càng nhiều suy luận xảy ra trong latent state, thì bạn còn có thể giám sát cái gì? Theo báo cáo, OpenAI hiện thậm chí còn chủ động giới hạn mức độ sử dụng recurrent depth của Astra, nhằm giữ lại nhiều CoT có thể đọc được hơn, đồng thời triển khai thêm các cơ chế giám sát trạng thái và hành vi nội bộ. Điều này thực sự rất thú vị. Trong vài năm qua, cách mở rộng khả năng suy luận của mô hình lớn rất dễ hiểu: cho nó nhiều token hơn, để nó nói nhiều hơn. Tiếp theo có thể sẽ là: cho nó nhiều vòng lặp nội bộ hơn — nhưng nó không cần phải kể cho bạn biết những quá trình đó.
sleepy.mdChia sẻ
Nguồn:Hiển thị bản gốc
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này.
Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụng và Tiết lộ rủi ro của chúng tôi.