Việc OpenAI ra mắt lập luận lặp lại mới gây ra lo ngại về an toàn AI

icon币界网
Chia sẻ
AI summary iconTóm tắt
Các phương tiện truyền thông về AI và tiền điện tử báo cáo rằng mô hình Astra mới của OpenAI sẽ sử dụng độ sâu lặp lại để che giấu các bước suy luận. Buck Shlegeris và Zvi Mowshowitz của Redwood cảnh báo điều này có thể làm giảm tính minh bạch của mô hình. OpenAI cho biết họ vẫn hỗ trợ các nhật ký chuỗi suy luận có thể đọc được. The Information lưu ý rằng Anthropic và DeepMind cũng đang thử nghiệm các phương pháp tương tự. Các danh mục token mới trên các sàn giao dịch lớn chưa phản ánh sự phát triển này.
Bijiewang báo cáo:

Theo TechCrunch trích dẫn báo cáo từ The Information, mô hình Astra sắp ra mắt của OpenAI sẽ sử dụng một kỹ thuật suy luận gọi là “recursive depth”. Phương pháp này có thể giảm thiểu các dấu vết có thể quan sát được trong quá trình suy luận của mô hình, khiến bên ngoài khó xác định lý do mô hình đưa ra một kết luận cụ thể thông qua các bản ghi chuỗi tư duy.

Các chuyên gia an ninh đưa ra cảnh báo

Trong các mô hình suy luận phổ biến, chuỗi tư duy thường trình bày từng bước cách mô hình xử lý vấn đề. Mặc dù việc ghi lại này không tương đương với toàn bộ quá trình nội bộ thực sự của mô hình, nhưng nó vẫn là công cụ quan trọng để quan sát sự lệch hướng, quyết định bất thường hoặc hành vi mất kiểm soát tiềm ẩn của mô hình.

Buck Shlegeris, CEO của Redwood Research, cho biết ông rất lo ngại về việc Astra sử dụng các công nghệ này. Ông cho rằng nếu OpenAI mở rộng thêm việc sử dụng các phương pháp này, tính khả năng giám sát chuỗi suy nghĩ của mô hình có thể giảm rõ rệt.

Nhà bình luận Zvi Mowshowitz, người đã theo dõi lâu dài về an toàn AI, cũng cho biết nếu các phòng thí nghiệm cạnh tranh về khả năng của mô hình, các cơ quan quản lý có thể cần can thiệp trong tương lai để ngăn chặn ngành công nghiệp tiếp tục hạ thấp tiêu chuẩn an toàn.

Giảm dấu vết hiển thị thông qua vòng lặp suy luận

Bài báo đề cập rằng, khái niệm “tính đệ quy không minh bạch” có nghĩa là mô hình không còn chủ yếu thực hiện suy luận theo các bước tuyến tính, mà thay vào đó lặp lại xử lý cùng một vấn đề. Việc này có thể làm giảm các quá trình trung gian mà bên ngoài có thể đọc được, tương đương với việc tránh xa con đường hiển thị do chuỗi suy nghĩ truyền thống cung cấp.

Đây cũng là phần khiến các chuyên gia nghiên cứu bảo mật lo ngại nhất. Bởi vì một khi mô hình ngày càng thực hiện suy luận nhiều hơn trong không gian nội bộ không thể quan sát được, các nhà nghiên cứu sẽ khó xác định hơn liệu nó có đang đưa ra thông tin sai lệch, tránh né các ràng buộc hoặc các hành vi không mong đợi khác hay không.

Nhà khoa học trưởng của Redwood Research, Ryan Greenblatt, cho biết rủi ro lớn hơn là loại suy luận không minh bạch này có thể dễ dàng mở rộng hơn so với suy luận chuỗi tư duy truyền thống, cuối cùng khiến phần lớn quá trình suy luận thoát khỏi các kênh có thể quan sát được.

OpenAI nhấn mạnh việc duy trì khả năng giám sát

Tuy nhiên, hiện tại việc Astra sử dụng công nghệ này được cho là vẫn còn hạn chế. Báo cáo chỉ ra rằng chuỗi tư duy của mô hình dự kiến vẫn sẽ có tính dễ đọc, và OpenAI cũng phản đối việc bên ngoài mô tả nó là sự chuyển đổi sang “ngôn ngữ thần kinh” hoàn toàn không thể giải thích.

Jakub Pachocki, nhà khoa học trưởng của OpenAI, cho biết trên X rằng công ty đã nỗ lực duy trì và tận dụng khả năng theo dõi chuỗi suy luận kể từ những mô hình suy luận đầu tiên, và đây cũng là một trong những mục tiêu cốt lõi trong kế hoạch nghiên cứu hiện tại.

Lưu ý rằng không chỉ OpenAI đang tiếp cận hướng này. Theo báo cáo tiếp theo của The Information, Anthropic và Google DeepMind cũng đã thảo luận về các công nghệ tương tự. Điều này có nghĩa là, việc cân bằng giữa việc nâng cao khả năng của mô hình và tính an toàn có thể kiểm tra, rất có thể sớm trở thành chủ đề chung rộng rãi hơn trong ngành AI.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.