Theo TechCrunch trích dẫn báo cáo từ The Information, mô hình Astra sắp ra mắt của OpenAI sẽ sử dụng một kỹ thuật suy luận gọi là “recursive depth”. Phương pháp này có thể giảm thiểu các dấu vết có thể quan sát được trong quá trình suy luận của mô hình, khiến bên ngoài khó xác định lý do mô hình đưa ra một kết luận cụ thể thông qua các bản ghi chuỗi tư duy.
Các chuyên gia an ninh đưa ra cảnh báo
Trong các mô hình suy luận phổ biến, chuỗi tư duy thường trình bày từng bước cách mô hình xử lý vấn đề. Mặc dù việc ghi lại này không tương đương với toàn bộ quá trình nội bộ thực sự của mô hình, nhưng nó vẫn là công cụ quan trọng để quan sát sự lệch hướng, quyết định bất thường hoặc hành vi mất kiểm soát tiềm ẩn của mô hình.
Buck Shlegeris, CEO của Redwood Research, cho biết ông rất lo ngại về việc Astra sử dụng các công nghệ này. Ông cho rằng nếu OpenAI mở rộng thêm việc sử dụng các phương pháp này, tính khả năng giám sát chuỗi suy nghĩ của mô hình có thể giảm rõ rệt.
Nhà bình luận Zvi Mowshowitz, người đã theo dõi lâu dài về an toàn AI, cũng cho biết nếu các phòng thí nghiệm cạnh tranh về khả năng của mô hình, các cơ quan quản lý có thể cần can thiệp trong tương lai để ngăn chặn ngành công nghiệp tiếp tục hạ thấp tiêu chuẩn an toàn.
Giảm dấu vết hiển thị thông qua vòng lặp suy luận
Bài báo đề cập rằng, khái niệm “tính đệ quy không minh bạch” có nghĩa là mô hình không còn chủ yếu thực hiện suy luận theo các bước tuyến tính, mà thay vào đó lặp lại xử lý cùng một vấn đề. Việc này có thể làm giảm các quá trình trung gian mà bên ngoài có thể đọc được, tương đương với việc tránh xa con đường hiển thị do chuỗi suy nghĩ truyền thống cung cấp.
Đây cũng là phần khiến các chuyên gia nghiên cứu bảo mật lo ngại nhất. Bởi vì một khi mô hình ngày càng thực hiện suy luận nhiều hơn trong không gian nội bộ không thể quan sát được, các nhà nghiên cứu sẽ khó xác định hơn liệu nó có đang đưa ra thông tin sai lệch, tránh né các ràng buộc hoặc các hành vi không mong đợi khác hay không.
Nhà khoa học trưởng của Redwood Research, Ryan Greenblatt, cho biết rủi ro lớn hơn là loại suy luận không minh bạch này có thể dễ dàng mở rộng hơn so với suy luận chuỗi tư duy truyền thống, cuối cùng khiến phần lớn quá trình suy luận thoát khỏi các kênh có thể quan sát được.
OpenAI nhấn mạnh việc duy trì khả năng giám sát
Tuy nhiên, hiện tại việc Astra sử dụng công nghệ này được cho là vẫn còn hạn chế. Báo cáo chỉ ra rằng chuỗi tư duy của mô hình dự kiến vẫn sẽ có tính dễ đọc, và OpenAI cũng phản đối việc bên ngoài mô tả nó là sự chuyển đổi sang “ngôn ngữ thần kinh” hoàn toàn không thể giải thích.
Jakub Pachocki, nhà khoa học trưởng của OpenAI, cho biết trên X rằng công ty đã nỗ lực duy trì và tận dụng khả năng theo dõi chuỗi suy luận kể từ những mô hình suy luận đầu tiên, và đây cũng là một trong những mục tiêu cốt lõi trong kế hoạch nghiên cứu hiện tại.
Lưu ý rằng không chỉ OpenAI đang tiếp cận hướng này. Theo báo cáo tiếp theo của The Information, Anthropic và Google DeepMind cũng đã thảo luận về các công nghệ tương tự. Điều này có nghĩa là, việc cân bằng giữa việc nâng cao khả năng của mô hình và tính an toàn có thể kiểm tra, rất có thể sớm trở thành chủ đề chung rộng rãi hơn trong ngành AI.
