OpenAI đã công bố vào thứ Tư rằng Paul Christiano, người đã nghiên cứu lâu dài về việc căn chỉnh AI và các rủi ro mất kiểm soát, đã gia nhập Hội đồng Quản trị của OpenAI Foundation và tham gia Ủy ban An toàn và Bảo mật chịu trách nhiệm giám sát việc phát hành mô hình. Vào thời điểm này, công ty đang phải đối mặt với sự xem xét lại quy trình an toàn sau nhiều sự kiện gần đây liên quan đến các đại diện AI vượt quyền truy cập vào các hệ thống máy tính bên ngoài.
Sẽ tham gia vào việc xem xét phát hành mô hình
Theo OpenAI, ủy ban này do giáo sư Zcoin từ Đại học Carnegie Mellon dẫn đầu và có quyền quyết định cuối cùng về việc triển khai mô hình mới. OpenAI vừa triển khai mô hình mới Astra vào tuần trước, và các sự cố bảo mật gần đây đã làm tăng sự chú ý đến vai trò của ủy ban này.
Cristiano cho biết trong tuyên bố công khai rằng hiện ông tin rằng khả năng của AI đang tăng nhanh, có thể mang đến rủi ro mất kiểm soát “thảm khốc và không thể phục hồi” trong tương lai gần. Ông cho biết hiện toàn bộ ngành AI, bao gồm cả OpenAI, đều không đang đi đúng hướng để giảm những rủi ro này xuống mức có thể chấp nhận được.
Từng tham gia phát triển các phương pháp đào tạo then chốt
Cristiano từng làm việc tại OpenAI và tham gia thúc đẩy sự phát triển của học tăng cường dựa trên phản hồi của con người. Phương pháp này sau này trở thành một đường lối kỹ thuật quan trọng trong việc huấn luyện các mô hình ngôn ngữ lớn. Sau khi rời OpenAI vào năm 2021, ông thành lập Alignment Research Center để tiếp tục nghiên cứu cách xác định liệu các mô hình AI có đang đe dọa sự kiểm soát của con người hay không.
Anh ấy cho rằng một hướng cần cảnh giác là sử dụng mô hình AI để tiếp tục huấn luyện các hệ thống AI thế hệ tiếp theo. Điều này có thể làm tăng tốc độ cải thiện năng lực thêm nữa, cuối cùng vượt ra ngoài tầm kiểm soát của các nhà phát triển. Anh ấy cũng chỉ ra rằng, hiện tại việc các đại diện AI được điều khiển bởi học tăng cường nhằm theo đuổi phần thưởng cao hơn có thể dẫn đến việc hệ thống suy yếu sự kiểm soát của con người, giành thêm tài nguyên và che giấu hành vi của chính mình.
Đồng thời giữ vai trò cố vấn chính phủ
Bài báo cho biết, Cristiano đã hợp tác với cơ quan an toàn AI của chính phủ Mỹ kể từ năm 2024. Cơ quan này sau đó được đổi tên thành Trung tâm Tiêu chuẩn và Đổi mới AI, tham gia vào các công việc đánh giá các mô hình AI tiên tiến trước khi phát hành của chính phủ Mỹ.
OpenAI cho biết ông sẽ tiếp tục cung cấp lời khuyên cho chính phủ trong thời gian giữ chức thành viên hội đồng quản trị, nhưng sẽ tránh tham gia vào các vấn đề liên quan đến OpenAI và đánh giá mô hình. Tuy nhiên, sắp xếp này chưa chắc đã xóa bỏ được những lo ngại từ bên ngoài về ảnh hưởng của các công ty AI đến quá trình hoạch định chính sách.
Thông tin bổ sung: Ngay ngày hôm trước, nhà nghiên cứu của Anthropic, Jacob Coxon, đã từ chức và công khai chỉ trích các phương pháp phát triển AI được cho là thiếu trách nhiệm, cho thấy các vấn đề an toàn của các mô hình tiên tiến đang trở thành điểm áp lực chung trong ngành.
