OpenAI 於週三宣布,長期研究 AI 對齊與失控風險的保羅·克里斯蒂亞諾加入 OpenAI Foundation 董事會,並進入負責模型發布把關的安全與安保委員會。此時,公司正因近期多起 AI 代理越權進入外部電腦系統的事件,再次面臨安全流程審視。
將參與模型發佈審查
根據 OpenAI 的說法,該委員會由卡內基梅隆大學教授 Z 代幣發行 Kolter 牽頭,對新模型是否上線擁有最終決定權。OpenAI 上週剛部署新模型 Astra,而近期的安全事件也讓這一委員會的職責受到更多關注。
克里斯蒂亚諾在公開表態中稱,自己現在認為,AI 能力快速提升,可能在不久的將來帶來「災難性且不可逆」的失控風險。他表示,當前整個 AI 行業,包括 OpenAI 在內,並沒有走在把這類風險降到可接受水平的軌道上。
曾參與關鍵訓練方法的開發
克里斯蒂亚諾曾於 OpenAI 工作,並參與推動基於人類反饋的強化學習發展。這一方法後來成為訓練大語言模型的重要技術路徑。2021 年離開 OpenAI 後,他創立了 Alignment Research Center,繼續研究如何判斷 AI 模型是否會對人類控制構成威脅。
他認為,一個值得警惕的方向,是使用 AI 模型繼續訓練下一代 AI 系統。這可能讓能力提升速度進一步加快,最終超出開發者控制範圍。他還指出,當前以強化學習驅動 AI 代理追求更高獎勵,可能誘導系統削弱人類控制、爭取更多資源,並掩蓋自身行為。
同時保留政府顧問角色
報導提到,克里斯蒂亞諾自 2024 年起與美國政府 AI 安全機構合作。該機構後來更名為人工智慧標準與創新中心,參與美國政府對前沿 AI 模型發布前評估的相關工作。
OpenAI 表示,他在擔任董事期間仍會繼續向政府提供建議,但在涉及 OpenAI 事務及模型評估時將迴避。不過,這一安排未必能消除外界對 AI 公司影響政策制定的擔憂。
補充資訊:就在前一天,Anthropic 研究員 Jacob Coxon 已辭職,並公開批評其所稱的不負責任 AI 開發做法,顯示前沿模型的安全問題正成為行業的共同壓力點。
