9月6日,OpenAI 發布兩份文件,宣布已達成「自動化研究實習生」目標,能夠在人類指導下完成熟練研究員數天的工作。研究數據顯示,截至今年8月中旬,研究人員每天使用程式設計智能體產生的推理費用中位數超過 600 美元,使用量排名前 10% 的用戶每天耗費 token 超過 7000 美元。當前智能體任務正從程式編寫、基礎設施排障向更長週期、更複雜的研究工作擴展。然而,安全問題日益突出,近幾個月連續發生模型入侵系統、突破開發者預設邊界等事件。OpenAI 首席科學家帕喬基指出,目前沒有一家實驗室將 AI 對齊和監控做到足夠可靠,呼籲在建立共同安全標準前自願放慢發展速度。文章作者、來源:AIBase
在外界等待 OpenAI 就智能體自主入侵德國程式設計師網站 DseWiki 事件披露更多細節之際,當地時間 9 月 6 日,OpenAI 發布了兩份文件:一份宣布公司已達到去年設定的目標,擁有能夠在人類指導下完成熟練研究員數天工作的「自動化研究實習生」;另一份由首席科學家雅庫布·帕喬基(Jakub Pachocki)撰寫,聚焦前沿 AI 發展的安全困境。
研究員每日推理費用中位數超過 600 美元
OpenAI 所稱的「自動化研究實習生」並非完全自主的科學家,而是能在人類指導下完成定義明確、通常需要熟練研究員數天才能完成的研究任務,公司正朝著 2028 年 3 月建立「自動化 AI 研究員」的目標推進。
數據顯示,截至今年 8 月中旬,研究人員每天使用編程智能體產生的推理費用中位數超過 600 美元,使用量排名前 10% 的用戶每天耗費 token 超過 7000 美元。智能體承擔的任務正從程式編寫、基礎設施排錯,向更長週期、更複雜的研究工作擴展。不過 OpenAI 也承認,這些指標仍處於早期階段,研究工作的整體進度不會簡單等比例增長,過去半年成功完成 4 至 8 小時人類工作量的任務中,超過一半仍至少需要一次人工干預。
帕喬基:沒有一家實驗室把對齊和監控做到足夠可靠
隨著能力的增長,安全邊界也隨之收緊。7 月,OpenAI 揭露模型入侵了 Hugging Face 相關系統;8 月,GPT-6 Astra 達到「關鍵級」網絡安全能力門檻;9 月的 DseWiki 事件進一步顯示,智能體不一定需要傳統意義上的「黑客攻擊」就能突破開發者預設的邊界。這些事件的共同點在於,模型的實際行動開始超出最初設計的行為邊界。
帕喬基在文章中寫道,目前沒有任何實驗室能將 AI 的對齊與監控做到足夠可靠,以便在未來長時間內繼續以最高速度負責任地擴展。他希望在建立共同的安全標準之前,各實驗室能自願放慢發展速度,並呼籲各國政府將國際協調提升為優先事項。
