兩個月前,獨立評估機構還處於萬億美元級人工智慧行業中相對冷清的角落。如今,它們卻被要求來「救場」。
隨著 Anthropic 和 OpenAI 就如何在保障先進模型安全的同時繼續擴張業務展開激烈爭論,這兩家公司正尋求少數幾家小型第三方機構的支持,例如 Model Evaluation and Threat Research(METR)、Apollo Research 和 Transluce。
這些評估機構大多以非營利組織形式運作,在資本以前所未有的速度湧入、而新模型以前所未有的頻率推出的行業裡,仍在摸索自己的定位。它們的主要職責,是評估 AI 模型的能力和風險,並指出技術出現不當行為的情況。
在缺乏聯邦層面監管推進的情況下,評估機構的重要性被放大。Anthropic 首席执行官 Dario Amodei 上月承諾將獨立評估機構嵌入公司內部,OpenAI 首席执行官 Sam Altman 很快表示支持。美國總統唐納德·特朗普也支持這一想法,許多美國大型科技公司同樣如此。但懸而未決的問題包括:這些第三方應如何獲得資金、他們將擁有多大訪問權限,以及最終的匯報結構會是什麼樣。
布朗大學電腦科學教授 Suresh Venkatasubramanian 在接受 CNBC 採訪時表示:「問題在某種程度上還是一如既往,就是錢。誰來為這些公司支付這項工作的費用?他們要如何支持這些機構?你需要一個生態系統,你需要一個可行的商業模式。」
目前,Anthropic、OpenAI 以及從 AI 熱潮中獲利的基礎設施合作夥伴正在制定規則。批評者說,這就像讓最大的銀行來保護我們免受金融危機,或者允許製藥公司在沒有監管批准的情況下把藥品推向市場。
川普最近讚揚 AI 高管的「極其出色的自我監管」,並表示他打算將該行業交由企業自行處理,不願阻礙這個正在推動經濟和股市增長的行業。川普在 9 月底提出的一項自願協議中,鼓勵 AI 公司「與獨立的外部審計員或評估員合作」。
這場討論由 Amodei 上月發表的一篇廣為流傳的文章引發。在那篇文章中,他呼籲先進模型的開發「放慢速度」,原因是有一些研究人員離開公司,並表達了對這項技術可能帶來生存性威脅的擔憂。
隨著 AI 實驗室開始部署評估機構,摩擦已經出現。
OpenAI 一位發言人稱,公司上週解僱了三名員工,原因是他們「違反了我們關於訪問和處理敏感公司資訊的政策」。其中兩名員工 Mikita Balesni 和 Tomek Korbak 表示,他們認為自己被解僱,是因為他們與第三方評估機構溝通的方式。
Balesni 周四在 X 上發帖寫道:「我的前同事告訴我,他們對該相信什麼感到困惑。他們也害怕發聲,擔心自己的個人手機會因為與我們和第三方的訊息而被搜查。我擔心,這種普遍存在的發聲恐懼和與第三方接觸的顧慮,會讓 OpenAI 在幕後為安全問題偷工減料。」
OpenAI 否認了這一說法,並於週五在一則帖子中表示,公司正在「積極敲定與第三方安全評估員的合同,並將在未來幾週公布細節」。
OpenAI 表示:“我們致力於嵌入外部評估員,並繼續將與獨立安全組織的密切合作作為安全工作的核心部分。”
OpenAI 一位發言人在電郵聲明中表示,公司即將與評估機構開展的工作「建立在與獨立安全組織的現有合作基礎上」,其中包括 METR 和 Redwood Research。
Anthropic 未回應 CNBC 的評論請求。
我從沒見過一個問題推進得這麼快
AI 評估機構生態系統主要由 METR 和 Apollo Research 等小型組織,以及 Accenture 等較大的會計和審計公司組成。
AI實驗室一直與評估機構在有限範圍內合作,但政策非營利組織Fathom的首席執行官Andrew Freedman表示,這個領域正在迅速成熟。
Freedman 在接受 CNBC 採訪時表示:「我在政治和政策領域工作了 20 年,從沒見過一個問題能在如此多不同的政治光譜上推進得這麼快。」他表示,預計將有「大量資本湧入」這一生態系統。
獨立評估機構 Vals AI 的首席執行官 Rayan Krishnan 表示,這家營利性初創公司為衡量 AI 模型在行業特定任務上的表現建立基準,今年員工人數已從 8 人增長到約 30 人,並於 8 月宣布完成 4000 萬美元融資。
非營利組織 METR 於 8 月宣布,過去六個月已獲得約 7100 萬美元的承諾資金。根據該組織向美國國稅局提交的最新文件,這一數字高於其 2024 年全年 1360 萬美元的捐款總額。
到該月底,METR 的知名度進一步上升。OpenAI 聘請了該機構兩名員工和一名承包商,協助撰寫一份事後分析報告,詳細說明公司的模型如何逃脫控制、訪問開放互聯網,並突破開源開發者平台 Hugging Face。METR 表示,未就這項評估從 OpenAI 獲得報酬。
賓夕法尼亞大學沃頓商學院 Accountable AI Lab 學術主任 Kevin Werbach 表示,這個生態系統「目前還不夠穩固」。例如,METR 網站顯示,該機構的全職員工少於 50 人。
小型評估機構與已融資數百億美元、僱用數千人的領先實驗室之間的力量失衡,引發了有關潛在利益衝突的問題。
Venkatasubramanian 說:「如果你想要真正的第三方評估,你需要真正的財務獨立,以及其他方面的獨立。這不僅僅是不能拿錢的問題,還包括:如果我是審計員,發布了一份對這家公司不利的報告,會不會有後果?我的業務會不會因此枯竭?」
Anthropic 上月在一篇部落格文章中承認了這種複雜性。該公司宣布,將讓 Accenture 旗下專注 AI 的業務 Faculty 的員工嵌入公司,測試安全防護措施,並評估模型是否會依照人類價值觀行事。Anthropic 表示,鑑於這項工作的「重要性和緊迫性」,公司將直接資助 Accenture 的相關貢獻。
Anthropic 表示:「目前對於嵌入式評估員應接觸哪些資訊、應如何報告發現,尚無標準。獨立評估的資金安排也尚未有定論。從長遠來看,我們認為資金應來自集資或政府來源。」
Anthropic 還表示,公司正在與 METR 及其他非營利評估機構討論,這些機構計劃使用自有資金試點「嵌入式評估」的某些「要素」。
Will the government intervene?
去年6月,Fathom 提出了一套獨立驗證組織(Independent Verification Organizations,簡稱 IVOs)的市場框架。這些機構將獲得政府許可,並被授權測試 AI 公司是否滿足各種安全標準。
Freedman 表示,政府監督至關重要,否則第三方評估機構可能在收入上依賴大型 AI 實驗室,從而被激勵去“開始照單蓋章”,以維持關係。
一些立法者已經表示支持。
IVOs 是《前沿風險監督、國家透明度、獨立評估與報告》(FRONTIER)法案中的一項關鍵條款。該法案由眾議員 Lori Trahan(馬薩諸塞州民主黨)和 Jay Obernolte(加利福尼亞州共和黨)於 7 月提出。Freedman 表示,Fathom 協助起草了法案的措辭,並提供了技術支持。
OpenAI 全球事務主管 Chris Lehane 於 9 月對記者表示,他曾於國會山與該法案的一位發起人會面,以表達對 IVO 條款的支持。
據報導,Lehane 說:「對他們來說,聽到這一點、並聽到我們這樣說很重要,我們也希望把這一點說得非常清楚。」
同時,加利福尼亞州、康涅狄格州和弗吉尼亞州的立法者已採取措施推進 IVOs,而馬薩諸塞州等州則在更廣泛地考慮獨立安全評估。
加州州長 Gavin Newsom 最近簽署了兩項涉及 IVOs 的法案,其中一項建立了「全國首創的框架」,另一項則為 AI 審計員建立州級登記冊。Anthropic 在 8 月支持了這兩項法案,OpenAI 上月也正式背書了這些法案,就在 Newsom 簽署成法的同一天。
Lehane 當時在一篇部落格文章中寫道:「我們更希望聯邦層面要求獨立技術評估」,但在缺乏聯邦行動的情況下,「加州可以幫助確立規則」。
Freedman 表示,他認為像 OpenAI 和 Anthropic 這樣的公司要自行摸索如何與獨立評估機構合作,“會非常困難”。不過,在政府角色尚不明确的情況下,“這是一項值得在過渡期培養的能力”,他說。
目前,業界最接近標準的東西,是特朗普上月底在白宮為科技領袖舉辦午餐會時所稱的一份「道德約束性」協議。
這份單頁協議指出:「每家公司都有責任以安全的方式開發自己的技術,並以能夠建立客戶和公眾信任的方式推進。」協議還鼓勵簽署方與「獨立的外部審計員或評估員合作,開展獨立評估」。
這份文件由 Anthropic、Google、Meta、OpenAI、SpaceX 和 Nvidia 的高層簽署,這在彼此對 AI 風險應對意見並不一致的領導者之間,是一次罕見的團結展示。但這些高層仍需為各自的前進道路作出規劃。
Venkatasubramanian 說:「這更像是一場試圖展示行動的表演,而實際上並沒有真正發生任何行動。他們承諾要做的事情,本來就應該已經在做了,而且事實上他們過去還聲稱自己一直在做。」
Amodei 在 9 月的文章中表示,Anthropic 將為評估員提供辦公桌、門禁卡、公司筆記型電腦,以及與內部風險評估團隊「基本相當」的權限。此外,評估員還將獲得合約支持,賦予他們「發布關鍵發現的權利」,而 Anthropic 保留「有限的能力」去刪除或修改某些涉及安全或機密的資訊。
Amodei 寫道:「這對一家公司來說是不同尋常的一步,但我們認為,證明嵌入式外部審查員這一概念是重要的。」
幾天後,OpenAI 發布了自己的提案,並表示評估員應圍繞「範圍明確且雙方同意的評估主張」開展工作,清楚說明方法和標準,證明相關技術專長,並披露利益衝突。
上月,包括 METR、AI Verification and Evaluation Research Institute(AVERI)在內的 AI Evaluator Forum 發布了一封名為「嵌入評估員的最低條件」的公開信。
信中稱,評估員應保持透明,免受報復,並獲得與 AI 公司「自身高度特權員工」相當的存取權限。
信中還寫道:「嵌入式評估不能解決所有監督需求,應被視為對更廣泛努力的補充,而不是替代——這些更廣泛的努力旨在讓前沿AI公司擴大外部監督。」
Freedman 表示,近幾個月來,他看到 OpenAI 和 Anthropic 的態度發生了變化,主要是因為它們意識到,如果沒有公眾信任,就無法推出先進系統。
Freedman 說:「我不認為你需要相信他們突然變得利他了,或者除了公司像公司那樣行事之外還有別的什麼。」
Werbach 表示,這或許突顯了核心問題。OpenAI 和 Anthropic 首先是在彼此競爭,一邊推進上市,一邊追求超過 1 萬億美元的估值。
Werbach 說:“這兩家公司之間存在著巨大的個人不信任。儘管在需要開展這類評估這一點上,也有著巨大的共識。”
觀看:布拉德利·塔斯克談 Anthropic 首次公開募股:如果安全是你的最高優先事項,為何要引入公開市場的壓力?
