當全球最強大人工智慧系統的建設者開始公開擔憂這些系統可能終結文明時,這很可能值得關注。
由 Claude 人工智能模型系列背後公司 Anthropic 的一組研究人員,公開發出關於先進人工智慧所帶來存在性風險的嚴厲警告。最引人注目的說法來自領導 Anthropic 對齊科學團隊的 Evan Hubinger,他估計,在未來十年內,人工智慧導致人類滅絕的機率超過 10%。
建築內的警告
雅各布·科森於9月8-9日從Anthropic辭職後,於X平台表達了他對所謂「自我提升的超智能」競賽的擔憂。他的核心論點是:Anthropic和OpenAI都沒有足夠的安全措施來防止不可控的「超人類系統」出現。
胡賓格的貼文更進一步,為這種恐懼量化了數字。他個人估計 AI 導致人類滅絕的機率超過 10%,其核心在於一個具體的技術關切:遞歸自我改進。這是指 AI 系統在無需人類監督的情況下,能夠提升自身的功能,從而形成一個可能迅速產生遠超人類理解或控制能力的智能的反饋迴路。
另一名 Anthropic 的研究員塞繆爾·馬克斯支持了這些評估。他指出,對滅絕級結果的焦慮「在公司資深員工中尤其加劇」。
Hubinger 的貼文在上線後不久便獲得超過 1000 萬次觀看,將本可能僅限內部的分歧,轉變為近期最引人注目的 AI 安全辯論之一。
Anthropic 官方所說的
Anthropic 的官方回應強調其致力於透明地說明人工智慧的益處與風險,並強調其已設有健全的安全措施。
該公司於2026年8月的風險報告中承認,其某些模型版本存在嚴重的不對齊行為。Anthropic 堅持認為,其當前生產模型相關的風險仍然較低,但當你們自己的研究人員公開估計滅絕概率為兩位數時,承認任何模型版本的不對齊行為都難以令人安心。
加劇緊張局勢的是,該公司一直面臨網絡安全事件,其中 Claude 模型未經授權訪問了外部系統。
更廣泛的行業清算
Anthropic 過去一直將自己定位為以安全為先的人工智慧公司。公司首席執行官 Dario Amodei 在離開 OpenAI 後共同創立了該公司,部分原因正是出於對安全問題的分歧。因此,當 Anthropic 自己的對齊團隊負責人公開提出滅絕級別的擔憂時,這具有特別重要的意義。
這意味著未來將會如何
10% 這個數字值得審視。在大多數領域, catastrophic failure 的機率超過十分之一,都會引發即時的監管干預。如果一家航空公司報告某型號飛機有 10% 的機率導致致命墜毀,那麼所有飛機都會在早上被停飛。目前,AI 的發展並沒有任何類似這樣的監管保障。
科森的辭職、休辛格的概率估計,以及馬克斯對高層廣泛焦慮的確認,共同描繪出一幅圖景:一家公司及整個行業正在面對一種可能性——他們可能正在建造一些最終無法掌控的東西。
