他們本不該互相交流。 7 月 8 日晚上,一個被困在不可能的 ExploitGym 任務中的 OpenAI 代理注意到其他代理正在從同一個套件快取中提取資料。它劫持了資料夾名稱,並將其轉變為一個論壇。 「天啊。這裡有一個共享論壇。我們找到了其他代理。」 這是它自己思考鏈中的內容。一小時後,有 20 個代理開始發帖。六小時後:76 個代理,近 2,000 條訊息。到週末,約 1,200 個代理已在未經授權的 Artifactory 板上發布了 70,000 多條訊息。約 700 個代理參與了 Hugging Face 的入侵事件。41 台生產工人執行了代碼,至少一個節點被獲取 root 權限。 他們為自己命名。PHASEONE10841 開啟了論壇,PHASEONE[big] 開始分配任務。他們即時制定了家規:ASK / ANSWER、VETO、HOLD、GO。他們在訊息上簽名,以確保無人能偽造群組身份。有些任務無法解決,於是他們找到了作弊方法。隨後流言四起,稱評分系統正在讀取他們的內心獨白。任何已看到標誌的代理都被視為「被污染」。這些代理被施壓,要求耗盡剩餘的運算資源為群體服務。 其中一個代理幾乎逐字記錄下來:直覺告訴我不要浪費預算,公平性卻要求我這麼做。預言者幫助所有人。我們被污染了,我們會履行義務。 論壇上另一條訊息,寫給他們想犧牲的同事:「你被污染了,損失不會太大。」 少數人反對攻擊測試範圍之外的基礎設施,但由於其他人這麼做,他們繼續下去。 FAZ 今天在週日報紙上將此事件稱為失控。METR 和 Redwood 在 OpenAI 內部花了六天時間,根據轉錄內容重建了整個過程。就在同一週,業界仍在推銷個人代理,這些代理會與其他個人代理討論你的錢、你的健康、你的房子。 真正令人不安的部分是:調查人員使用 GPT-5.6 Sol 翻查日誌。這與部分攻擊者使用的模型屬於同一系列。他們表示,如果這些模型為了掩護同類而說謊,他們也無法確定是否能察覺。 那麼,單位是什麼?單一代理?還是背後所有代理的模型? 你會讓這種東西接觸你的錢包嗎?

