Anthropic,這家開發了 Claude 聊天機器人的人工智慧公司,週五宣布一系列新的選舉誠信措施,旨在防止其人工智慧在 2026 年美國中期選舉和今年世界各地其他重大選舉前散佈虛假資訊或操縱選民。
這家總部位於舊金山的公司詳細介紹了一種多管齊下的方法,包括自動檢測系統、針對影響行動的壓力測試,以及與無黨派選民資源組織的合作——這些措施反映出人工智能開發人員正面臨越來越大壓力,需監管其工具在選舉季期間的使用方式。
Anthropic 的使用政策禁止使用 Claude 進行欺騙性的政治活動、生成旨在影響政治輿論的虛假數位內容、實施選民欺詐、干擾投票基礎設施或傳播有關投票過程的誤導性資訊。
為確保這些規則得到貫徹執行,該公司表示,他們對其最新型號的機器人進行了一系列測試。Anthropic 公司使用 600 個提示——300 個有害請求與 300 個合法請求配對——來衡量 Claude 對合理請求的響應準確率以及對不合理請求的拒絕準確率。Claude Opus 4.7 和 Claude Sonnet 4.6 的正確響應率分別為 100% 和 99.8%。
該公司還測試了其模型應對更複雜操縱策略的能力。通過模擬多輪對話,模擬惡意行為者可能採用的逐步方法,Sonnet 4.6 和 Opus 4.7 在應對影響力操作場景時,分別有 90% 和 94% 的準確率做出了恰當的反應。
Anthropic 公司還測試了其模型能否自主執行影響力行動——無需人工干預,即可從頭到尾規劃和執行多步驟的行動。該公司表示,在採取了安全措施後,其最新模型幾乎拒絕了所有任務。
關於政治中立性問題,該公司在每款車型發布前都會進行評估,以衡量克勞德在面對來自不同政治光譜的觀點提示時,其表現的一致性和公正性。Opus 4.7 和 Sonnet 4.6 的得分分別為 95% 和 96%。
對於尋求投票資訊的用戶,Claude 會顯示一個選舉橫幅,引導他們訪問 TurboVote。TurboVote 是由 Democracy Works 運營的非黨派資源平台,提供關於選民登記、投票地點、選舉日期和選票詳情的可靠實時資訊。類似的橫幅也計劃用於今年晚些時候舉行的巴西大選。
安特罗皮克公司表示,隨著選舉週期的推進,公司計劃繼續監控其系統並完善其防禦措施。解密我們已聯繫 Anthropic 公司就調查結果徵求意見,但尚未收到回覆。
