1Password 的安全團隊進行了一項評估,使用 Linux、Chrome 等軟體中的 6 個複雜漏洞,讓 ChatGPT 5.5 和 Claude Opus 4.8 生成修補程式,最終評估了 6080 次嘗試。這項研究於 8 月 6 日發表。 結果顯示,26% 的修補程式成功修復了漏洞,且未破壞原有功能;20.1% 雖堵住了漏洞,卻破壞了程式其他行為。約一半的修補程式甚至未能修復原始漏洞,其中一些還引入了新的漏洞。 研究人員發現,面對 Spring AI 的漏洞,模型經常選擇處理攻擊樣本中的幾個特殊字元。攻擊指令雖失效,但導致漏洞的程式碼卻未被修改。更換輸入方式,風險可能再次出現。交到你手中的修補程式,看似有效且曾擋住一次攻擊,很容易讓人放鬆警惕。 「完全由大模型生成、未經人工審核的修補程式,其預期價值明顯為負」也是論文作者的判斷。他們擔心的正是這種情況:舊問題未解決,卻讓人誤以為問題已處理完畢。 我認為,若要計算 AI 編程帶來的效率提升,必須將審核、返工和事故的成本一併計入。僅計算代碼生成有多快,帳面當然好看。寫代碼的人省下來了,但能發現代碼問題的人,也準備一併省掉嗎?

