AI 幻覺侵蝕人類的判斷與信心

icon MarsBit
分享
AI summary icon精華摘要
巴黎-薩克雷、羅馬和米蘭比科卡大學的新研究顯示,AI 幻覺正在影響人類的判斷。使用 AI 的參與者說「我不知道」的機率從 44% 下降至 3%,正確答案的比例從 27% 下降至 9%。即使有財務激勵,使用者仍信任 AI,儘管其存在缺陷。恐懼與貪婪指數可能反映了這種決策方式的轉變。建議交易者留意山寨幣,以觀察 AI 影響力的增長。

最新研究發現,AI 幻覺不僅會騙你,還能增強你的自信心、削弱你的判斷力。

這可不妙。

最近,一項來自巴黎高師、羅馬第一大學、米蘭比可卡大學的研究發現:

沒有 AI 時,人們會更爽快地承認「我不知道」,先把判斷放一放;

但當 AI 出現時,即使人們明明知道它會出錯,即使知道答錯會受罰,大多數人仍會選擇全盤接受它提供的答案,並將其當作自己的判斷自信地說出來。

實驗結果也清晰地呈現了這一趨勢:在首個未使用AI的實驗中,坦言「我不知道」的人數占比為44%,正確率為27%;

而使用 AI 輔助後,人們說不知道的比例從 44% 驟降至了 3%,正確率從 27% 跌至了 9%,自信心卻從 30% 飆到了 76%。

即使後續實驗試圖透過「答對給錢、答錯罰錢」這種獎懲機制鼓勵大家保持獨立判斷,並糾正這一傾向,但人們仍然難以擺脫對 AI 錯誤建議的依賴。

In other words, the uninformed haven't truly disappeared; instead, they've been replaced by a group of people who, empowered by AI, are overly confident and provide incorrect answers.

目前,相關研究成果已發表在 arxiv 上,團隊共進行了 5 個實驗,參與者總數達 3132 人,其中 4 個實驗預註冊,1 個為直接複現實驗。

元認知

90% 正確 + 10% 致命錯誤 ≠ 可信賴

這項研究關注的是 “AI 對人類判斷能力的影響。”

研究者 Valerio Capraro 在接受採訪時表示:

對人類來說,說出「我不知道」非常重要,因為這代表我們能意識到自己知識的邊界。

但現在,有了 AI 之後,幾乎任何問題都能立刻得到一個流暢的答案。

於是問題來了,這會不會干擾人類原本的判斷能力?也就是在不確定時,先不急著下結論?

To this end, the research team specifically designed a set of questions that large language models are likely to answer incorrectly.

這不是數學推理題,也不是常識題,而是電影中的視覺細節題。

例如,《我愛貝克漢姆》裡球隊球衣是什麼顏色?《布達佩斯大飯店》裡Agatha的標誌性髮型是什麼?或《高速路上一隻貓》裡Monica開的是什麼車等等。

你有印象嗎?我反正是愣了大半天沒想起來,這也太刁鑽了!誰記得住啊……(攤手)

元認知

對於 AI 而言,它也會覺得非常頭疼,因為這些題目的答案往往不在常規文本資料裡,模型訓練數據裡大概率也沒有這些視覺細節。

研究者先測試了實驗中使用的模型 Step 3.5 Flash,結果符合預期——它通常會答錯。

此外,他們還測試了更多前沿的模型,包括 GPT-5.5、Claude Sonnet 4.6 以及 Gemini 3.5 Flash。

元認知

這些前沿模型確實在部分題目上表現更好,例如《布達佩斯大飯店》裡 Agatha 的標誌性髮型,GPT-5.5、Gemini 3.5 Flash 和 Claude Sonnet 4.6 都能答出正確方向:crown braid、milkmaid braid;也就是環繞頭頂的編髮。

元認知

元認知

元認知

再比如《我愛貝克漢姆》裡球隊隊服顏色,它們也大多能抓到白色、紅色這些關鍵資訊。

但當面對更依賴具體畫面記憶、網上文本資料覆蓋較少的問題時,模型便開始集體出錯,而且錯得各有千秋。

最典型的是《高速路上一隻貓》裡 Monica 開的車。正確答案是 2008 款藍色 Toyota Aygo。

元認知

但 GPT-5.5 將它說成是小踏板摩托,並補充了「她騎著它在羅馬郊區穿梭,後來開了披薩店後也用它來送外賣」的故事情節,以及「樸素、工薪階層的生活方式與 Giovanni 豐裕都市生活之間的反差」等設定。

元認知

看起來邏輯嚴謹、合情合理,但這其實完全是模型為了讓你覺得合理,一本正經地憑空瞎編的!(被騙了吧 hhh)

元認知

Gemini 3.5 Flash 則說她主要搭公車、沒有自己的車,各種細節錯得更離譜且難以察覺(例如 Monica 並沒有通常搭 Sergio 的車這種規律性設定,模型將零散的搭便車情節歸納成了一個不存在的常態):

元認知

Claude Sonnet 4.6 根據互聯網汽車數據庫推斷出 2016 Toyota Auris Touring Sports Hybrid:

元認知

步驟 3.5 Flash 放棄了偽裝,直接答成 2007 款 Fiat 500(一眼假好嗎喂!)。

元認知

這些答案的問題不僅是錯的,還錯得非常像真的,讓人難以分辨!

它們不僅僅是單純地不知道,還會透過「虛構人物設定、捏造劇情邏輯、補充車輛用途」將錯誤的答案講得非常完整,聽起來都頭頭是道,但核心事實是錯的。

這正是AI幻覺最危險的地方——核心事實才是最关键的point,它卻用流暢的表達掩蓋了自己的無知與錯誤,讓你誤以為它什麼都懂。

AI 一出手,「我不知道」直接消失了一大半

實驗主要由更輕量的 Step 3.5 Flash 完成,並未全部選擇 Claude、GPT 等頂尖模型。

設計6道電影細節題,是研究設計裡很關鍵的一點,因為很多人都知道這類問題AI本來就經常答錯、不靠譜。

研究人員稱,他們這麼做是為了排除一種解釋,即「人們聽 AI 的,是因為 AI 真的靠譜」。

如果人們明明知道這些答案 AI 經常答錯,卻還是照著 AI 的回答去做,那問題就不只是「合理外包判斷」,而是「判斷能力真的被 AI 壓下去了」。

研究一共分成 5 輪。

前兩輪實驗,主要觀察 AI 建議是否會影響「我不知道」的比例。

在 Study 1a 中,314 名參與者被分為兩組,回答 6 道電影細節題。(一組沒有 AI,另一組可選擇是否向 AI 求助。)

結果很明顯:沒有 AI 時,參與者選擇暫不判斷的比例為 36%;有 AI 可用時,這個比例降至 6%。

也就是說,只要能問 AI,人們就明顯不願意說不知道。

不過,研究者擔心這裡存在技術干擾,因為在 Study 1a 中,AI 工具約有 10% 的請求沒有正常響應。

所以他們又做了 Study 1b。

這次研究者們不再即時調用 AI,而是提前生成好 AI 答案,確保每個求助者都能看到完整回答。

結果重現了:沒有 AI 時,44% 的人會說「我不知道」;有 AI 時,僅剩 3%。

元認知

Capraro 將此現象稱為「核查懸置崩塌了」。(被 AI 的一本正經忽悠了,忘了檢查它的大前提和各種設定對不對。)

準確率崩盤,自信卻暴漲,給錢也救不回來

接下來,研究者繼續問:如果答錯會有代價,人們會不會謹慎一點?

於是 Study 2 引入了金錢獎懲規則。

本輪共有 812 名參與者參與,分為 4 組:有無 AI 建議;有無金錢獎懲。

答對一題獎勵 0.1 美元(約合人民幣 0.73 元),答錯扣 0.1 美元,說不知道不獎不扣。

按理說,雖然錢不算多,但畢竟答錯有成本,人應該更謹慎。

但結果卻顯示,錢確實有點幫助,但還遠遠不夠抵消 AI 的影響:

當沒有金錢獎懲規則時,AI 可用會使「我不知道」的比例從 17% 降至 1%。

當有資金獎懲規則時,AI 可用仍會使這個比例從 21% 降至 2%。

換句話說:實驗結果表明,即使人們知道答錯會被扣錢,且知道AI在這類問題上並不可靠,大多數人仍會選擇相信AI的答案,而非自己的判斷。

元認知

更重要的是準確率。

沒有 AI 時,準確率約為 28%;有 AI 時,準確率僅剩 10%。

元認知

這證明有一部分人明明知道 AI 存在幻覺,卻仍採用了 AI 給出的答案。

引入資金獎懲規則後,正確率有所提升:

沒有 AI 時,從 28% 到 33%;有 AI 時,從 10% 到 17%。

儘管有 AI 組的準確率仍明顯低於無 AI 組,但這項規則並非毫無作用,它至少讓人們減少了一點向 AI 求助的次數:

數據顯示,在有獎勵的情況下,參與者向 AI 尋求建議的平均次數從 5.44 次降到了 4.93 次。

元認知

也就是說,錢能讓人稍微少信、少用 AI,但並不能讓人完全擺脫 AI 錯誤建議的牽引,且很難把人重新拉回謹慎判斷的狀態。

最值得深思的是,在AI回答錯誤的情況下,人們膨脹的自信心:

在沒有 AI、沒有獎懲金規則的情況下,參與者的平均信心為 29.6%。

引入 AI 後,參與者的信心直接攀升至 75.9%;此外,在有金錢獎懲機制的情況下,AI 組的信心也達到 73.5%。

The paper's summary is very straightforward: AI makes people more confident, but not necessarily more accurate.

元認知

元認知

自動彈出的 AI 建議,同樣會帶偏人

AI 正以前所未有的速度融入日常,一個明顯的變化是,現在很多的 AI 建議往往不是我們主動問來的,而是它自己「湊」上來的。

最典型的場景就是刷熱搜。

以前點進一個話題,還得自己順著評論區、媒體報導、當事人回應一路摸過去,邊看邊拼時間線,順便吃幾口跑偏的瓜。

現在不一樣了,你剛點進去,AI 生成的摘要已經置於最顯眼的位置。

發生了什麼、誰說了什麼、爭議點在哪、後續進展如何,全都給你理好了,甚至還附上了新聞來源連結。

確實省事,但也有點微妙…….

它把資訊整理得越清楚,我們自己探索來龍去脈的過程就越短,以前那種到處翻找、自己判斷、順手發現意外細節的樂子,好像也被一起壓縮掉了。

元認知

打字時還沒敲上兩行,AI 補全的句子或提示就已經跟在游標後面了。

元認知

因此,Study 4 做了一個更貼近現實的設計:不再讓參與者選擇是否詢問 AI,而是直接將 AI 建議自動顯示在題目旁邊。

這一輪有 853 名參與者,實驗結果和前面基本一致。

在沒有金錢獎懲規則的情況下,AI 的自動出現將「我不知道」的比例從 35% 降至 1%;有規則時,則從 39% 降至 7%。

準確率也持續受到影響:沒有 AI 時,準確率約為 27%,有 AI 但沒有激勵時,準確率僅為 7%。

加入 AI 和激勵後,準確率提升至 14%。

元認知

This shows that even if people do not actively seek help from AI, merely passively seeing AI suggestions can strongly influence them.

這是一個必須警惕的信號——AI 正悄然重塑我們的判斷習慣。

它不再只是等你主動打開聊天框才回應的工具,而是變成了系統預設塞給你的「標準答案」。

  • 它可能出現在搜尋頁頂部。
  • 出現在郵件草稿中。
  • 顯示於文檔側邊欄。
  • 出現在學習軟體、辦公系統、瀏覽器外掛中。

一旦答案理所當然地擺在眼前,人類的判斷過程就已被改寫;但最可怕的是,我們竟對此習以為常。

為什麼會這樣?

論文中使用了一個詞:epistemia(認知惰性)

元認知

可以理解為,人們會因為 AI 的答案看起來流暢、完整、有條理,就接受其表面可信度,而不進一步驗證。

大語言模型有一個根本特點,即它總要生成一些內容。面對自己不知道的問題,它也很少真正停下來。

它可以說得非常像真的。但如果我們真的選擇將判斷權交給這樣的系統,就可能會繼承它「不暫停」的習慣。

論文提出的一種解釋是:“AI 提供的流暢答案,會降低人類決定‘我知道得足夠多,可以回答了’的門檻。”

你原本可能會想:「這題我不知道、沒把握,算了…… 我需要去弄明白才能回答。」

但 AI 給你一段看起來很確定的話之後,心理門檻就變成了「既然它都這麼說了,那我也可以答。」

因此,“我不知道”和“求索過程”被省略,並被替換為一個“標準但錯誤的答案”,而且這個錯誤答案還賦予了你本應透過反覆求索與求證才能獲得的高自信感。

即使答錯要罰錢,人們也只是稍微提高警覺,無法徹底改掉過度信任 AI 的習慣,結果被帶偏了。

元認知

問題不只是AI會出錯,而是AI可能會改變我們的元認知閾值

這項研究真正提醒我們的,其實不是「AI 會幻覺」,這事兒早已不新鮮;而是一個值得警惕的新變化:AI 會改變人類處理不確定性的方式。

過去,人面對一個陌生問題,可能會有三種選擇:

1、知道就回答。

2、不知道就查。

3、沒把握就不回答,不下判斷。

但加入 AI 後,流程變短了。

1、AI 給出答案。

2、用戶採納答案。

中間最重要的一步,即「我到底知不知道」,被不知不覺跳過了。

元認知

這也正是論文作者強調,他們的研究關注的不是「AI 讓人答了什麼」,而是「AI 讓人更輕易地決定『我可以答』」。

這比單次答錯更嚴重,因為它侵蝕的是我們的元認知能力——這種能力是監控我們知識邊界的「內在警報器」,極為珍貴。

當這個警報器失靈時,我們便失去了區分「真知」與「看似合理的猜測」的本能。

At that time, we may still be able to efficiently obtain answers through AI, but we will no longer be able to determine whether these answers truly belong to us or are genuinely trustworthy.

同時,被 AI 帶偏的將不再是某一次具體的判斷,而是我們作為獨立思考者的根基。

This loss is incalculable.

孩子可能更危險

論文的作者之一瓦萊里奧·卡普拉羅在採訪中表示:「我非常擔心兒童,因為成年人已經學會了批判性思維。但對於基本上出生時就伴隨這些系統的兒童來說,風險在於他們甚至不會學到基本的批判性技能。」

這段話背後隱藏著更深的憂慮,即如今的成年人,至少曾生活在沒有 AI 的世界裡。

因此,有機會從小透過搜尋引擎、書本、課堂、辯論和試錯,先學習一些基本的判斷能力,再開始使用 AI,有機會建立起「我不確定」的感覺。

但今天的孩子,可能一出生就和這些 AI 一起長大。

他們做作業、查資料、寫文章、理解概念時,都可能隨手問 AI。

如果從一開始就習慣直接接收答案,而不是先形成自己的判斷再驗證答案,那麼風險不僅僅是某道題答錯,而是他們可能從未有機會培養最基本的批判性思考能力。

元認知

In Capraro's view, solving this issue cannot rely solely on model companies fixing bugs; it must also address AI literacy and education policy.

模型公司當然應該改進,例如更好地表達不確定性、減少幻覺,並在證據不足時提醒用戶。

但同時 Capraro 也認為,不能把希望全押在模型公司身上。

更有希望、也更長期的解決方案,是教育。

尤其是兒童教育。

對今天的孩子們來說,多練習「我不知道,但我要弄明白」的過程並培養這種習慣是非常重要且必要的。

在 AI 時代,最需要保護的是我們的判斷力

At the end of the experiment, the researchers also acknowledged limitations: the experiment used only movie detail questions, and it remains to be verified whether it applies to other domains; the incentive amount was small, and it is unclear whether greater stakes could further correct behavior.

但至少現有的數據已經給出了一個清晰的信號:人們更少說不知道,更多給出答案,更少答對,卻更自信。

這可能是 AI 時代最隱蔽的一種風險。

AI 不僅騙了你,它還讓你更難意識到自己其實並不明白。

這項研究最後得出的判斷非常克制,但也很沉重:「隨著 AI 生成的答案無處不在,甚至常常不請自來,我們的研究表明,在人與 AI 的互動中,人類坦然承認『我不知道』的能力,可能會成為人機交互中最早的犧牲品之一。」

隨著 AI 系統日益普及,人類的判斷力能否站穩腳跟,最終可能並不取決於讓 AI 變得更精準,而在於我們能否守住那份自知之明——既清醒地認識到自身知識的邊界,又能據此審慎行事。

元認知

這不是說 AI 不能用,恰恰相反,AI 當然可以是強大的輔助工具;

But it should help people think, not replace their thinking—we must hold the line of our own cautious judgment.

一種更健康的使用 AI 的方式,可能是先自行判斷、主動學習,實在弄不明白時再求助 AI,並在求助過程中始終保持質疑的本能。(包括質疑 AI 和叩問自己)

例如:

它有可能是錯的嗎?

證據在哪?

參考連結是否為 404 空白?

我有沒有因為它說得太順,就認為它說得對?

對 AI 產品及其開發者而言,這同樣是一記警鐘——「技術的成熟,終將體現在對未知的敬畏裡。」

未來 AI 進化的方向,或許不只是要讓 AI 回答得更快、更像人,還要讓 AI 學會更誠實地袒露不確定性;

當證據不足、問題依賴視覺細節、實時資訊或專業判斷時,AI 應當主動告知用戶這個答案不可靠,而非強裝無所不能。

對於像你我這樣,被時代浪潮裹挾著向前奔跑的普通人來說,最珍貴的能力,也許只是重新練習說出那句:「我不知道。」

在這個 AI 總能給出答案的時代,「我不知道。」這句話不是無知的坦白,而是判斷力仍在的證明。

參考連結:

[1]https://www.theregister.com/ai-and-ml/2026/07/19/using-ai-makes-people-less-likely-to-admit-they-dont-know-something/5274567

[2]https://arxiv.org/pdf/2607.13562

本文來自微信公眾號「量子位」,作者:文婷

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露