Google 推出 Science One 框架以打擊 AI 研究造假

iconMetaEra
分享
AI summary icon精華摘要
Google 於 2026 年 7 月 30 日基於 MetaEra 推出 Science One 框架,以應對 AI 研究造假問題。該框架使用 Chain-of-Evidence(CoE)將每個結論與可驗證的來源、代碼和實驗相連結,實現了零幻覺引用和完全可重現的結果。在內容生成過程中整合了即時證據收集。該系統在 MLE-Bench 和 Parameter-Golf 上表現出色。Google 表示,Science One 是一個實驗性原型,尚未適用於生產環境。此 AI + 加密貨幣新聞更新重點關注研究完整性方面的鏈上新聞發展。
Google Research 於 2026 年 7 月 30 日公布 Science One 框架,核心是一套叫 "Chain-of-Evidence" (CoE) 的機制,讓 AI 做科研的每一句結論都必須綁定出處、代碼和實驗記錄。

文章作者、來源:0x9999in1,ME News



簡而言之

  • Google Research 於 2026 年 7 月 30 日公布 Science One 框架,核心是一套叫 "Chain-of-Evidence" (CoE) 的機制,讓 AI 做科研的每一句結論都必須綁定出處、代碼和實驗記錄。
  • 現有 AI 科研系統的老毛病很嚴重:捏造引用、無法複現的分數、方法描述與代碼不符。基線系統的幻覺引用率最高達 21%,分數可複現率低至 42%。
  • Science One 的成績為:引用零幻覺,分數驗證全對,方法與代碼一致率最高。據披露,其生成的 337 條引用全部真實,12 項可複現實驗全部對上,15 篇論文中 14 篇與代碼一致。
  • 關鍵設計是「邊生成邊取證」,而不是「寫完再補引用」。引用來自 Semantic Scholar API 的真實檢索,而非模型記憶。
  • 更重要的判斷:Science One 沒有為了「誠實」犧牲「能幹」。它在 MLE-Bench 上獲得 2 金 2 銀,在 Parameter-Golf 上創下當時的最佳成績。
  • 這件事真正的意義,不在於又一個 AI 能寫論文,而在於它首次將「可驗證」作為架構的地基,而非事後的補丁。

先問一個扎心的問題:AI 寫的論文,你敢信嗎?

In the past two years, AI research systems have made astonishing progress.

它能閱讀文獻。能提出假設。能運行實驗。能從頭到尾寫出一篇結構完整、語氣專業的論文。你掃一眼,挑不出毛病。

但問題就藏在這個「掃一眼」裡。

掃一眼沒問題,深挖一下呢?

Google Research 專注於深入探討這件事。他們將五套主流的自主科研系統拿出來,在五項系統優化任務上共生成了 75 篇論文,並逐一質疑:你引用的這篇文獻,真的存在嗎?你報告的這個分數,重新運行代碼後還能對得上嗎?你說你使用了某種算法,代碼中真的這麼寫了嗎?

結果不好看。

每一套基線系統,都至少犯了一種系統性的錯誤。幻覺引用率最高達 21%——也就是說,每五條引用中可能就有一條指向一篇根本不存在的論文。分數驗證的通過率低至 42%。方法和代碼的一致性在 20% 至 80% 之間波動。

你好好想想這個 42%。超過一半的論文,所報告的成績,用代碼重新運行都無法復現。

這不是小 bug。這是信任的崩塌。

因為科研這件事,底層邏輯就是「可重現」和「可追溯」。一篇論文的價值,不在於它讀起來多順暢,而在於別人能否根據它的引用、代碼和數據,一步步追溯回來,確認它沒有說謊。AI 把論文的「表面品質」拉滿了,卻抽走了最底層的這根支柱。

表面越光鮮,問題越隱蔽。這才是最危險的地方。

Google 的答案:不靠信任,靠鎖鏈

Science One 的思路,說白了很樸素。

既然不能信任 AI 會自覺誠實,那就別指望它自覺。給它套上鎖鏈。

這條鎖鏈,就是「證據鏈」(Chain-of-Evidence)。

Google 為它找到了一個極其精準的類比:在資料庫領域有一個概念叫 ACID,它不關心你的資料庫如何構建,只規定一筆交易要「可靠」必須滿足哪些性質。證據鏈也是如此。它不規定你如何構建一個科研 agent,只規定:你產生的每一個成果,若想被信任,必須滿足什麼條件。

One principle, two halves.

第一半稱為完整性:論文中的每一句聲明——不論是引用、數字、方法描述,還是最終結論——都必須附有經過記錄的證據鏈。

第二半叫正確性:這條鏈,得真的能撐住它掛的那句話。

簡單來說:你說的每一句話都必須有來源;而且這個來源必須能真正證明你說的話。

那該如何落實?關鍵在於時機。

現有的系統是怎麼運作的?先洋洋灑灑寫出一篇論文,寫完再回頭補引用、補證據。這就像先編好一個故事,再去找證據來圓它。圓不起來的地方,就只能繼續編造。幻覺引用就是這樣來的。

Science One 則相反。它在「生成這句話的那一刻」,就同時建好了證據鏈。聲明與證據是共同生長的,而非事後縫合的。

這一個先後順序的調換,是整件事的靈魂。

拆開看:三個模組,各管一段謊

Science One 的架構分為三部分,每一部分都精準地遏制了某種造假的可能性。

第一塊,問題調查員,負責處理引用造假。

它不依賴模型的「記憶」來引用文獻。模型記憶是幻覺的溫床——它會「記得」一篇實際不存在的論文。Science One 直接接入 Semantic Scholar API,以構建真實的引文圖譜,每個主題最多讀取 100 篇全文 PDF,生成一份結構化的研究簡報。最終論文中的每一條引用,均源自此次真實的 API 檢索,徹底切斷對模型記憶的依賴。

引用不是「想」出來的,是「查」出來的。這一刀下去,幻覺引用的根就斷了。

第二塊,發現引擎,管的是實驗記錄造假。

它採用並行的「探索—利用」策略,在多條分支上同時嘗試解決方案。每輪中,一個 Solver 執行方案,一個專門的評估器進行打分。表現優異的分支會反覆優化,而所有原始的評估輸出都會被記錄在一份嚴格的唯讀日誌中。

只讀。這兩個字很重要。原始成績一旦記下,就不能改。後面寫論文時想報個更漂亮的分數?對不起,賬本在這兒,改不了。

第三塊,論文寫手兼聲明核查員,負責處理方法與代碼不一致的問題。

在真正渲染出論文之前,它會先將每一個事實性聲明結構化,為每句話加上內聯證據標籤,並綁定到工作區中的某個具體產物上。然後,一名專門的核查員會將每句聲明與其聲稱的來源進行比對。

如果對不上怎麼辦?這裡有個細節特別巧妙。它不是簡單粗暴地刪掉,而是「往回收」—— 把話說得保守一點,讓它重新落回證據能支撐的範圍。證據能撐到哪,話就說到哪。

不誇張,也盡量不浪費。這種分寸感,比一刀切更高級。

成绩单:誠實的代價,是不是變笨?

到這兒,一個尖銳的質疑就該冒出來了。

給 AI 套這麼多鎖鍊,讓它每句話都戰戰兢兢地找證據,它是不是就不敢大膽探索了?是不是為了「誠實」,把「能幹」給犧牲了?

這個擔憂非常合理。這也是所有「安全」和「能力」之間的經典矛盾。

Science One 的回答是:沒有。

先看誠實這一欄。在同樣一套審計協議下——Google 稱之為 CoE Audit,一個類似法醫的自動審查工具——會將每一條引用與實時學術數據庫進行核對——Science One 在四項完整性檢查中全部領先。它的引用零幻覺,每一條都指向一篇真實且可檢索的論文;分數驗證達至完美;方法與代碼的一致率也最高。根據披露的數據,它生成的 337 條引用全部真實,12 項可複現實驗的結果全部吻合,15 篇論文中已有 14 篇與實際代碼一致。

對照一下基線裡那些「混合神經符號求解器」之類唬人的名字——聽起來高大上,扒開代碼一看,就是個簡單的確定性啟發式規則。名字是給人看的,代碼才是真相。

再看能幹這一欄。

在 ADRS 基準的五項任務上,Science One 追平或超越了人類專家的水平,其中兩項(Cloudcast 和 EPLB)拿到了所有系統裡的最好成績。

跳出這個圈子,它還挑戰了更艱難的外部任務。在 MLE-Bench 的五場硬核 Kaggle 競賽中,涵蓋醫學影像、細粒度識別和 3D 感知,它贏得了 2 枚金牌和 2 枚銀牌——其中在 3D 目標檢測賽事中,其他系統全軍覆沒,而它獲得了冠軍級分數。在 Parameter-Golf 這項對硬體和檔案大小有嚴格限制的即時 LLM 訓練競賽中,其他系統甚至無法提交有效結果,而它不僅嚴格遵守所有限制,還創下了截至 2026 年 4 月 27 日的最優成績,且是透過發現真正創新演算法技巧達成,而非僅靠調參僥倖。

所以答案很明確:誠實,沒有讓它變笨。

這正是我最看重的一點。如果 Science One 是靠「縮手縮腳」換來的乾淨,那它毫無價值——因為沒有人會使用一個又笨又誠實的科研工具。但它證明了,可驗證性與高性能可以同時兼得。這才讓「把誠實當成硬性約束」這件事,從道德倡議變成了工程上划算的選擇。

我的判斷:它很重要,但別急著將它神化

說了這麼多好話,得潑兩盆冷水。

第一盆:Google 自己在文末寫得明明白白,Science One 是一個實驗性的研究原型,不是能直接上生產的工具。

這不是謙虛,這是界限。它執行的五項任務,屬於系統優化之類「有明確評估器、可自動打分」的領域。換句話說,好壞能被機器客觀判定。但真正的前沿科研呢?許多假設的價值、許多結論的意義,短期內根本沒有任何評估器能給你打分。證據鏈能防住「偽造引用」,卻防不住「選擇了一個平庸的問題」。它管的是誠實,管不了品味。

第二盆:證據鏈本身也有成本。每個主題閱讀 100 篇 PDF,每句話建立證據、綁定標籤、再核對一遍——這套流程不便宜。它在追求真相的同時,也在消耗算力和時間。規模化推廣時,這筆賬怎麼算,現在還沒有答案。

But after pouring out these two basins of water, I still believe this is an underappreciated matter.

為什麼?

因為它改變了提問的方式。

過去兩年,所有人都在問:AI 能不能做科研?能做到多強?大家比的是解題能力,是刷榜的分數。Science One 提出的問題是另一個維度的:AI 做出來的科研,能不能被信任?

這兩個問題,不在同一條賽道上。

當越來越多的系統都能做出漂亮的解法,解題能力就不再是區分度了。到那時候,真正把它們分出高下的,是它們的產出能不能被信任。Google 把「可驗證」提到了「一等公民」的高度,說它必須是架構級的約束,而不是事後的補救——這個判斷,我認為是對的,而且來得正是時候。

因為信任這東西,積累起來很慢,崩塌卻很快。如果 AI 科研在早期就靠一堆看似光鮮、實則漏洞百出的論文透支了整個學術共同體的信任,那後面再想挽回,代價會大到無法承受。Science One 所做的,是在信任還未崩塌之前,先將地基裡的鋼筋補上。

尾聲

回到開頭的那個問題:AI 寫的論文,你敢信嗎?

在 Science One 之前,誠實的答案是——不太敢。它寫得越好,你越該多留個心眼。

Science One 沒有讓 AI 變得更聰明。它做的是另一件更樸實、也更困難的事:讓 AI 學會為自己說的每一句話,留下能被檢驗的證據。

聰明的 AI 已經夠多了。

對自己負責的 AI,才剛剛開始。

這一步不大,是個原型,還有一堆未解決的問題。但方向對了。有時候,一件事真正的分量,不在於它當下能跑多快,而在於它把標尺立在了哪兒。

Science One 將評判標準,從「寫得像不像」,移至「經不經得起查」。

這一下挪動,很值得。

參考資料

  1. Google 研究部落格。《Science One 框架:透過證據鏈實現可驗證的自主研究框架》,2026年7月30日。
  2. Google Cloud AI 研究。arXiv:2605.26340《Science One Framework / Chain-of-Evidence》論文。
  3. AlphaSignal.《Google's Science One Framework Fixes AI Research's Fake Citation Crisis》, 2026年7月.
  4. 至頂網。《Science One 框架:基於證據鏈的可驗證自主科研系統》,2026年7月31日。
  5. Sakana AI. arXiv:2504.08066 《The AI Scientist v2》(對比基線).
  6. OpenAI。GitHub 項目《Parameter-Golf》基準。
  7. arXiv:2410.07095《MLE-Bench》基準論文。
  8. arXiv:2510.06189《Automated Design of Research Systems (ADRS)》基準。
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露