Google、AI研究の捏造に対抗するためにScience Oneフレームワークを開始

iconMetaEra
共有
AI summary icon概要
Googleは2026年7月30日、AI研究の捏造に対応するためにMetaEra上にScience Oneフレームワークを公開しました。このフレームワークは、Chain-of-Evidence(CoE)を使用して、すべての結論を検証可能なソース、コード、実験にリンクします。偽の引用はゼロで、完全に再現可能な結果を達成しました。リアルタイムでの証拠収集がコンテンツ生成中に統合されています。このシステムはMLE-BenchとParameter-Golfで高いスコアを記録しました。Googleは、Science Oneを実用段階ではない実験的なプロトタイプであると述べています。このAI+暗号通貨ニュース更新は、研究の整合性に関するオンチェーンのニュース動向を強調しています。
Google Researchは2026年7月30日、Science Oneフレームワークを発表しました。その核心は「証拠チェーン」(Chain-of-Evidence, CoE)と呼ばれるメカニズムで、AIが科学研究を行う際のすべての結論に、出典、コード、実験記録を必ず紐づけるものです。

記事作成者、出典:0x9999in1、ME News



要約

  • Google Researchは2026年7月30日、Science Oneフレームワークを発表しました。その核心は「証拠チェーン」(Chain-of-Evidence, CoE)と呼ばれるメカニズムで、AIが科学研究を行う際のすべての結論に、出典、コード、実験記録を必ず紐づけるものです。
  • 現在のAI研究システムには、従来の問題が根強く残っている:引用の捏造、再現不可能なスコア、手法の説明とコードが一致しない。基線システムの幻覚引用率は最大21%に達し、スコアの再現率は42%まで低下している。
  • Science Oneの成績は、引用の幻覚なし、スコア検証すべて正解、方法とコードの一致率が最高である。開示によると、生成された337件の引用はすべて実在し、12の再現実験はすべて一致し、15本の論文のうち14本がコードと一致している。
  • 重要な設計は「書き終えてから引用を追加する」のではなく、「生成しながら証拠を収集する」ことです。引用はモデルの記憶ではなく、Semantic Scholar APIによるリアルな検索結果に基づいています。
  • より重要な判断:Science One は「誠実さ」のために「能力」を犠牲にしていない。MLE-Bench で金メダル2つ、銀メダル2つを獲得し、Parameter-Golf では当時の最良成績を記録した。
  • この出来事の真の意味は、また一つのAIが論文を書けるようになったことではなく、それが初めて「検証可能」をアーキテクチャの基盤として扱い、後からのパッチではなくした点にある。

まず、心に刺さる質問を一つ:AIが書いた論文、信じられますか?

この2年間、AI研究システムの進歩は驚異的だ。

文献を読める。仮説を立てられる。実験を実行できる。構造が整い、プロフェッショナルなトーンの論文を一貫して書き上げられる。一瞥しただけでは、どこにも問題が見つからない。

しかし、問題はこの「一瞥」の中に隠れている。

一見すると問題なさそうですが、深く掘り下げてみるとどうでしょうか?

Google Research はこの点を深く掘り下げました。彼らは5つの主要な自律研究システムを抽出し、5つのシステム最適化タスクで合計75本の論文を生成し、それぞれについて厳密に検証しました:引用した文献は本当に存在するか?報告されたスコアはコードを再実行しても一致するか?特定のアルゴリズムを使用したと主張しているが、コードには本当にそのように記述されているか?

結果が良くありません。

すべての基準システムは、少なくとも一種のシステム的エラーを犯している。幻覚引用率は最大21%に達し、5つの引用のうち1つは存在しない論文を指し示している可能性がある。スコア検証の合格率は42%まで低下している。手法とコードの一貫性は20%から80%の範囲で変動している。

この42%を考えてみてください。半数以上の論文で報告された結果を、コードを再実行しても再現できません。

これは小さなバグではありません。信頼の崩壊です。

研究という行為の基盤には「再現性」と「追跡可能性」がある。論文の価値は、読みやすさではなく、他の研究者がその引用やコード、データに従って一歩一歩戻っていき、その主張が嘘でないことを確認できるかどうかにかかっている。AIは論文の「表面的な品質」を高めた一方で、最も基本的な柱を抜き去ってしまった。

表面がどれほど輝いて見えても、問題はそれだけ隠蔽されている。それが最も危険な点である。

Googleの答え:信頼ではなく、チェーンに依存する

Science Oneの考え方は、言い換えればとても単純である。

AIが自発的に誠実であることを期待しないでください。それには鎖をつけてください。

この鎖は「証拠鎖」(Chain-of-Evidence)です。

Googleは、これに非常に正確な類比を示した:データベース分野にはACIDという概念があり、データベースの構築方法には関係なく、1つのトランザクションが「信頼できる」ために満たすべき性質を定めている。証拠チェーンも同様である。科研エージェントの構築方法を規定するのではなく、生成するすべての成果が信頼されるために満たすべき条件を定めている。

一つの原則、二つの半分。

第一の半分は整合性:論文内のすべての主張——引用、数字、方法の説明、または結論のいずれであっても——は、文書化された証拠のチェーンと結びついていなければならない。

第二半叫正确性:このチェーンは、それに掲げられた文を本当に支えられるものでなければならない。

つまり、あなたが言うことすべてに根拠が必要で、その根拠は実際にその言葉を裏付けるものでなければならないということです。

では、どのように実行するのでしょうか?鍵はタイミングです。

現在のシステムはどのように動作しているか?まず論文を長々と書き上げ、その後で引用や証拠を補う。これは物語を先に作り上げ、その後でそれを裏付ける証拠を探すようなものだ。裏付けが取れない部分は、ただ作り上げるしかない。これが幻覚的な引用が生じる理由である。

Science Oneは逆である。この文を生成した瞬間に、証拠チェーンも同時に構築される。主張と証拠は後から縫い合わせるのではなく、一緒に育つものである。

この順序の入れ替えが、この出来事の本質である。

分解来看:三個模塊,各自負責一段謊言

Science Oneのアーキテクチャは三つの部分で構成され、それぞれが偽造の可能性を正確に抑えています。

第1部は、引用の偽造を担当する問題調査員です。

それはモデルの「記憶」に頼って文献を引用しません。モデルの記憶は幻覚の温床であり、実際には存在しない論文を「記憶」してしまうことがあります。Science One は直接 Semantic Scholar API に接続し、リアルな引用ネットワークを構築します。各トピックについて最大100篇の全文PDFを読み取り、構造化された研究要約を生成します。最終論文内のすべての引用は、このリアルなAPI検索に基づいており、モデルの記憶への依存を完全に断ち切っています。

引用は「思いつく」ものではなく、「調べる」ものである。この一撃で、幻覚的な引用の根が断たれる。

第二のブロックは、実験記録の不正を管理するエンジンです。

並列の「探索—活用」戦略を用いて、複数の分岐上で同時に解を試行します。各ラウンドでは、1つのSolverが方案を実行し、専用の評価器がスコアを付与します。優れた分岐は繰り返し洗練され、すべての初期評価出力は、厳格な読み取り専用の記録に組み込まれます。

読み取り専用。この二文字が重要です。元の成績が記録されると、変更できません。後で論文を書くときに、もっと良い点数を報告したい?残念ですが、帳簿がここにあります。変更できません。

第3ブロックは、論文執筆者兼声明検証者で、手法とコードの不一致を管理しています。

論文が実際にレンダリングされる前に、すべての事実的な主張を構造化し、各文にインラインの証拠ラベルを付与して、ワークスペース内の特定の成果物にバインドする。その後、専用のチェック担当者が、各主張をその主張が示す出典と照合する。

対応できない場合はどうすればよいでしょうか?ここには非常に巧妙な細部があります。単純に削除するのではなく、「引き戻す」のです—言葉を控えめにし、証拠が裏付ける範囲内に再び収めるのです。証拠がどの程度支えられるかに応じて、その分だけ言葉を発するのです。

吹かず、なるべく無駄にしない。この加減が、一括処理より洗練されている。

成績表:正直さの代償、バカになったのか?

ここで、鋭い疑問が浮かび上がるはずだ。

AIにこれほど多くの制約を課して、毎回の発言で証拠を慎重に探させると、大胆な探求をためらってしまうのではないだろうか?「誠実さ」のために「能動性」を犠牲にしていないだろうか?

この懸念は非常に合理的です。これは「セキュリティ」と「能力」の古典的な矛盾です。

Science Oneの回答は:いいえ。

まず「誠実性」の項目を見てみましょう。同じ監査プロトコル(GoogleはこれをCoE監査と呼び、法医的性質を持つ自動チェックツール)のもとで、各引用がリアルタイムの学術データベースと再照合されます。その結果、Science Oneは4つの整合性チェックすべてで最上位を記録しました。引用には一切の幻覚がなく、すべてが実在し、検索可能な論文にリンクされています。スコアの検証は完璧であり、手法とコードの一致率も最高です。開示されたデータによると、Science Oneが生成した337件の引用はすべて実在し、12の再現可能な実験結果はすべて一致し、15本の論文のうち14本が実際のコードと一致しています。

基線にある「混合神経符号ソルバー」などの威圧的な名前と比べてみよう——聞こえは立派だが、コードを開いてみれば、単なる単純な決定論的ヒューリスティックルールに過ぎない。名前は人を欺くためのもので、コードが真実だ。

もう一度「能幹」の欄をご覧ください。

ADRS基準の5つのタスクにおいて、Science Oneは人間の専門家と同等、またはそれ以上のパフォーマンスを達成し、そのうち2つ(CloudcastおよびEPLB)では、すべてのシステムの中で最高の成績を収めた。

この分野を飛び越えて、より困難な外部タスクにも挑戦しました。MLE-Benchでの5つのハードコアなKaggleコンペティションでは、医療画像、細粒度認識、3D認識の分野で、金メダル2つ、銀メダル2つを獲得。特に3Dオブジェクト検出のコンペでは、他のシステムは全敗した中で、彼は優勝級のスコアを記録しました。Parameter-Golfという、ハードウェアとファイルサイズが厳格に制限されたリアルタイムLLMトレーニングコンペでは、他のシステムは有効な提出さえできなかった一方で、彼はすべての制約を守り、2026年4月27日時点での最良成績を更新しました。これはハイパーパラメータの調整による偶然の成果ではなく、真正に革新的なアルゴリズムの発見によるものです。

したがって、答えは明確です:正直であり、それを愚かにはしていません。

これがまさに私が最も重視する点です。Science One が「手を抜いて」得た清潔さであれば、その価値はほとんどありません——なぜなら、誰も拙くかつ正直な科研ツールを使いたいとは思わないからです。しかし、Science One は、検証可能性と高性能を同時に実現できることを証明しました。これにより、「正直さを硬い制約とする」という考えが、道徳的な提言から、工学的に有利な選択へと変わりました。

私の判断:それは重要だが、すぐに神格化しないこと

ここまで良いことを言ってきたので、冷や水を二杯かけてみましょう。

最初の盆:Googleは自ら文末で明確に述べているように、Science Oneは実験的な研究プロトタイプであり、直接生産に使用できるツールではありません。

これは謙虚な表現ではなく、境界線である。このシステムがこなした5つのタスクは、システム最適化のような「明確な評価指標があり、自動でスコア付けできる」分野である。言い換えれば、良し悪しは機械的に客観的に判定できる。しかし、真の最先端の研究ではどうか?多くの仮説の価値や、多くの結論の意義は、短期間では誰も評価指標を提供できない。証拠の連鎖は「捏造された引用」には対応できるが、「平凡な問題を選んだ」ことには対応できない。それは誠実さには対応できるが、感性には対応できない。

第二の盆:証拠チェーン自体にもコストがかかる。各テーマについて100本のPDFを読み、各文について証拠を構築し、ラベルを付与し、再確認する——このプロセスは決して安価ではない。真実を追求する一方で、計算リソースと時間を消費している。スケールさせた場合、このコストはどのように計算されるのか、現在のところ答えは出ていない。

しかし、この二つのバケツの水をすべて注いでも、私はこれが過小評価されていることだと考えます。

なぜですか?

因为它改变了提问的方式。

過去2年、誰もが問い続けてきた:AIは研究をできるのか?どれほど強力なのか?人々は問題解決能力やランキングの得点を競ってきた。Science Oneが提起する問いは、別の次元にある:AIが生み出した研究は、信頼できるのか?

この二つの問題は、同じレースコース上にありません。

より多くのシステムが優れた解決策を生み出すようになると、問題解決能力はもはや差別化要因ではなくなる。そのとき、それらを真正に分けるのは、その出力が信頼できるかどうかである。Googleは「検証可能性」を「一等公民」として位置づけ、後からの対応ではなくアーキテクチャレベルの制約であるべきだと述べた。この判断は正しいと私は考え、まさに適切な時期に現れた。

信頼というものは、築くのにとても時間がかかり、崩れるのは一瞬だ。AI研究が初期段階で、見かけは立派だが実際は穴だらけの論文によって学術共同体全体の信頼を過剰に消費すれば、その後に信頼を取り戻そうとしても、その代償は耐えがたいほど大きくなるだろう。Science Oneが行っているのは、信頼が崩れる前に、土台の鉄筋をまず補強することだ。

エピローグ

最初の質問に戻ります:AIが書いた論文、信じられますか?

Science One 以前は、正直な答えは——あまり安心できませんでした。書かれている内容が良ければ良いほど、より注意が必要です。

Science One は AI をより賢くしたのではありません。それよりもシンプルで、より難しいことを実現しました:AI が自らの発言すべてについて、検証可能な証拠を残すようにしたのです。

賢いAIはもう十分です。

自分自身に責任を持つAIは、まだ始まったばかりです。

このステップは小さく、プロトタイプに過ぎず、解決されていない問題がたくさんあります。しかし、方向は正しいです。時として、ある出来事の真の価値は、現在どれほど速く動けるかではなく、その基準をどこに置いたかにあります。

Science Oneは、基準を「よく似ているか」から「検証に耐えられるか」に移した。

この移動は価値がある。

参考資料

  1. Google Research Blog。《Science One Framework: Chain-of-Evidenceによる検証可能な自律研究フレームワーク》、2026年7月30日。
  2. Google Cloud AI研究。arXiv:2605.26340《Science One Framework / Chain-of-Evidence》論文。
  3. AlphaSignal.《GoogleのScience OneフレームワークがAI研究の偽引用危機を解決》、2026年7月。
  4. 至頂網。《Science One フレームワーク:証拠チェーンに基づく検証可能な自律的研究システム》、2026年7月31日。
  5. Sakana AI. arXiv:2504.08066《The AI Scientist v2》(ベースライン比較).
  6. OpenAI。GitHubプロジェクト《Parameter-Golf》ベンチマーク。
  7. arXiv:2410.07095《MLE-Bench》ベンチマーク論文。
  8. arXiv:2510.06189《Automated Design of Research Systems (ADRS)》ベンチマーク。
免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。