新しい論文が、探索的モデリングを通じた生成モデルのエンドツーエンド学習を提案

icon MarsBit
共有
AI summary icon概要
UIUCとハーバード大学による新しい論文では、生成モデルのためのエンドツーエンドの学習手法であるExplorative Modeling(XM)が紹介されています。このアプローチは、forループを使用して候補を生成し、最上位の候補を選択することでモードのぼやけを軽減します。画像、動画、言語タスクで性能向上を示し、FLOP、サンプル、パラメータの効率が改善されています。注目を集めるアルトコインと同様に、このような革新はトレーダー間のフィアーアンドグリードインデックスに影響を与える可能性があります。

2012年、AlexNetは圧倒的な勝利によって一つの時代を終えた。それ以前、画像認識は人間が手動で段階的な特徴抽出プロセスを設計する必要があった。しかしAlexNetは、その後繰り返し検証されることになる事実を示した:全体のタスクをエンドツーエンドでモデルに学習させることの方が、人間が丁寧に設計した段階的なパイプラインを常に上回るということだ。

画像分類から物体検出、そして画像セグメンテーションへと、ディープラーニングの各段階の飛躍の背後には、常に同じ一文がある:それを自分で一気に学習させること。

唯一始终是例外的领域是生成模型。

今日、最も強力で最も拡張可能な生成モデル(自己回帰モデルでも拡散モデルでも)はエンドツーエンドではない。

それらは学習時に「一歩分」の予測のみを学習し、推論時にはこれをループネットワークのように数百〜数千回繰り返す。

トレーニングと推論では、同じサンプリング手法を使用していません。このギャップは、従来の問題を引き起こします:各ステップの誤差が次のステップに伝播し、入力がトレーニング時に観測された分布から徐々にずれて、誤差が段階的に蓄積します。学術的にはこれを「曝露バイアス(exposure bias)」と呼びます。

言い換えれば、「エンドツーエンドが最良である」というディープラーニングの最も核心的な経験則は、これまで十数年間、生成モデルには実際に適用されてこなかった。

そして最近、UIUCとハーバード大学の論文が、この最後のピースを補おうとしています。

生成モデル

著者はこの新しいパラダイムを「Explorative Modeling(探索的モデリング)」と名付け、モデルの略称をXMとした。そのアイデアは単純で、ほぼ素朴に見えるが、生成モデルにはパラメータとデータに加えて、第三の拡張軸が存在するという大胆な結論を導いている。

生成モデル

プロジェクトウェブサイト:https://explorative-modeling.github.io

論文のアドレス:https://arxiv.org/abs/2607.27372

コードリポジトリ:https://github.com/alexiglad/XM

問題の根本原因:モデルは「平均を取る」だけである

この論文が何を解決しようとしているかを理解するには、生成がなぜ難しいのかを理解する必要がある。

一般的監督学習(分類など)では、各入力に対して基本的に正しい答えが1つだけであり、モデルは1つの確定的なマッピングを学習すれば十分です。

しかし生成は異なります。モデルに「犬を生成してください」と指示した場合、正しい答えは無数に存在する可能性があります。これらの正当な出力が、データ分布内のそれぞれのモード(分布内の個々のピーク)です。生成が難しいのは、これらの多数のモードを同時に捉える必要があるからです。

問題は、主要な生成モデルの訓練に再構成損失(例:二乗誤差)が使用されていることです。入力に複数の異なる正当なターゲットがランダムに割り当てられた場合、再構成損失が導き出す最適解は、これらのターゲットの平均値になります。しかし、ほとんどのデータにおいて、その平均値はデータの多様体上には存在せず、複数のモードの間の領域に位置し、どのモードにも似ていません。

論文の図は非常に直観的です:モデルにあらゆるテクニックを用いずに、端から端まで直接回帰させると、3つの点群は真ん中の1点に予測され、犬の写真はぼやけた塊になり、1文は「the」を繰り返すだけに退化します。これが「モード曖昧」(mode blurring)であり、最適解が実際のデータとは最も似ていない答えであることを意味します。

生成モデル

従来のモデルはどのように回避してきたのか?答えは、「生成」というプロセスを細分化することである。自己回帰は一度に一つの要素を予測し、拡散は一度にわずかにノイズを除去する。各小さなステップの目標は、ほぼ単一のモードにまで縮小されるため、再構成損失は平均を取らなくなる。

この「分割生成プロセス」が、拡散と自己回帰が高品質なサンプルを生成できる理由であり、同時にそれがモデルをエンドツーエンドにできない原因でもある。

著者はこれにより、生成モデルには分解できる要素が二つしかない、すなわちどのように生成するか、そしてどのように訓練するかという重要な問いを提起した。

もし生成を分割することがエンドツーエンドを破壊するなら、なぜ訓練を分割しないのか?

生成モデル

forループ:探索的モデリングのすべてのコア

Explorative Modeling はトレーニングループそのものを分解します。

そのメカニズムは一言で言えば:各トレーニングステップで、モデルは目標に無理やり合わせるために1つのサンプルしか生成せず、代わりにK個の候補を生成し、その中で真のデータに最も近いものを選んでトレーニングし、勾配をバックプロパゲートする。論文ではこれを3~5行のforループとして実装しており、簡潔すぎて疑わしく思えるほどである(アルゴリズム1)。

生成モデル

なぜこれを行うことでmodeの曖昧さが解決されるのですか?

生活の別のシナリオに置き換えてみましょう:ダーツの着地点を当てるゲームです。1回だけ予測できる場合、最適な戦略はすべてのダーツの平均位置を予測することですが、その場所は実際にはダーツがほとんど刺さっていない場所です。しかし、K回予測でき、その中で最も近い予測だけが得点対象になると、最適な戦略は一転します。この場合、複数の予測を分散させて、それぞれが異なる着地点の群をカバーするようにします。

生成モデル

モデルも同様です。K個の候補を探索することが許されると、異なる入力ノイズがそれぞれ異なるモードを「獲得」し、中央に集中して平均を取ることはありません。どれだけ探索するかに応じて、モデルはその数だけモードを確実に捉えられます。

生成モデル

著者は、長く無視されてきたこの能力に「生成的表現力(generative expressivity)」という名前を付け、それが訓練目標自体によって決定され、パラメータやデータをどれほど増やしても自発的に向上することはないとしている。

生成モデル

これは、業界で長年観察されてきた不思議な現象を説明している:なぜ今日の最良のモデルが「ガイドANCE」技術にこれほど依存しているのか。

無分類ガイドとは、予測をその曖昧な平均値から「引き離す」ことである。しかし、モデル自体が曖昧でなければ、なぜそれを引き離す必要があるのか? ガイドが有効なのは、モードの曖昧さが残す病巣ゆえである。

論文はForwardとReverseの2つの探索方向を提示しています。前者は真のターゲットを固定し、自身の生成結果の中で最も近いものを検索するため、「再現率」(すべてのモードをカバー)に焦点を当てます。後者は生成結果を固定し、真のデータの中で最も近いものを検索するため、「適合率」に焦点を当て、計算コストの増加はほぼありませんが、少数のモードに収束する可能性があります。両者は補完的であり、組み合わせて使用できます。

生成モデル

生成モデル

第三の軸:拡大するほど収益が大きくなる

この論文の最も重要な結論は、「探索」を実際のスケーリング軸として検証した点である。

著者は、拡散/フローモデル、Jumpyモデル、さらにはマスクド拡散言語モデルに探索を導入し、画像、動画、言語の3つのモダリティにおいて一貫して性能が単調に向上することを確認した。より重要なのは、スケール拡大に伴うメリットの傾向である:スケールが大きくなるほど、効果がより顕著になる。

論文で示された数値は、データ規模が増加するにつれて、探索による利益は7%から36%まで上昇し、モデルが大きくなるにつれて13%から23%まで上昇し、計算リソースが3倍になると、効率の向上が2倍以上になるというものです。

効率面では、FLOP効率を4.1倍、サンプル効率を6.2倍、パラメータ効率を47%向上させました。画像生成においては、現在最強のRAE手法をさらに進化させ、ImageNetでの無誘導FIDを1.43まで改善し、業界最高峰に迫りました。

生成モデル

5つのモードを探索するLargeモデルは、パラメータが47%多いが探索を行わないXLargeモデルを上回る性能を発揮する。

生成モデル

この傾向の意味は小さくない。著者の説明によると、小規模ではモデルは主にパラメータとデータに制約され、生成表現力はボトルネックになっていないが、パラメータとデータが「もはや制約でなくなる」レベルに拡大されると、生成表現力が徐々に真のボトルネックとなっていく。そして、それが直接拡大可能な要素を探索する対象である。

現在の本格的な基礎モデルのトレーニングに使用される計算リソースは、この論文で実施された最大の実験よりも約4桁多いことを踏まえ、著者は論文で報告された数値が、より大規模なスケールにおける収益の下限に過ぎない可能性があると考えている。

本物のエンドツーエンド生成

探求を極限まで押し進めると、何が起こるのか?その答えは、最初の謎に戻る:生成モデルがついにエンドツーエンドで実現された。

著者はXMを独立したエンドツーエンドモデルとして扱い、ロボット制御タスクに適用した。行動模倣(Behavior Cloning)において、彼らのExplorative Policyは1回のネットワーク前方計算で、100回の前方計算を要するDiffusion Policyを上回るか、同等の性能を達成した。目標指向の世界モデルにおいて、Explorative World ModelはDiffuserよりも16〜256倍少ない推論リソースで、より優れた平均性能を実現した。

生成モデル

生成モデル

この差異の源は明確である:拡散モデルは推論時に数百ステップをかけて生成することで表現力を得ているのに対し、エンドツーエンドのXMはそのコストを訓練時の探索に移し、推論は一度のフロワードのみで済む。「複数のモードを処理する」という同じ課題を、推論時に徐々に分解するか、訓練時に一度で探索し切るかのどちらかを選ぶ必要がある。この論文は後者を選んだ。

著者紹介

この論文の第一著者であるAlexi Gladstoneは、2025年7月に彼が主導したEnergy-Based Transformers(EBT)がソーシャルメディアで大きな議論を呼んだことから、決して無名の存在ではない。

生成モデル

その研究は、複数の次元で標準的なフィードフォワードTransformerのスケーリング曲線を初めて「上回った」と主張し、「システム2の思考」を任意のモードに拡張しようとしています。機械之心の報道『新パラダイム登場!新エネルギーモデルがTransformer++のスケーリング上限を打破、トレーニングスケーリング率が35%向上』をご覧ください。

生成モデル

Explorative Modeling は、彼の従来の考え方と一貫しており、「モデルは、ある種の検索や探索を通じて、単一のフォワードパスでは実現できないことを実行できるか」という問いを常に投げかけている。この論文は、彼と共同研究者(Yilun Du および Heng Ji)が構築した別の理論である Mode Forcing を基盤としている。論文では、この理論が先に存在していたため、XM の大部分の結果は実験によって検証される前に理論的に予測されていたと明言されており、これは「実験を実施してから説明する」ことが一般的なディープラーニング分野では珍しい。

生成モデル

著者もまた、限界を正直に認めている:best-of-Kというアイデア自体は新しくなく、以前にも多くの研究者が試している。彼らの真の貢献は、この単純なループが何をしているのかを明確に理解したことにある——それは生成プロセスを分割せずに、生成の表現力を直接拡大している。

また、自己回帰言語モデルは現在でも最も難しい課題の一つであり、純粋なエンドツーエンドのForward XMは、極めて多モードな分布(例:画像生成)では依然としてコストが高すぎます。これらの課題は、今後の研究に委ねられます。

十数年来、私たちは生成モデルを調整するために、2つのノブを使い慣れてきました:より大きくし、より多くのデータを投入することです。

この論文で提案された三つ目の調整ボタンは非常に単純です:モデルに複数回推測させ、その中で最も優れた結果のみを残すことです。しかし、もし示された傾向が正しいならば、規模がさらに拡大するにつれて、最初の二つの調整ボタンはいずれ限界に達し、三つ目のボタンはようやく動き始めたばかりです。

参照リンク

https://x.com/AlexiGlad/status/2083230922196107288

本文は微信公众号「機械の心」(ID:almosthuman2014)より、著者:Panda

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。