蚂蚁集团はIJCAI 2026で4本の論文を発表し、AIの動的環境における適応能力を体系的に探求します。記事執筆者、出典:雷峰網

どんなに賢いアルゴリズムでも、最終的には動的な環境で検証される必要があります。
IJCAI-ECAI 2026は2026年8月15日から21日までドイツのブレーメンで開催されます。大会開催に合わせて、AI科技評論は本大会で採択された論文を系統的にスキャンし、技術トレンドと業界の動向を抽出しています。
在华为 IJCAI 2026 論文盘点:从「规模密度」转向「设计密度」中,我们观察到了大厂在参数竞赛上的克制,以及对算力效率的追求。
一方、蚂蚁グループが選ばれた4本の論文は、同様に重要だが道筋がまったく異なる技術の流れを示している:動的環境への適応能力に対する体系的な探求。
アルゴリズムモデルの精度は実験室で次々と記録を更新するが、現実世界にデプロイされると、性能の低下がほぼ常態化している。理由は単純だ:現実世界は決して静止していないからだ。
蚂蚁グループのビジネスシーンでは、この「静止しない」状況が極限まで推し進められています:10億人を超えるユーザー、8,000種類以上のサービス、支払いのピークと深夜の低谷との間で数桁の差が生じ、リスク管理モデルは時間単位で不正行為の戦略の進化に応答しなければならず、グローバル展開では各国の異なる金融インフラに適応する必要があります。
このような環境では、「一度訓練、永続的にデプロイ」する静的モデルは、「舟の側面に印をつける」ような状況に陥る必然がある。
そのため、真の知能とは、アルゴリズムが環境の変化を感知し、自らの戦略を能動的に調整し、動的な状況の中で最適解を見出すことができるかどうかにあります。蚂蚁グループのこの4本の論文は、いずれもこの核心的な命題に答えています:AIを「静的なソルバー」から「動的な自己適応者」へと進化させるにはどうすればよいか?
01 MSRGC-Net:時系列クラスタリングをデータ密度分布に適応的に対応させる
時系列クラスタリングは、膨大な行動シーケンスを自動的に分類するもので、行動パターンを理解し、異常シグナルを監視するための基本的なツールです。
しかし、現在の方法にはそれぞれ課題があります:
- 類似度手法(k-Shapeなど):局所パターンを捉えられるが、すべてのサンプル間の距離を計算する必要があり、データ量が増えると処理が遅くなる;
- 深層学習手法(オートエンコーダなど):表現力が強いが、トレーニングコストが高く、パラメータ調整が煩雑で、計算リソースを多く消費する;
- 従来の特徴抽出:人工的に設計された特徴に依存し、重要な時間的動的情報が失われる可能性がある。
より大きな問題は、現実の時系列データの密度分布が極めて不均一であることです——ブラックフライデーの取引データは暴雨のように密集し、深夜のデータは滴のように希薄ですが、従来の手法では事前にカテゴリ数を指定する必要があり、これは現実と一致していません。
蚂蚁グループと重慶郵電大学が提案したMSRGC-Netは、「トレーニング不要」の組み合わせ技で、精度と計算効率のジレンマを回避します。

論文のアドレス:https://arxiv.org/pdf/2606.12077v1
▎その核心ロジックは3ステップに分解できます:

ステップ1:マルチスケールリザバーコーディング(特徴抽出)。トレーニング不要な複数のエコーサテイトネットワーク(ESN)をリザバー計算の基本単位として使用し、スペクトル半径を調整するだけで、原始時系列から局所的な変動と長期的なトレンドを同時に抽出し、すべてのサンプルを統合してビュー特徴行列を形成し、後続のプロセスの入力として使用します。
第二ステップ、「顆粒球」のアンカーマップ構築(構造モデリング)が、最も巧みな部分です。アルゴリズムは個々のデータポイントに注目するのではなく、データの局所的な密度に基づいて「顆粒球」を自動的に分割します:密度の高い領域には小さく多数の顆粒が形成され、密度の低い領域には大きく少数の顆粒が形成されます。データ規模は N から M(顆粒数、M < N)に圧縮され、同時にノイズ干渉も抑制されます。
ステップ3:コンセンサスに基づくマルチスケールグラフ最適化。スケール間のアンカーグラフはコンセンサス戦略によって統合され、モデルは微观的な局所パターンを捉えつつ、宏观的な全体トレンドを把握できるようになり、最終的に人為的なクラスタ数の指定を必要としないロバストなクラスタリング結果を生成します。
この戦略の効果はいかがですか?

5つの多変量ベンチマークデータセット、15の評価指標(NMI、ARI、RIそれぞれ5つ)において、MSRGC-Netは12項目で最優秀、2項目で2位を獲得し、最優秀率は80%です。
さらに重要なのは、O(n²)の対比較計算を回避し、ほぼ線形の複雑さを実現していることです。簡単に言えば、速く、正確で、何クラスに分けるかを予測する必要がありません。
蚂蚁の実際のビジネスシナリオでは、これはシステムがトラフィック密度に応じてクラスタリングの粒度を自動的に調整できることを意味します。ピーク時には細かいクラスタで異常を検出し、低谷時には粗い粒度で要約して計算リソースを節約し、常にデータに沿って動作します。
02 オフラインからオンラインへの強化学習のためのアダプティブなデータ混合戦略
強化学習には有名な「水土不服」の問題——「分布シフト」があります。オフラインデータで訓練されたモデルは、オンラインで実行するとすぐに「記憶を失う」傾向があります。これは、オフラインデータとオンラインインタラクションデータの間で分布に差異が生じ、オンライン初期の戦略がオフラインで学習した知識を急速に「忘却」してしまうためです。
現在の解決策は主に二つあります:一つは、オフライン50%とオンライン50%の混合比率を固定する方法、もう一つは、ヒューリスティックなルールを使って「近接戦略」のサンプルを優先的に抽出する方法です。
しかし問題は、戦略が各段階で必要なものがまったく異なることです——初期にはオフラインデータを多く必要とし、基本盤を安定させる必要がありますが、後期にはオンラインデータを多く必要とし、新たな可能性を探索する必要があります。固定された戦略は、舟の辺に印をつけるようなものです。
蚂蚁グループと上海交通大学はROADを提案し、データ混合比率を「事前設定パラメータ」から「動的決定変数」に変更しました。

論文のアドレス:https://arxiv.org/pdf/2605.14497
その核心思想は興味深い:データ選択は本質的に二重最適化問題である。

- 内層(Inner-Level):ベルマン誤差を最小化する標準的なQ学習更新;
- 外層(Outer-Level):データ混合戦略をメタ決定変数と見なし、オンライン戦略の期待リターンを最大化することを目的とする。
二層は多腕バンディット(MAB)アルゴリズムを用いて近似解を求め、混合戦略がトレーニング中にリアルタイムで調整されるようにします:モデルがオフライン段階で学習した知識を「忘れる」傾向を検出すると、自動的にオフラインデータのサンプリング比率を上げて基本を安定させます。モデルが保守的になり、探索が不足している場合には、オンラインデータの割合を適時に増やして試行錯誤を促します。
実験は非常にしっかりとしています。チームは、オフラインからオンライン強化学習への三大古典的ベンチマークで検証を行いました:AntMaze(ロボットが迷宮で目標を見つける)、MuJoCo(生体ロボットの運動制御)、FrankaKitchen(ロボットアームがキッチンで複雑な操作を実行する)。これらのタスクは難易度が異なり、状態空間も多様であるため、アルゴリズムの汎化能力を包括的に評価できます。

ROADのアルゴリズムの汎用性を検証するため、研究チームはROADをIQL、PEX、CQL、Cal-QLなどの主要なオフラインアルゴリズムと組み合わせました。その結果、基盤となるアルゴリズムにかかわらず、ROADは安定してパフォーマンスの向上をもたらすことが示されました。

PEX+ROADを例に挙げると、この手法はD4RLベンチマークの24の連続制御タスクで71.12の総合平均スコアを達成し、24タスク中18タスクで1位を獲得し、固定比率、減衰比率、ヒューリスティックバランスリプレイなどのすべてのベースラインを大幅に上回りました。
つまり、ROADは「保守的な継承」と「積極的な探索」の間で最適なバランスを実現し、リリース直後に失敗することなく、リアルタイムデータによる改善機会を逃さないのです。この手法は、蚂蚁集団のリスク管理モデルのリリースやレコメンドシステムのリアルタイム最適化といったシナリオにおいて、明確な価値を発揮します。
03 DSEBO:高次元ベイズ最適化がサブスペースを適応的に探索
ベイズ最適化はブラックボックス関数最適化の古典的アプローチであるが、高次元問題に直面すると課題が生じる。一般的な解決策としてランダム埋め込みがあり、これは最適化を低次元部分空間に射影するものであるが、新たな課題が生じる:有効次元は実際にいくつなのか?
従来の方法は、専門家の経験に基づいて固定された部分空間次元を設定するか、試行錯誤で繰り返し推定するため、大量のリソースを消費し、固定された部分空間次元では異なるタスクに適応できません。さらに厄介なのは、有効な次元自体が最適化の進行に伴って変化する可能性があることです。初期の探索段階では低次元で十分ですが、後期の微調整段階ではより高次元の詳細が必要になる場合があります。
蚂蚁グループと華東師範大学、南京大学が提唱するDSEBOは、部分空間の次元を最適化プロセス中の「動的変数」とし、検索の進捗に応じて自発的に切り替えます。

論文のアドレス:https://arxiv.org/pdf/2605.23473
DSEBOの核心メカニズムは「低から高へ、段階的に昇進」です:

- 低次元部分空間から出発し、オプティマイザは低次元空間で候補解を生成し、ランダム埋め込みにより元の空間にマッピングして、目的関数の大まかな輪郭を迅速に把握した後、結果のフィードバックがガウス過程の反復更新を駆動する;
- 収束を検出後、共有埋め込み行列を通じて低次元解を高次元に「継承」する次元拡張が自動的にトリガーされます。
- 新しいサブスペースの初期化と継続的最適化は、共有埋め込み行列によって各サブスペースが相互にネストされるように保証され、「低次元探索→収束トリガー→次元拡張→継続的最適化」のサイクルを形成し、評価予算の上限に達するまで繰り返されます。
次元拡張フェーズでは、拡張幅も固定されておらず、アルゴリズムは現在の最適値の変化曲線に応じて自己調整します。曲線が緩やかであれば拡張を遅くして無駄なコストを削減し、曲線が急激であれば拡張を速めて高次元の利益を迅速に捉えます。
実験結果によると、合成関数(Levy、Griewank、Sphere、D=1000)および3つの実際のタスク(MSLR、Lasso-Hard、LIMO)において、DSEBOはREMBO、SIRBO、BAxUS、TuRBOなど十数種の主要な手法と逐一对比され、ほぼすべてのタスクで最適解を達成——精度と収束速度の両方でリードしました。

「低次元で探査し、高次元で精密に調整」というアプローチは、蚂蚁の日常的な開発においても非常に実用的です。クレジットモデルのハイパーパラメータ最適化、リスク管理戦略の閾値最適化、マーケティングキャンペーンの多変量実験設計など、専門家が次元を直感で推定する必要はなく、アルゴリズムが「進みながら学習」することで、自動化され、高効率な運用が実現されています。
04 VGA-BenchV2:動画評価ベンチマークをAIGCエコシステムの進化に「適応」させる
前三の論文がアルゴリズムレベルの適応性について議論しているとすれば、VGA-BenchV2は、評価インフラがAIGC技術エコシステムの進化にどのように「適応」するかを示しています。これは、四つの論文の中で唯一、マルチモーダルコンテンツ理解に焦点を当てた作品であり、蚂蚁グループがデジタルライフやコンテンツエコシステムなどの非金融分野で蓄積している戦略的準備を反映しています。
AIGCにより動画制作が爆発的に拡大したが、一つの核心的な課題が残っている:これらの生成動画の品質をどのように体系的に評価するのか?
伝統的な評価指標であるFVD(全体の品質と時間的整合性を評価)やCLIP Score(生成された画像とテキスト記述の意味的一貫性を評価)は、画像が明確かどうか、動作が滑らかかどうか、テキストが一致しているかどうかを主に確認します。一方、構図が優れているかどうか、光と影の使い方が丁寧かどうか、色合いが調和しているかどうか——このような「美しさ」に関わる知覚的品質については、これらの指標はほとんど機能しません。
以前、CVPR 2026で、蚂蚁は北京映画学院および汎用人工知能研究院(BIGAI)と共同でVGA-Benchを提案し、動画審美評価のために初めて三つの次元のフレームワーク(美的品質、美的ラベル、生成品質)を構築しました。また、1016のプロンプト、12の生成モデル、6万を超える動画を基に評価ベンチマークを構築し、AIが初めて専門的な視点から動画を「鑑賞」する方法を学びました。

論文リンク:https://arxiv.org/pdf/2604.10127
しかし、ビデオ生成モデルの進化が速すぎ、月単位のイテレーションペースにより、固定ベンチマークはすぐに「不十分」になる。このIJCAI 2026論文で、チームはさらにVGA-BenchV2を発表した。

オープンソースアドレス:
https://huggingface.co/datasets/BestVictoryLab/VGA-Bench
▎核心進化は3点あります:
第一に、手動アノテーションの量が増加しました。VGA-BenchV2には、36,000件のタスクレベル手動アノテーションが追加され、その内訳は美学的品質アノテーション16,200件、美学的ラベルアノテーション13,200件、生成品質アノテーション6,600件です。これは、それぞれVGA-Benchと比較して13.46倍、11.15倍、1.55倍の拡張となります。より豊富な「人間の好み」データにより、評価器が人間の美的判断とより正確に一致するようになります。
第二に、評価アーキテクチャをアップグレードしました。チームはハイブリッドアーキテクチャを設計し、VAQA-Netが連続的美学スコアを担当し、VTag-NetおよびVGQA-NetはQwen大規模視覚言語モデルを用いてタグ認識と品質評価を行います。大規模モデルの導入により、評価器の複雑な視覚意味の理解が飛躍的に向上しました。実験結果によると、複数の生成モデルにおける評価結果は人間の判断と非常に高い一致を示しています。
第三に、「評価」から「最適化」へのクローズドループを実現しました。これはVGA-BenchV2の最も革新的な設計です:学習された美学評価器を報酬信号として直接強化学習の生成モデルの微調整に利用します。これにより、評価ベンチマークは単なる「審判」ではなくなり、提供されるスコアが最適化信号に直接変換され、生成モデルが美学的品質において継続的に改善するよう導かれます。
VGA-BenchからVGA-BenchV2へと進化し、評価体系は静的な指標ではなく、生成エコシステムと「共進化」する生きたシステムとなった。蚂蚁グループのコンテンツ理解、セキュリティ監査、レコメンデーション最適化などのシナリオにおいて、動画品質評価能力はAIGCエコシステムの進化に対応するだけでなく、上流モデルの最適化を逆に促進する。評価から最適化へと至る閉ループが完成した。
結び:どれほど賢いアルゴリズムでも、最終的には動的な環境で検証される必要がある
4本の論文は、それぞれ非監視学習、強化学習、ブラックボックス最適化、マルチモーダル評価の4つの方向からアプローチし、すべて同じ技術的道筋——静的から動的へのパラダイムシフト——を指向している。
実験データはこのアプローチの有効性を裏付けています:MSRGC-Netは15の指標のうち12で第1位、2で第2位を獲得しました。ROADは複数のオフラインからオンライン強化学習タスクで既存の戦略を上回りました。DSEBOは千次元最適化問題で定量的な改善を実現しました。VGA-BenchV2は複数の生成モデルでの評価結果が人間の判断と高い一致を示しました。
この技術的道筋から蚂蚁の全体的なレイアウトを眺めると、明確な「二輪駆動」構造が見えてきます。一方では金融のコアシーンで時系列モデリング、強化学習、最適化アルゴリズムを深掘りし、他方ではデジタルライフとコンテンツエコシステムにおいてマルチモーダル理解と評価インフラを先見的に整備しています。
結局のところ、アルゴリズムがどれほど賢くても、最終的には動的な環境で検証される必要がある。この4本の論文の真の価値は、すべてが実際のビジネスの土壌から育まれている点にある:蚂蚁のビジネスシナリオは論文の「背景」ではなく、問題の源泉であり、データの生産地であり、効果の検証場である。
そして、これが産業界がAI研究を行う最もユニークな点かもしれません——彼らは単に「論文を書く」だけでなく、現実世界の課題に対して「動的な変化に耐える」解決策を見出しているのです。
