Huawei、AI設計効率に関するIJCAI 2026論文を4本公開

iconMetaEra
共有
AI summary icon概要
HuaweiはIJCAI 2026で、MetaEraを用いた設計効率に焦点を当てた4本のAI+暗号通貨関連の論文を発表しました。この研究はアーキテクチャの革新、データ選択、モジュール適応、トレーニング戦略をカバーしており、パフォーマンスを安定させながら計算コストを削減することを目的としています。オンチェーンニュースとAIの進歩は、現実世界のアプリケーションを引き続き形作っています。
华为はIJCAI 2026で4本の論文が採択され、AIが「規模密度」から「設計密度」への技術トレンドを示しています。

記事執筆者、出典:雷峰網

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

AIが現実のシナリオに進出する中で、システム化されたエンジニアリング能力がボトルネックであり、同時に突破口でもある。

IJCAI-ECAI 2026は2026年8月15日から21日までドイツのブレーメンで開催されます。AI分野の総合的トップ会議であるIJCAIは、各企業が過去1年間に得た最先端の研究成果を検証する重要な場であり、どの分野で実質的な進展があったか、どの技術路線がコンセンサスを形成しつつあるかを、論文が最も直接的な答えを提供します。

大会開催にあたり、AI科技評論は、本会議で採択された論文をシステム的にスキャンし、技術トレンドと業界の動向を捉えています。

明確なトレンドとして、AIの計算リソースコストは依然として高止まりしており、パラメータ規模の拡大による限界収益はすでに限界コストに追いついていない。この経済的な現実は、技術革新のロジックを「より大きくできるか」から「より効率的に使えるか」へと再構築している。

华为がIJCAI 2026に採択された4本の論文は、データ不足のボトルネックを補うために、より洗練されたアーキテクチャ設計とトレーニング戦略を用いて、単位計算リソースあたりの知的出力を向上させるという転換のための技術的道筋を示している。

この技術指向の転換は、AIの実用化に伴う深い変化とも呼応しています。技術が研究室の外に出たとき、競争はもはやある特定の能力における単点突破ではなく、正確性、汎化性、データ、計算能力の間のシステム全体の統合です。それぞれの工程がボトルネックとなり得る一方で、突破口にもなり得ます。

以下の4本の論文は、それぞれこの4つの方向から、華為のシステムエンジニアリング能力と技術選択を示しています。

01 規模の壁を突破:アーキテクチャ+トレーニングで階層化ViTの能力限界を書き換える

視覚基礎モデルのスケーリング競争には、常に見えない「天井」が存在してきた。一般のViTはスケーリングを着実に進めており、6Bから22Bへと上限を次々と更新してきた。しかし、階層的ViTは常に2Bパラメーター以下で立ち止まっている。大きくしたくないのではなく、大きくできないのだ。階層的モデルは、一般のViTよりもデータとトレーニング戦略に対する要件がはるかに高く、一般のViTのスケーリング手法を単純に適用してもうまくいかない。これにより、構造的な矛盾が生じている——階層的ViTは本来、マルチスケール表現と密な予測タスク(物体検出、セグメンテーション、動画理解)に優れているが、スケールが拡大できないため、その能力の上限が固定されてしまう。

華為チームのこの論文『Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters』は、規模の上限を2Bから直接30Bまで引き上げました。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

どのように実現したのか?答えは、モデル構造とトレーニング戦略の両方を再設計することであり、どちらも欠かせません。

構造上のコア設計は、Efficient Hierarchical ViTアーキテクチャです。これは、多スケール特徴抽出能力を保ちながら、計算効率も考慮しています。

このアーキテクチャに基づき、チームは2億から50億パラメータの密なモデルを訓練し、スパース・エキスパート・ミキシング(SMoE)バリアントを導入して、総パラメータ数を300億まで拡大しました。これは、階層的ViT分野でこれまでに公開された中で最大のパラメータ規模です。

トレーニングでは、チームが二段階のプロセスを設計しました:

第1段階では、ImageNet-21KでMAEの自己教師あり事前学習を行い、モデルに視覚表現の基本的な規則を学習させる。

第二段階では、2700万画像データセットを用いて、複数の最先端の汎用基礎モデルから知識を蒸留し、能力の飛躍を実現します。

実験結果は最も強力な証拠を示した。ImageNet-1Kの線形評価において、総パラメータ数30BのMoEモデル(EHV-5B-MoE)は、推論時に67億パラメータのみを活性化し、89.0%の精度で、より大きな総パラメータ数を持つ通常のViTアーキテクチャのモデルEVA-CLIP-18Bを上回った。さらに重要なのは、その性能向上が画像分類に限定されず、動画分析や密な予測タスクにおいても優れた成果を示したことである。これは、EHVが分類特徴だけでなく、真正に高品質で汎用性のある視覚的表現を学習したことを示している。

華為チームはこの研究により、階層化ViTが規模を拡大できるだけでなく、推論時により少ないアクティベーションパラメータでより高い精度を達成できることを実証しました。アーキテクチャ設計がモデルの能力の上限を決定し、トレーニング戦略がその上限をどの程度引き出せるかを決定します。

02 事前フィルタリング入力:学習可能なフレームセレクタのパラダイム革新

モデルのベースの天井は上がったが、計算リソースの消費はモデル自体だけでなく、モデルに与えられるデータにも大きく依存している。ビデオ-大言語モデル(Video-LLMs)がビデオを処理する際、計算コストの大部分はフレームのエンコードに消費される。コストを抑えるため、現在のモデルはほぼすべて均等サンプリング——等間隔でフレームを抽出——を採用している。

しかし、動画内の重要なイベントは決して均等に分布することはありません。重要な動作が1〜2秒しか続かず、サンプリングポイントの間にちょうど含まれた場合、完全に見逃されてしまいます。逆に、長時間続く静的な映像が繰り返しエンコードされ、貴重な計算リソースが無駄になります。

別のアプローチとして、クエリ駆動法があります——具体的な質問に基づいて関連するフレームを検索します。これはビデオ質問応答のシナリオでは有効ですが、詳細なビデオ説明は「クエリなし」タスクであるため、この方法はここでは適用できません。

均等サンプリングは粗すぎ、クエリ駆動の方法は使えない。どうすればいいか?华为AIデータチームが提案した学習可能なフレームセレクターLFS(Learnable Frame Selector)が、この問題を解決しようとしています。

論文のアドレス:https://arxiv.org/pdf/2601.14594v1

彼らの核心的なアイデアは非常にシンプルです:人工的なルールでフレームを選択するのではなく、モデルに「何を見るべきか」を自ら学習させることです。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

これは「結果から逆算する」トレーニングパラダイムであり、LFSは「ある中間スコアでどのフレームをより高く選ぶか」を学ぶのではなく、「どのフレームを選べば大規模モデルがより良い説明を書けるか」を学びます。具体的には、以下の3つの重要な設計により実現されます:

まず、スコアリングネットワークをトレーニングし、各フレームに「イベントの重要性」スコアを付与します。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

第二に、グローバルなソートではなく、セグメントごとにフレームを選択します。フレーム選択では単純に「スコアが最も高い上位K個」を選ぶのではなく、動画全体を複数の時間セグメントに分割し、各セグメント内で最も重要なフレームを個別に選出します。これにより、重要なイベントを捉えつつ、時間軸上にフレームが均等に分布します。

第三に、最も重要なステップ——トレーニング方法です。LFSがフレームを選択した後、それらを固定されたVideo-LLMに投入して説明を生成し、生成された説明と人間がアノテーションした標準説明を比較して損失を計算し、その後、逆伝播によってフレーム選択器のパラメータを更新します。このプロセス全体で、大規模言語モデル自体は一切変更されず、LFSはプラグアンドプレイの外部モジュールのように機能します。

また、研究チームは、既存の詳細な動画説明ベンチマークと人間の実際の認知の間に大きなギャップがあることを発見しました。そのため、彼らは新しいベンチマークICH-CCを独自に構築しました。このベンチマークの動画は、中国の無形文化遺産の料理に関する実際の商業シーン(レストランの厨房や料理教室など)から収集され、すべての説明と質問は人間によって丁寧に作成されており、実際のアプリケーションシーンにより近くなっています。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

実験結果はいかがですか?

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

LFSは、さまざまなモデルとベンチマークにおいて一貫して安定した改善をもたらしました。すべてのモデルのLFS強化版は、すべてのテストベンチマークでベースラインモデルを上回っており、LFSが単一のベンチマークだけでなく、一定の汎用性を持つことを示しています。

これは論文の核心的な命題にも応えています:均一にサンプリングされたフレーム上でモデルに「強引に計算」させるのではなく、入力段階でスマートにフレームを選別するほうが、適切なフレームを選べば、下流タスクのパフォーマンスも向上します。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

03 タスクアダプテーション:モジュール型介入がフルモデルファインチューニングに代わる

大規模言語モデルのタスク間汎化能力は、常に「重要だが実装が難しい」課題である。現在の主流手法は、per-token動的ルーティング——各トークンの処理時に複数のLoRAアダプターの間で選択を行い、経路を決定する仕組みである。このメカニズムは確かに効果的だが、その代償も大きい:計算量とVRAMの使用量が常に高止まりし、モデルの実行は遅く、VRAMを大量に消費する。

別のアプローチである表征微調(ReFT)は、モデルのパラメータを変更せず、プレフィックスとサフィックストークンの表征のみを編集して単一タスクへの適応を実現します。この方法はLoRAよりもはるかに効率的ですが、二つの短所があります。一つ目は、トークン自体の意味が曖昧であるため、先頭と末尾のみを変更しても精度が十分でないことです。二つ目は、「自己誘導」メカニズムが欠けており、モデルがこれまで見たことのない新しいタスクに直面した場合、どの層を修正し、どの表征を変更すべきかがわからないことです。

華為雲チームは複数の大学と協力し、表征感知のモジュール化RaMod(Representation-Aware Modularity)フレームワークを提案し、ReFTのアイデアをタスク間汎化シナリオに成功裏に拡張しました。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

核心の取り組みは二つの部分に分けられます:

第一部分はデュアルモジュール表現とパラメーターファインチューニングです。ReFTは先頭と末尾のみを変更できますが、RaModははるかに精密で、中間層の隠れ表現から戦略的に選択されたサブセットを抽出してモジュール型の介入を行います。どこを変更し、どのように変更するかは、選択的かつ戦略的です。これにより、モデルが未見のタスクをより正確に解決するよう誘導できます。

第二部は非同期スケジューラーです。タスク間の汎化で最も懸念されるのはメモリ不足ですが、RaModはアクティブなスケジューリングメカニズムを設計しました:必要な干渉に応じてメモリを割り当て、使用が終わったら積極的に解放します。これにより、ストレージオーバーヘッドを最小限に抑えることができます。

効果は即座に現れます。実験により、RaModはタスク間の汎化性能がさらに向上し、コストも大幅に削減されたことが示されました。オリジナルのLLMsと比較して、この手法では事前埋め込み時間が83%減少し、生成遅延が100%低下し、VRAM使用量が79%削減されました。

言い換えれば、RaModはタスクアダプテーションを「モデルを変更する」から「表現を調整する」へと変えました。モデルの本体は変更せず、重要な層の隠れ状態にのみポイント編集を施します。このアプローチが有効であれば、大規模モデルのデプロイ経済学は書き換えられる可能性があります。1つのベースモデルに複数の軽量な干渉モジュールを組み合わせることで、異なるタスクシナリオに低コストで対応でき、各シナリオごとに完全なコピーを個別にトレーニングまたはロードする必要がなくなります。

しかし「リライト」の前に、この表現微調整手法には、複雑な推論などの高難度シナリオにおいても、計算コストを大幅に削減しながら精度を維持できるかどうかといった重要な問題が残っています。

04 データの突破口:言語専門家がそれぞれの役割を果たし、段階的なトレーニングで着実に進む

前の3つの論文はすべて「モデルをより効率的に使用する方法」に焦点を当てている。しかし、多くのタスクには、さらに根本的な現実の課題がある:訓練データが十分でない場合はどうするのか?

コードスイッチング(Code-Switching、CS)音声翻訳タスクでは、複数の言語が混在する音声をターゲット言語に翻訳する必要があります。このタスクは意味モデルの構築が複雑であるだけでなく、CSデータの不足も大きな課題です。

以前の研究は主に二つの道を取っていた:モデルに自ら意味表徴を「悟らせる」方法で、効果が不安定だったり、あるいは高額な人手によるアノテーションに頼ったりして、コストが高すぎ、スケールを広げるのが難しかった。

華為翻訳サービスセンターのチームは、廈門大学およびマカオ大学と共同で、新しいアプローチを提案しました。モデルに異なる言語の意味表現を自力で学習させるのではなく、各言語ごとに専門チームを設け、それぞれが自言語の意味モデリングを担当し、最終的に統一的にアラインメントを行うというものです。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

論文のリンク:https://arxiv.org/pdf/2511.10670

具体的実装方法には2つの重要な設計があります:

最初はMoE(混合専門家)音声プロジェクターです。従来のプロジェクターはすべての言語を同じように扱うため、効果は当然ながら満足できません。MoEバージョンでは、各言語に専用の「専門家」グループを割り当て、各専門家グループが特定の言語の細粒度音声特徴のモデリングのみを担当します。ルーティングメカニズムが音声特徴を対応する言語の専門家グループに自動的に送信します。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

ルートがずれないように、論文では2つの補助損失を導入しました。言語固有損失は、各エキスパートが対応する言語の特徴を真正に学習することを保証し、グループ内ロードバランス損失はすべてのトークンが同じエキスパートに集中するのを防ぎます。

二つ目はマルチステージのトレーニングパラダイムです。データが不足している場合、戦略で補います。トレーニングは四段階で進みます。まず、自動音声認識(ASR)データを使用して、各言語のプロジェクターを個別にプリトレーニングし、音声とテキストのアライメントの基礎を築きます。次に、各言語のプロジェクターをMoE構造に組み立て、言語特異的損失とロードバランス損失を併用して最適化します。その後、ASRデータから単一言語音声翻訳(ST)データへ段階的に移行し、トランジション損失でスムーズな移行を実現します。最後に、STデータからCS音声翻訳データへ適応します。

この段階的な設計の妙は、モデルに希少なCSデータをいきなり学習させるのではなく、まず十分なASRおよびSTデータで基礎能力を固め、その後段階的にターゲットタスクに移行することにあります。

華為 IJCAI 2026 論文まとめ:「規模密度」から「設計密度」へ

Whisper、SeamlessM4T、LLaSTなどの複数の強力なベースラインモデルを比較実験しました。FisherおよびNTUML2021の4つのテストセットにおいて、本手法は最も優れた性能を示したSeamlessM4Tを上回り、BLEUは最大39.52、COMETは最大81.33を達成しました。

この作業が示す信号は明確です:データが限られたクロスランゲージシナリオでは、洗練されたアーキテクチャ設計と段階的なトレーニング戦略が、単にデータを積み重ねるよりも効果的である可能性があります。

この手法は、言語数が限られ、データ品質がコントロール可能なシナリオでは有効な「尖兵ソリューション」ですが、数十種類の言語をカバーする汎用マルチリンガル翻訳システムにおいて拡張性が確保できるかは、さらなる検証が必要です。

05 結論:設計密度で計算コストを削減する

30B階層化ViTはモデルの骨格を再構築し、67億のアクティブパラメータでImageNet上で180億の対抗モデルを上回りました;

LFSは入力端で減算を行い、大量の無意味なフレーム符号化オーバーヘッドを計算前に遮断した。

RaModは、フルファインチューニングを表現層の定点編集に圧縮し、タスク間アダプテーションにおけるメモリ使用量と遅延を同時に削減しました。

言語コード転換音声翻訳はMoEの役割分担と段階的トレーニングを用い、データが最も不足する分野で、アーキテクチャの知恵がデータの貧困を補うことができることを証明した。

四つの論文、四つの分野がすべて同じ核を指向している:ファーウェイは「規模密度」ではなく「設計密度」を採用している。これらの論文は基礎研究、AIデータ、クラウドサービス、翻訳サービスセンターからそれぞれ寄せられており、効率優先が特定のチームの好みにとどまらず、あらゆる技術選択の段階に組み込まれていることを示している。

過去2年間のAI競争を「鉱山の競争」と例えるなら、2026年は転換点が現れてきている:「精錬技術」の競争がすでに始まっている。スパース活性化、インテリジェントフィルタリング、モジュール型アダプテーション、漸進的トレーニング——これらのアプローチは、より多くのチップや計算リソースに依存せず、問題そのものに対するより深い理解に依存している。

大手企業もスタートアップも、すでにパラメータの軍拡競争は超えており、AIの後半戦では、現実の課題への理解と、それらを体系的に解決するエンジニアリング能力が真の勝負所である。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。