Huawei publie quatre articles à l'IJCAI 2026 sur l'efficacité de la conception de l'IA

iconMetaEra
Partager
AI summary iconRésumé
Huawei a publié quatre articles sur l'IA et les cryptomonnaies à l'IJCAI 2026, en se concentrant sur l'efficacité de conception à l'aide de MetaEra. La recherche couvre l'innovation architecturale, la sélection des données, l'adaptation modulaire et les stratégies d'entraînement. Ces méthodes visent à réduire les coûts computationnels tout en maintenant une performance stable. Les nouvelles sur chaîne et les avancées en IA continuent de façonner les applications du monde réel.
Huawei a publié quatre articles acceptés à IJCAI 2026, illustrant la tendance technologique de l'IA passant de la « densité de taille » à la « densité de conception ».

Auteur et source de l'article : Leifengwang

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

L'intégration de l'IA dans des scénarios réels, ainsi que les capacités d'ingénierie systémique, constituent à la fois un goulot d'étranglement et une opportunité de rupture.

IJCAI-ECAI 2026 se tiendra du 15 au 21 août 2026 à Brême, en Allemagne. En tant que conférence de premier plan couvrant l'ensemble du domaine de l'IA, IJCAI reste un examen clé pour évaluer les avancées de pointe réalisées par les grandes entreprises au cours de l'année écoulée : qui a fait des progrès réels dans quel domaine, quelles approches technologiques sont en train de faire consensus — les articles sont la réponse la plus directe.

À l'occasion de la conférence, AI Science Review effectue également un balayage systématique des articles acceptés lors de cette conférence majeure pour identifier les tendances technologiques et les orientations du secteur.

Une tendance claire : le coût de la puissance de calcul pour l'IA reste élevé, et les rendements marginaux issus de l'expansion de la taille des paramètres ne suivent plus le rythme des coûts marginaux. Cette réalité économique est en train de redéfinir la logique de l'innovation technologique — en passant de « peut-on le rendre plus grand ? » à « peut-on l'utiliser de manière plus économe ? »

Les quatre articles de Huawei acceptés par IJCAI 2026 offrent une référence technologique pour ce changement : utiliser des conceptions d'architecture et des stratégies d'entraînement plus sophistiquées pour compenser la rareté des données et obtenir une production d'intelligence plus élevée par unité de calcul.

Ce changement d'orientation technologique reflète également les transformations profondes de l'implémentation de l'IA : lorsque la technologie quitte le laboratoire, la concurrence ne repose plus sur une percée ponctuelle d'une seule capacité, mais sur une coordination systémique entre précision, généralisation, données et puissance de calcul — chaque étape peut devenir un goulot d'étranglement, mais aussi une opportunité de rupture.

Les quatre articles ci-dessous illustrent précisément les capacités systémiques d'ingénierie et les choix technologiques de Huawei.

01 Breaking the Scale Barrier: Architecture + Training, Redefining the Capability Limits of Hierarchical ViT

Dans la course à l'échelle des modèles visuels de base, il existe un « plafond » invisible. Les ViT classiques ont progressé sans relâche, passant de 6B à 22B en battant constamment des records. Mais les ViT hiérarchiques restent bloqués sous les 2 milliards de paramètres. Ce n'est pas qu'ils ne veulent pas être plus grands, c'est qu'ils ne peuvent pas l'être. Les modèles hiérarchiques exigent bien plus de données et de stratégies d'entraînement que les ViT classiques ; appliquer simplement les méthodes d'échelle des ViT classiques ne fonctionne pas. Cela crée une contradiction structurelle : les ViT hiérarchiques sont naturellement excellents pour les représentations multi-échelles et les tâches de prédiction dense (détection d'objets, segmentation, compréhension vidéo), mais leur échelle limitée verrouille leur potentiel maximal.

L'article de l'équipe Huawei, « Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters », a poussé la limite de taille de 2B à 30B.

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

Comment y parvenir ? La réponse consiste à redessiner à la fois la structure du modèle et la stratégie d'entraînement ; les deux sont indispensables.

La conception centrale structurelle est l'architecture Efficient Hierarchical ViT, qui assure à la fois la capacité d'extraction de caractéristiques multi-échelles et l'efficacité computationnelle.

Sur la base de cette architecture, l'équipe a entraîné des modèles denses de 200M à 5B paramètres et a introduit une variante de mélange d'experts épars (SMoE), portant le nombre total de paramètres à 30B — la plus grande échelle de paramètres jamais publiée dans le domaine des ViT hiérarchisés.

En matière de formation, l'équipe a conçu un processus en deux étapes :

Au premier stade, effectuer un pré-entraînement auto-supervisé MAE sur ImageNet-21K pour permettre au modèle d'apprendre les lois fondamentales de la représentation visuelle ;

À la deuxième étape, une transition de capacité est réalisée en distillant les connaissances à partir de plusieurs modèles de base généraux les plus avancés sur un jeu de données de 27 millions d'images.

Les résultats expérimentaux fournissent la preuve la plus convaincante. Lors de l'évaluation linéaire sur ImageNet-1K, le modèle MoE de 30 milliards de paramètres totaux (EHV-5B-MoE) n'active que 6,7 milliards de paramètres lors de l'inférence, tout en atteignant une précision de 89,0 %, dépassant ainsi les modèles de la lignée ViT traditionnelle ayant un nombre total de paramètres plus élevé, comme EVA-CLIP-18B. Plus important encore, ses améliorations de performance ne se limitent pas à la classification d'images — il excelle également dans les tâches d'analyse vidéo et de prédiction dense. Cela démontre que les représentations visuelles apprises par EHV ne sont pas simplement des caractéristiques de classification, mais bien des représentations visuelles de haute qualité et véritablement généralisables.

L'équipe Huawei a démontré, à travers ce travail, qu'un ViT hiérarchique peut non seulement être rendu plus grand, mais aussi atteindre une précision supérieure avec moins de paramètres d'activation au niveau de l'inférence. La conception de l'architecture détermine la limite supérieure des capacités du modèle, tandis que la stratégie d'entraînement détermine dans quelle mesure cette limite peut être atteinte.

02 Input pre-filtering: Paradigm shift in learnable frame selectors

Le plafond des bases de modèles a été relevé, mais la consommation de puissance de calcul ne se limite pas au modèle lui-même : les données fournies au modèle consomment également d'importantes ressources de calcul. Lors du traitement de vidéos par des modèles de langage de grande taille (Video-LLMs), le coût de calcul est principalement concentré sur l'encodage des images. Pour maîtriser les coûts, les modèles actuels utilisent presque tous un échantillonnage uniforme — une extraction d'images à intervalles réguliers.

Cependant, les événements clés dans la vidéo ne sont jamais répartis uniformément. Un mouvement important peut ne durer qu'une ou deux secondes, et s'il tombe exactement entre deux échantillons, il est complètement omis. À l'inverse, les images statiques prolongées sont codées à plusieurs reprises, gaspillant des ressources de calcul précieuses.

Une autre approche consiste en une méthode guidée par la requête — récupérer les cadres pertinents en fonction d'une question spécifique. Cela fonctionne bien dans les scénarios de问答 vidéo, mais la description détaillée de la vidéo est une tâche « sans requête », pour laquelle cette méthode n'est pas applicable.

L'échantillonnage uniforme est trop grossier, et les méthodes pilotées par requête ne sont pas applicables. Comment résoudre ce problème ? L'équipe de données IA de Huawei a proposé un sélecteur de trames apprenable, LFS (Learnable Frame Selector), pour tenter de résoudre ce problème.

Adresse du papier : https://arxiv.org/pdf/2601.14594v1

Leur idée de base est simple : au lieu de sélectionner des images selon des règles humaines, laissez le modèle apprendre par lui-même « ce qu'il faut regarder ».

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

Il s'agit d'une approche d'entraînement « de la fin vers le début » ; LFS n'apprend plus à « sélectionner quelles frames obtiennent un meilleur score à un stade intermédiaire », mais à « sélectionner quelles frames permettent au grand modèle d'écrire une meilleure description ». Comment cela fonctionne-t-il exactement ? Trois conceptions clés :

First, train a scoring network to assign an "event importance" score to each frame.

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

Deuxièmement, sélectionnez des images clés par segment plutôt que par tri global. Lors de la sélection des images, n'utilisez pas simplement les « K images les mieux classées », mais divisez la vidéo en plusieurs périodes temporelles et choisissez les images les plus importantes dans chaque période. Cela permet de capturer les événements clés tout en assurant une répartition équilibrée des images sur la timeline.

Troisièmement, et étape la plus cruciale : la méthode d'entraînement. Une fois que LFS a sélectionné les images, il les fournit au Video-LLM gelé pour générer des descriptions, compare ces descriptions générées aux descriptions de référence annotées manuellement, calcule la perte, puis effectue une rétropropagation pour mettre à jour les paramètres du sélecteur d'images. Tout au long de ce processus, le modèle de langage massif reste inchangé ; LFS agit comme un module externe plug-and-play.

En outre, l'équipe de recherche a identifié un problème : un écart significatif existe entre les référentiels existants de descriptions vidéo détaillées et la cognition humaine réelle. Ils ont donc développé un nouveau référentiel, ICH-CC, dont les vidéos proviennent entièrement de scénarios commerciaux réels de cuisine du patrimoine culturel immatériel chinois (tels que les cuisines de restaurants ou les cours de cuisine). Toutes les descriptions et questions ont été rédigées manuellement avec soin pour mieux refléter les applications réelles.

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

Comment se sont passés les résultats de l'expérience ?

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

LFS apporte une amélioration générale et stable sur différents modèles et différents jeux de tests. Toutes les versions améliorées par LFS dépassent les modèles de référence sur tous les benchmarks testés, ce qui démontre que LFS ne se limite pas à de bonnes performances sur un seul benchmark, mais possède également une certaine généralité.

Cela répond également à la thèse centrale de l'article : plutôt que de faire "calculer" au modèle des frames échantillonnées uniformément, il vaut mieux effectuer un filtrage intelligent en entrée — choisir les bonnes frames permet d'améliorer les performances des tâches en aval.

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

03 Task Adaptation: Characterizing Modular Intervention Instead of Full Model Fine-Tuning

La capacité de généralisation inter-tâches des grands modèles de langage reste un problème « important à dire, difficile à mettre en œuvre ». Les solutions dominantes actuelles reposent sur un routage dynamique par token — chaque token doit choisir, lors de son traitement, parmi plusieurs adaptateurs LoRA, déterminant ainsi son chemin. Ce mécanisme est effectivement efficace, mais il a un coût élevé : la charge de calcul et l'utilisation de la mémoire vidéo restent très élevées, ce qui ralentit l'exécution du modèle et consomme beaucoup de mémoire vidéo.

Une autre approche — le fine-tuning par représentation (ReFT) — ne modifie pas les paramètres du modèle, mais ne modifie que les représentations des jetons de préfixe et de suffixe pour adapter le modèle à une tâche unique, offrant une efficacité bien supérieure à LoRA. Toutefois, elle présente deux limites : premièrement, les jetons eux-mêmes présentent une ambiguïté sémantique, et ne modifier que les jetons de début et de fin n’est pas suffisamment précis ; deuxièmement, elle manque d’un mécanisme d’« auto-guidance » : face à une nouvelle tâche inconnue, le modèle ne sait pas quelle couche modifier ni quelle représentation ajuster.

L'équipe Huawei Cloud, en collaboration avec plusieurs universités, a proposé le cadre RaMod (Representation-Aware Modularity) sensible à la représentation, étendant avec succès l'approche ReFT à des scénarios de généralisation entre tâches.

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

La stratégie principale peut être divisée en deux parties :

La première partie concerne la représentation en modules doubles et le raffinement des paramètres. ReFT ne peut modifier que les extrémités, tandis que RaMod est beaucoup plus fin : il sélectionne un sous-ensemble filtré par une stratégie parmi les représentations cachées des couches intermédiaires pour effectuer une intervention modulaire. L'endroit à modifier et la manière de le faire sont choisis et stratégiques. Cela permet de guider plus précisément le modèle pour résoudre des tâches inédites.

La deuxième partie est l'ordonnanceur asynchrone. La généralisation entre tâches craint le manque de mémoire vidéo ; RaMod a conçu un mécanisme de planification actif : allouer de la mémoire vidéo uniquement selon les interventions nécessaires, et la libérer activement une fois utilisée. Ainsi, la surcharge de stockage est réduite au minimum.

Les résultats sont immédiats. Les expériences montrent que RaMod offre non seulement une meilleure généralisation entre les tâches, mais aussi une réduction significative des coûts : par rapport aux LLMs originaux, le temps de pré-remplissage supplémentaire est réduit de 83 %, la latence de génération est diminuée de 100 %, et l'utilisation de la mémoire GPU est réduite de 79 %.

Autrement dit, RaMod transforme l'adaptation des tâches de « modifier le modèle » en « ajuster les représentations » — en laissant le modèle principal inchangé et en effectuant des éditions ciblées uniquement sur les états cachés des couches clés. Si cette approche s'avère valide, l'économie du déploiement des grands modèles pourrait être réécrite : un modèle de base accompagné de plusieurs modules d'intervention légers pourrait servir des scénarios de tâches radicalement différents à faible coût, sans nécessiter d'entraîner ou de charger une copie complète pour chaque scénario.

Cependant, avant la « réécriture », cette méthode de finesse de représentation soulève encore certaines questions cruciales, comme la capacité à maintenir la précision tout en réduisant considérablement les coûts de calcul dans des scénarios complexes tels que le raisonnement avancé.

04 Données brisant la stagnation : des experts linguistiques spécialisés, un entraînement progressif étape par étape

Les trois premiers articles traitent tous de la question « comment utiliser le modèle de manière plus efficace ». Mais de nombreuses tâches présentent un défi pratique encore plus fondamental : et si les données d'entraînement ne suffisaient pas ?

La tâche de traduction vocale de code-switching (Code-Switching, CS) consiste à traduire des discours contenant plusieurs langues en une langue cible. Ce type de tâche présente non seulement une modélisation sémantique complexe, mais la rareté des données CS constitue un problème majeur.

Les recherches précédentes reposaient principalement sur deux approches : soit laisser le modèle découvrir lui-même les représentations sémantiques, ce qui rend les résultats imprévisibles ; soit effectuer une annotation manuelle coûteuse, trop onéreuse et difficile à échelle.

L'équipe du Centre de traduction Huawei, en collaboration avec l'Université de Xiamen et l'Université de Macao, propose dans cet article une nouvelle approche : au lieu de laisser le modèle découvrir lui-même les représentations sémantiques des différentes langues, il vaut mieux les aligner activement — en créant une « équipe d'experts » distincte pour chaque langue, chargée de modéliser la sémantique de sa langue propre, puis en procédant à un alignement final.

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

Adresse du papier : https://arxiv.org/pdf/2511.10670

Deux conceptions clés permettent de réaliser cela :

Le premier est un projetor vocal MoE (Mixture of Experts). Les projecteurs traditionnels traitent toutes les langues de la même manière, ce qui donne naturellement de mauvais résultats. La version MoE attribue un ensemble d’« experts » dédiés à chaque langue, chaque groupe d’experts se chargeant uniquement de la modélisation fine des caractéristiques vocales d’une langue spécifique. Le mécanisme de routage envoie automatiquement les caractéristiques vocales au groupe d’experts correspondant à la langue appropriée.

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

Pour garantir que le routage ne dévie pas, l'article introduit deux pertes auxiliaires : une perte spécifique à la langue pour s'assurer que chaque expert apprend réellement les caractéristiques de la langue correspondante, et une perte d'équilibrage de charge intra-groupe pour empêcher tous les tokens de se concentrer sur un seul expert.

Le second est un paradigme d'entraînement en plusieurs étapes. En cas de données insuffisantes, on utilise des stratégies pour compenser. L'entraînement se déroule en quatre étapes : d'abord, on pré-entraîne séparément chaque projet pour chaque langue à l'aide de données ASR (reconnaissance automatique de la parole), afin d'établir une base d'alignement voix-texte ; ensuite, on assemble les projets des différentes langues en une structure MoE, et on les optimise conjointement à l'aide d'une perte spécifique à la langue et d'une perte d'équilibrage de charge ; puis, on passe progressivement des données ASR aux données de traduction vocale monolingue (ST), en utilisant une perte de transition pour assurer un transfert fluide ; enfin, on adapte les données ST aux données de traduction vocale code-switching.

La subtilité de cette conception progressive réside dans le fait que, au lieu de faire directement apprendre au modèle les données CS rares, on renforce d’abord ses capacités de base avec des données ASR et ST abondantes, puis on progresse progressivement vers la tâche cible.

Compte rendu des articles de Huawei pour IJCAI 2026 : passage de la « densité de taille » à la « densité de conception »

L'expérience a comparé plusieurs modèles de référence avancés, notamment Whisper, SeamlessM4T et LLaST. Sur les quatre ensembles de test de Fisher et NTUML2021, cette méthode dépasse systématiquement SeamlessM4T, le meilleur parmi les autres modèles, avec un BLEU maximal de 39,52 et un COMET maximal de 81,33.

Le message transmis par ce travail est clair : dans les scénarios interlangues où les données sont rares, une conception d'architecture fine et des stratégies d'entraînement progressives pourraient être plus efficaces que l'accumulation simple de données.

Il convient de noter que cette solution est efficace dans des scénarios où le nombre de langues est limité et la qualité des données est maîtrisée, mais son extensibilité dans un système de traduction multilingue général couvrant des dizaines de langues doit encore être démontrée.

05 Conclusion : Échanger la densité de conception contre le coût de calcul

30B ViT hiérarchique重构了模型骨架,让67亿激活参数在ImageNet上超越了180亿的对手;

LFS effectue une soustraction à l'entrée, bloquant avant le calcul un grand nombre de surcharges de codage de trames inutiles ;

RaMod compresse le fine-tuning complet en une édition ponctuelle au niveau de la couche de représentation, réduisant à la fois la mémoire et la latence pour l'adaptation inter-tâches ;

La traduction vocale par changement de code utilise une répartition MoE et un entraînement progressif, prouvant sur le segment le plus dépourvu de données qu'une architecture intelligente peut parfois compenser le manque de données.

Quatre articles, quatre domaines, tous pointant vers le même noyau : Huawei remplace la densité d'échelle par la densité de conception. Ces quatre articles proviennent de la recherche fondamentale, des données IA, des services cloud et du centre de traduction, ce qui montre que la priorité à l'efficacité n'est plus simplement une préférence d'une équipe spécifique, mais que cette logique est intégrée dans les choix technologiques de chaque étape.

Si la course à l'IA des deux dernières années était comparée à une « course à l'exploitation », 2026 marque un tournant : l'ère de la « métallurgie » a commencé. Activation clairsemée, filtrage intelligent, adaptation modulaire, entraînement progressif — ces approches ne dépendent pas de davantage de puces ou de puissance de calcul, mais d'une compréhension plus profonde du problème lui-même.

Que ce soit des grandes entreprises ou des startups, la course aux paramètres est déjà derrière nous ; la véritable clé de la victoire réside désormais dans la compréhension des problèmes concrets de mise en œuvre et dans les capacités d'ingénierie pour les résoudre de manière systématique.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.