Ant Group publie quatre articles à l'IJCAI 2026 sur l'adaptabilité de l'IA dans les environnements dynamiques

iconMetaEra
Partager
AI summary iconRésumé
Ant Group a publié quatre articles de recherche sur l'IA + crypto à l'IJCAI 2026, en se concentrant sur l'adaptabilité de l'IA dans des environnements dynamiques. La recherche couvre le regroupement de séries temporelles dynamiques, le mélange de données par apprentissage par renforcement, l'optimisation bayésienne en haute dimension et l'évaluation de la qualité vidéo. Ces études visent à résoudre les décalages de distribution, l'efficacité computationnelle et les écosystèmes AIGC évolutifs. Des plateformes d'actualités sur chaîne comme MetaEra ont mis en avant la profondeur technique et la pertinence pratique de ce travail.
Ant Group publie quatre articles à l'IJCAI 2026, explorant systématiquement l'adaptabilité de l'IA dans les environnements dynamiques.

Auteur et source de l'article : Leifeng.com

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Même le plus intelligent des algorithmes doit finalement être testé dans un environnement dynamique.

IJCAI-ECAI 2026 se tiendra à Brême, en Allemagne, du 15 au 21 août 2026. À l'occasion de la conférence, AI Technology Review effectue actuellement un balayage systématique des articles acceptés par ce sommet pour identifier les tendances technologiques et les orientations du secteur.

Dansle bilan des articles de Huawei à l'IJCAI 2026 : du « volume de paramètres » au « densité de conception », nous avons observé la retenue des grandes entreprises dans la course aux paramètres et leur quête d'efficacité énergétique.

Les quatre articles sélectionnés d'Ant Group pointent vers une autre voie technologique tout aussi importante, mais radicalement différente : une exploration systématique de la capacité d'adaptation aux environnements dynamiques.

La précision des modèles algorithmiques ne cesse de battre des records en laboratoire, mais une fois déployés dans le monde réel, une dégradation des performances devient presque la norme. La raison est simple : le monde réel n'est jamais statique.

Les scénarios d'activité d'Ant Group poussent ce caractère « non statique » à l'extrême : plus de 1 milliard d'utilisateurs, plus de 8 000 services différents, les pics de paiement et les creux nocturnes peuvent différer de plusieurs ordres de grandeur ; les modèles de gestion des risques doivent répondre en heures aux itérations des stratégies de la cybercriminalité, et le déploiement mondial doit s'adapter aux infrastructures financières très variées de chaque pays.

Dans un tel environnement, les modèles statiques « entraînés une fois, déployés pour toujours » sont condamnés à tomber dans le piège de « chercher son épée sous l'endroit où elle est tombée ».

C'est précisément pourquoi l'intelligence véritable réside dans la capacité des algorithmes à percevoir les changements d'environnement, à ajuster activement leurs stratégies et à rechercher des solutions optimales dans un contexte dynamique. Ces quatre articles du groupe Ant répondent tous à cette question centrale : comment faire évoluer l'IA d'un « solveur statique » en un « adaptateur dynamique » ?

01 MSRGC-Net : Rendre le regroupement de séries temporelles "adaptatif" à la distribution de densité des données

Le regroupement de séries temporelles consiste à classer automatiquement d'immenses séries de comportements ; c'est un outil fondamental pour comprendre les modèles de comportement et surveiller les signaux anormaux.

Mais les méthodes actuelles présentent chacune leurs propres difficultés :

  • Méthodes de similarité (comme k-Shape) : capables de détecter des motifs locaux, mais nécessitent le calcul de la distance entre toutes les paires d'échantillons ; deviennent inefficaces avec un grand volume de données ;
  • Méthodes d'apprentissage profond (comme les autoencodeurs) : capacité de représentation élevée, mais entraînement coûteux, réglage complexe et forte consommation de puissance de calcul ;
  • Extraction de caractéristiques traditionnelle : repose sur la conception manuelle de caractéristiques, ce qui peut entraîner la perte d'informations dynamiques temporelles essentielles.

Le problème plus important est que la densité des données temporelles dans le monde réel est extrêmement inégale — les données de transaction du 11/11 sont aussi denses qu'une averse, tandis que les données de l'aube sont aussi rares qu'une goutte d'eau, mais les méthodes traditionnelles exigent que vous leur indiquiez à l'avance combien de catégories il faut créer, ce qui est déjà en décalage avec la réalité.

MSRGC-Net, proposé par Ant Group en collaboration avec l'Université de Chongqing de technologie des télécommunications, contourne le dilemme entre précision et efficacité de calcul grâce à une approche « sans entraînement ».

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Adresse du papier : https://arxiv.org/pdf/2606.12077v1

▎Son logique fondamentale peut être décomposée en trois étapes :

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Étape 1 : Codage de réservoir à échelles multiples (extraction de caractéristiques). Utilisez plusieurs réseaux à état d'écho (ESN) non entraînés comme unités de calcul de base du réservoir ; en ajustant uniquement le rayon spectral, il est possible d'extraire simultanément les fluctuations locales et les tendances à long terme à partir des séries temporelles brutes. Après agrégation de tous les échantillons, une matrice de caractéristiques de vue est formée, servant d'entrée pour les étapes suivantes.

Étape 2 : Construction de la carte d'ancrage des « boules granulaires » (modélisation structurelle), qui constitue la partie la plus ingénieuse. L'algorithme ne se concentre plus sur des points de données individuels, mais divise automatiquement les « boules granulaires » en fonction de la densité locale des données : les régions à forte densité forment de petites boules nombreuses, tandis que les régions à faible densité forment de grandes boules peu nombreuses. La taille des données est réduite de N à M (nombre de boules, M < N), tout en atténuant les interférences de bruit.

Étape 3 : Optimisation de graphe multi-échelle basée sur le consensus. Les graphes ancrés à travers les échelles sont fusionnés selon une stratégie de consensus, permettant au modèle de capturer à la fois des motifs locaux microscopiques et des tendances globales macroscopiques, afin de produire des résultats de regroupement robustes sans nécessiter de spécification manuelle du nombre de clusters.

How effective is this strategy?

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Sur 5 ensembles de données de référence multivariées et 15 indicateurs d'évaluation (NMI, ARI, RI à 5 chacun), MSRGC-Net a obtenu 12 premières places et 2 deuxièmes places — un taux de 80 % de premières places.

Plus important encore, il évite les calculs par paires en O(n²) et atteint une complexité quasi linéaire. En termes simples : rapide et précis, sans avoir à deviner le nombre de catégories à utiliser.

Dans les scénarios réels d'exploitation de Ant, cela signifie que le système ajuste automatiquement la granularité du regroupement en fonction de la densité du trafic : pendant les pics, il effectue un regroupement fin pour détecter les anomalies ; pendant les creux, il utilise une granularité plus grossière pour économiser des ressources de calcul, en suivant toujours les données.

02 Rendre la stratégie de mélange de données adaptative pour l'apprentissage par renforcement en ligne à partir de hors ligne

L'apprentissage par renforcement souffre d'un problème bien connu appelé « décalage de distribution » : un modèle formé sur des données hors ligne a tendance à « oublier » dès son déploiement en ligne. Cela est dû à une différence de distribution entre les données hors ligne et les données issues des interactions en ligne, ce qui entraîne une perte rapide des connaissances acquises hors ligne au début de l'exploitation en ligne.

Les solutions actuelles se résument à deux options : soit fixer un ratio mixte de 50 % hors ligne et 50 % en ligne, soit utiliser des règles heuristiques pour privilégier l'échantillonnage des échantillons « proches de la stratégie ».

Mais le problème, c’est que les besoins de la stratégie varient complètement selon les phases — au début, il faut davantage de données hors ligne pour stabiliser la base, tandis qu’à la fin, il faut davantage de données en ligne pour explorer de nouvelles possibilités. Une stratégie fixe, c’est comme graver un trait sur un bateau pour chercher son épée tombée à l’eau.

Ant Group, en collaboration avec l'Université Jiaotong de Shanghai, a proposé ROAD, transformant le ratio de mélange des données d'une « variable prédéfinie » en une « variable de décision dynamique ».

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Adresse du papier : https://arxiv.org/pdf/2605.14497

Son idée centrale est intéressante : le choix des données est fondamentalement un problème d'optimisation à deux niveaux.

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

  • Niveau interne (Inner-Level) : Mise à jour standard de Q-learning, consistant à minimiser l'erreur de Bellman ;
  • Niveau externe (Outer-Level) : Considérer la stratégie de mélange de données comme une variable de décision méta, dans le but de maximiser le rendement attendu de la stratégie en ligne.

Deux couches résolvent approximativement l'algorithme Multi-Armed Bandit (MAB) pour permettre à la stratégie hybride de s'ajuster en temps réel pendant l'entraînement : dès que le modèle commence à « oublier » les connaissances apprises pendant la phase hors ligne, le taux d'échantillonnage des données hors ligne est automatiquement augmenté pour stabiliser la base ; lorsque le modèle devient trop conservateur et manque d'exploration, la proportion de données en ligne est augmentée à temps pour l'encourager à expérimenter.

Les expériences ont été menées de manière solide. L'équipe a validé l'algorithme sur trois benchmarks classiques du passage de l'apprentissage par renforcement hors ligne à en ligne : AntMaze (robot cherchant à sortir d'un labyrinthe), MuJoCo (commande du mouvement de robots biomimétiques) et FrankaKitchen (bras mécanique accomplissant des tâches complexes dans une cuisine). Ces tâches, de difficultés variées et avec des espaces d'état différents, permettent d'évaluer de manière globale la capacité de généralisation de l'algorithme.

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Pour vérifier la généralité de l'algorithme ROAD, l'équipe de recherche a combiné ROAD avec plusieurs algorithmes hors ligne courants tels que IQL, PEX, CQL et Cal-QL. Les résultats montrent que, quel que soit l'algorithme de base utilisé, ROAD apporte systématiquement une amélioration des performances.

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Avec PEX+ROAD, cette méthode obtient un score moyen global de 71,12 sur les 24 tâches de contrôle continu du benchmark D4RL, atteignant la première place sur 18 tâches sur 24, surpassant nettement toutes les lignes de base telles que les ratios fixes, les ratios décroissants et la rééchantillonnage heuristique équilibré.

Cela signifie que ROAD permet au modèle d'atteindre un équilibre optimal entre « héritage conservateur » et « exploration audacieuse » — évitant ainsi les échecs au lancement tout en ne manquant pas les opportunités d'amélioration apportées par les données en temps réel. Cette méthode présente une valeur très claire pour des scénarios tels que le déploiement de modèles de gestion des risques du groupe Ant et l'optimisation en temps réel des systèmes de recommandation.

03 DSEBO : Faire en sorte que l'optimisation bayésienne de haute dimension recherche de manière adaptative des sous-espaces

L'optimisation bayésienne est une méthode classique pour l'optimisation de fonctions boîte noire, mais elle peine face aux problèmes de haute dimension. Une solution courante consiste en l'embedding aléatoire — projeter l'optimisation dans un sous-espace de faible dimension — mais une nouvelle question surgit : quelle est la dimension effective ?

Les méthodes traditionnelles dépendent soit de l'expérience des experts pour fixer une dimension de sous-espace, soit utilisent une approche par essais et erreurs pour l'estimer répétitivement, consommant ainsi de nombreux ressources, et la dimension fixe du sous-espace peine à s'adapter à différentes tâches. Plus problématique encore, la dimension efficace elle-même peut varier au cours de l'optimisation : une faible dimension suffit lors de l'exploration initiale, tandis qu'une dimension plus élevée est nécessaire pour le raffinement final.

DSEBO, proposé par Ant Group en collaboration avec l'Université normalle de l'Est de la Chine et l'Université de Nankin, fait de la dimension de l'espace sous-jacent une « variable dynamique » au cours de l'optimisation, permettant un basculement autonome selon l'avancement de la recherche.

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Adresse du papier : https://arxiv.org/pdf/2605.23473

Le mécanisme central de DSEBO est « du bas vers le haut, progression par étapes » :

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

  • À partir d'un sous-espace de faible dimension, l'optimiseur génère des solutions candidates dans cet espace de faible dimension, les mappe aléatoirement vers l'espace d'origine, identifie rapidement la forme générale de la fonction objectif, puis utilise les retours des résultats pour mettre à jour itérativement le processus gaussien ;
  • Observation d'une extension dimensionnelle déclenchée automatiquement après convergence, permettant d'« hériter » des solutions de faible dimension via une matrice d'incrustation partagée ;
  • Initialisation et optimisation continues des sous-espaces, garanties par une matrice d'embeddings partagée pour assurer l'emboîtement mutuel des sous-espaces, formant une boucle « exploration à faible dimension → déclenchement de convergence → extension de dimension → optimisation continue » jusqu'à atteindre la limite budgétaire d'évaluation.

Lors de la phase d'extension de dimension, l'amplitude d'extension n'est pas fixe — l'algorithme ajuste automatiquement en fonction de la courbe de variation de la valeur optimale actuelle : si la courbe est plate, l'extension est plus lente pour éviter des coûts inutiles ; si la courbe est abrupte, l'extension est plus rapide pour capter rapidement les gains en haute dimension.

Les résultats expérimentaux montrent que, sur des fonctions synthétiques (Levy, Griewank, Sphere, D=1000) et trois tâches réelles (MSLR, Lasso-Hard, LIMO), DSEBO a été comparé point par point à une dizaine de méthodes principales telles que REMBO, SIRBO, BAxUS et TuRBO, et a obtenu la solution optimale dans presque toutes les tâches — avec une précision et une vitesse de convergence supérieures.

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Cette approche « explorer en basse dimension, affiner en haute dimension » est également très utile dans le développement quotidien d'Ant — l'optimisation des hyperparamètres des modèles de crédit, la recherche des seuils optimaux pour les stratégies de gestion des risques, la conception d'expériences multivariées pour les campagnes marketing : plus besoin d'estimer les dimensions à l'aveugle par des experts, l'algorithme « observe et s'ajuste en temps réel », réalisant ainsi un fonctionnement automatisé et hautement efficace.

04 VGA-BenchV2 : Rendre le benchmark d'évaluation vidéo "adaptatif" à l'évolution de l'écosystème AIGC

Si les trois premiers articles discutent de l'adaptation au niveau des algorithmes, VGA-BenchV2 montre comment l'infrastructure d'évaluation s'adapte à l'évolution de l'écosystème des technologies AIGC. C'est également le seul des quatre articles à se concentrer sur la compréhension des contenus multimodaux, reflétant les réserves stratégiques du groupe Ant dans des domaines non financiers tels que la vie numérique et l'écosystème de contenu.

AIGC déclenche une explosion de la production vidéo, mais un problème fondamental bloque la voie : comment évaluer systématiquement la qualité de ces vidéos générées ?

Les indicateurs d'évaluation traditionnels tels que le FVD (évalue la qualité globale et la cohérence temporelle) et le CLIP Score (évalue la cohérence sémantique entre les images générées et les descriptions textuelles) se concentrent principalement sur la netteté des images, la fluidité des mouvements et la correspondance avec le texte. En revanche, ils sont presque incapables d'évaluer des qualités perceptuelles liées à l'esthétique, telles que la composition, l'utilisation de la lumière et de l'ombre, ou l'harmonie des couleurs.

Lors du CVPR 2026, Ant Group, en collaboration avec l'Académie de cinéma de Pékin et l'Institut d'intelligence générale artificielle (BIGAI), a introduit VGA-Bench, établissant pour la première fois un cadre tridimensionnel pour l'évaluation esthétique des vidéos (qualité esthétique, étiquettes esthétiques, qualité de génération), et a construit une base d'évaluation basée sur 1 016 prompts, 12 modèles de génération et plus de 60 000 vidéos, permettant à l'IA d'apprendre pour la première fois à « apprécier » les vidéos du point de vue d'un expert.

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Lien vers l'article : https://arxiv.org/pdf/2604.10127

Mais les modèles de génération vidéo évoluent trop rapidement ; le rythme d'itération mensuel rend rapidement les benchmarks fixes « insuffisants ». Dans cet article de l'IJCAI 2026, l'équipe présente encore plus loin VGA-BenchV2.

Ant Group - Récapitulatif des articles IJCAI 2026 : Apprendre à l'IA à « s'adapter en temps réel »

Adresse open source :

https://huggingface.co/datasets/BestVictoryLab/VGA-Bench

▎Trois évolutions principales :

Premièrement, la quantité d'annotations humaines a augmenté. VGA-BenchV2 ajoute 36 000 annotations humaines au niveau des tâches, dont 16 200 annotations de qualité esthétique, 13 200 annotations d'étiquettes esthétiques et 6 600 annotations de qualité de génération, représentant respectivement une extension de 13,46 fois, 11,15 fois et 1,55 fois par rapport à VGA-Bench. Une quantité plus importante de données sur les « préférences humaines » permet à l'évaluateur de mieux s'aligner sur le jugement esthétique humain.

Deuxièmement, mise à niveau de l'architecture de l'évaluateur. L'équipe a conçu une architecture hybride : VAQA-Net gère l'évaluation continue de l'esthétique, tandis que VTag-Net et VGQA-Net effectuent la reconnaissance des étiquettes et l'évaluation de la qualité à l'aide du grand modèle visuel et linguistique Qwen. L'introduction de ces grands modèles a permis à l'évaluateur de mieux comprendre les sémantiques visuelles complexes. Les résultats expérimentaux montrent que ses évaluations sur plusieurs modèles de génération sont fortement cohérentes avec les jugements humains.

Troisièmement, la boucle fermée entre « évaluation » et « optimisation » est établie. Il s'agit de la conception la plus révolutionnaire de VGA-BenchV2 : elle utilise l'évaluateur esthétique appris comme signal de récompense pour le fine-tuning direct des modèles génératifs par apprentissage par renforcement. Cela signifie que le benchmark d'évaluation n'est plus seulement un « arbitre » ; ses scores peuvent être directement convertis en signaux d'optimisation pour guider l'itération continue des modèles génératifs en matière de qualité esthétique.

De VGA-Bench à VGA-BenchV2, le système d'évaluation n'est plus une règle statique, mais un système vivant qui évolue en parallèle avec l'écosystème de génération. Pour les scénarios d'Ant Group tels que la compréhension des contenus, la modération de sécurité et l'optimisation des recommandations, la capacité d'évaluation de la qualité vidéo ne suit pas seulement l'évolution de l'écosystème AIGC, mais stimule également l'optimisation des modèles en amont : du « score » à l'« optimisation », un cercle vertueux est ainsi établi.

Conclusion : Même le plus intelligent des algorithmes doit être testé dans un environnement dynamique.

Quatre articles explorent respectivement l'apprentissage non supervisé, l'apprentissage par renforcement, l'optimisation boîte noire et l'évaluation multimodale, convergent tous vers une même voie technologique : la transition du statique au dynamique.

Les données expérimentales confirment également l'efficacité de cette approche : MSRGC-Net obtient 12 premières places et 2 deuxièmes places sur 15 indicateurs ; ROAD surpasse les stratégies existantes dans diverses tâches d'apprentissage par renforcement de hors ligne vers en ligne ; DSEBO réalise des améliorations quantifiables sur des problèmes d'optimisation à mille dimensions ; VGA-BenchV2 obtient des résultats d'évaluation sur plusieurs modèles de génération fortement cohérents avec les jugements humains.

En examinant la stratégie globale d'Ant le long de cette voie technologique, on observe une structure claire de « propulsion double » : d'un côté, elle approfondit la modélisation temporelle, l'apprentissage par renforcement et les algorithmes d'optimisation dans les scénarios financiers fondamentaux ; de l'autre, elle anticipe le déploiement d'infrastructures de compréhension et d'évaluation multimodales dans l'écosystème numérique et de contenu.

Au fond, quel que soit l'ingéniosité des algorithmes, ils doivent finalement être testés dans un environnement dynamique. La véritable valeur de ces quatre articles réside peut-être dans le fait qu'ils ont tous émergé d'un contexte commercial réel : les scénarios d'activité d'Ant ne sont pas un « décor » pour les articles, mais la source des problèmes, le lieu de production des données et le terrain d'essai des résultats.

Et c’est peut-être précisément ce qui rend la recherche en IA dans l’industrie si unique — ils ne se contentent pas de « publier des articles », mais cherchent des solutions capables de résister aux changements dynamiques pour des problèmes du monde réel.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.