L'agent IA AIRA₂ surpasse les modèles précédents de 9 points de pourcentage dans le benchmark ML

iconCryptoBriefing
Partager
AI summary iconRésumé
Actualités IA + crypto : AIRA₂, un agent de recherche IA autonome issu du laboratoire FAIR de Meta, du University College London et de l’Université d’Oxford, a obtenu 81,5 % au benchmark MLE-bench-30 après 24 heures, passant à 83,1 % après 72 heures. Cela représente une progression de 9 points de pourcentage par rapport aux modèles précédents. AIRA₂ s’est également classé 8e dans une compétition Kaggle regroupant 4 000 équipes, remportant une médaille d’or. Les activités sur chaîne mettent en lumière l’intégration croissante de l’IA dans les domaines axés sur les données.

Un agent IA vient de battre environ 3 992 équipes humaines à leur propre jeu. AIRA₂, un agent de recherche autonome développé par des chercheurs du laboratoire FAIR de Meta, de l’University College London et de l’Université d’Oxford, a obtenu la 8e place sur 4 000 équipes dans une compétition Kaggle axée sur le raisonnement IA, remportant au passage une médaille d’or.

Ce que fait réellement AIRA

La ligne d'agents AIRA (dont le nom signifie AI Research Agent) est conçue pour résoudre de manière autonome des problèmes complexes d'ingénierie de l'apprentissage automatique. Plutôt que de simplement exécuter un seul modèle et d'espérer le meilleur, AIRA utilise une stratégie d'exécution asynchrone multi-GPU sur 8 GPU Nvidia H200.

Publicité

Le système utilise ce que l'équipe de recherche appelle un protocole d'évaluation cachée et cohérente, une méthode pour empêcher l'agent de tricher sur ses propres scores de test. L'agent utilise également des opérateurs dynamiques de type ReAct, ce qui signifie qu'il peut raisonner étape par étape, ajuster sa méthode en temps réel et exécuter du code simultanément sur plusieurs processeurs.

Sur MLE-bench-30, un benchmark structuré issu de 30 compétitions Kaggle réelles, AIRA₂ a atteint un rang percentuel moyen de 81,5 % après 24 heures de calcul. En lui accordant 72 heures, ce chiffre est passé à 83,1 %. Le meilleur baseline précédent d'autres agents se situait à 72,7 %, ce qui fait de l'amélioration d'AIRA₂ une avance d'environ 9 points de pourcentage sur la concurrence.

Pourquoi cela importe au-delà du simple orgueil

AIRA₂ a dépassé les performances de pointe humaines sur 6 tâches sur 20 dans l'évaluation AIRS-Bench. Elle a également remporté des médailles d'or sur des tâches individuelles de Kaggle où les versions précédentes de l'agent n'avaient obtenu aucune récompense.

Le cadre s'appuie sur ce que l'équipe appelle l'approche AIRA-dojo, conçue spécifiquement pour remédier aux limites des agents précédents. Ces limites incluaient un débit computationnel restreint, un surapprentissage lors de l'évaluation, des écarts de généralisation entre différents types de problèmes, ainsi que des contraintes opérationnelles statiques qui empêchaient l'agent d'adapter sa stratégie en cours de tâche.

Le paysage compétitif de la recherche en intelligence artificielle

La collaboration entre Meta FAIR, UCL et Oxford est remarquable par son poids institutionnel. L'équipe de recherche a diffusé ses résultats via des prépublications arXiv, le canal standard pour la recherche en intelligence artificielle de pointe.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.