Meta et l'Université de l'Illinois développent EvoHarness-RL, augmentant le taux de réussite des agents IA à 96,9 %

iconCryptoBriefing
Partager
AI summary iconRésumé
Des chercheurs de Meta et de l'Université de l'Illinois ont développé EvoHarness-RL, une couche d'exécution auto-évolutive pour les agents IA. Le système a atteint un taux de réussite de 96,9 % sur un benchmark standard, contre 47,9 % sans elle. Le cadre utilise un état externe structuré composé de Croyance, Progrès et Expérience (BPE) pour gérer des tâches complexes. Il manifeste des comportements émergents tels que le recuit de harness et l'évolution. Cette avancée pourrait avoir un impact sur les efforts CFT et améliorer la liquidité sur les marchés cryptos.

Des chercheurs de Meta AI et de l'Université de l'Illinois à Urbana-Champaign ont publié un nouvel article présentant EvoHarness-RL, une couche de coordination entraînable qui permet aux agents basés sur des modèles de langage de grande taille de créer, accéder et gérer leur propre état externe. Résultat : un taux de réussite de 96,9 % sur un benchmark standard, contre 47,9 % pour le modèle de référence fonctionnant sans elle.

Ce que fait réellement EvoHarness-RL

Les agents LLM ont des fenêtres de contexte limitées. Lorsqu'une tâche s'étend sur de nombreuses étapes, impliquant des connexions API dynamiques, des journaux serveur, des sous-objectifs en attente et une récupération d'erreurs, la mémoire interne du modèle n'est pas suffisante. Il a besoin d'une structure externe pour suivre ce qu'il croit sur le monde, les progrès accomplis et ce qu'il a appris des erreurs passées.

Le cadre introduit un état externe structuré basé sur trois composants : Croyance, Progrès et Expérience, regroupés sous l'acronyme BPE. La Croyance capture la compréhension actuelle de l'agent concernant son environnement. Le Progrès suit les sous-objectifs accomplis et en attente afin que l'agent n'omette pas d'étapes ni ne duplique du travail. L'Expérience stocke les enseignements tirés des erreurs, comme un refus de lot par une API en raison de limites de taux, permettant à l'agent d'adapter sa méthode.

La formation se déroule en deux étapes. Tout d'abord, un raffinement supervisé à l'aide de démonstrations d'experts enseigne au modèle comment interagir avec le dispositif. Ensuite, une technique d'optimisation consciente des coûts appelée Group Relative Policy Optimization (GRPO) affine le comportement de l'agent pour équilibrer la performance de la tâche et le coût computationnel des appels au dispositif.

Publicité

Les chercheurs ont testé leur approche en utilisant le modèle Qwen3-8B sur ALFWorld, un benchmark pour l'IA incarnée qui exige que les agents accomplissent des tâches domestiques en plusieurs étapes. Le taux de réussite de 96,9 % dans les environnements familiers est déjà impressionnant, mais le taux de réussite de 86,6 % dans les environnements inédits est peut-être encore plus révélateur.

Deux comportements que les chercheurs n’ont pas explicitement programmés

L'article met en lumière deux phénomènes émergents apparus pendant l'entraînement, aucun n'ayant été directement conçu.

Le premier est le « recuit de montage ». Avec le temps, l'agent commence à internaliser les opérations de montage routinières, réduisant la fréquence à laquelle il doit consulter l'état externe. Les appels de montage diminuent non pas parce que le système se dégrade, mais parce que le modèle a intégré les schémas.

Le second est « exploiter l'évolution ». Pendant que l'agent s'entraîne, il apprend à compresser et à restructurer son état externe en un format plus compact adapté à des types de tâches spécifiques. La représentation BPE devient plus légère et plus spécialisée sans aucune intervention humaine dans sa conception.

S'appuyant sur les travaux antérieurs

EvoHarness-RL s'appuie sur Meta-Harness, un projet antérieur de mars 2026 qui se concentrait sur l'optimisation du code de harness à l'aide de techniques de recherche agente. Alors que Meta-Harness considérait le harness comme un code à améliorer par recherche, EvoHarness-RL traite l'ensemble de la couche de coordination comme quelque chose que le modèle peut apprendre à construire et à affiner.

L'article signale également des améliorations par rapport aux cadres d'agents existants tels que SkillOS et SkillRL, particulièrement sur des tâches inédites. L'écart entre les performances sur des environnements familiers et novateurs est d'environ 10 points de pourcentage pour EvoHarness-RL, contre des baisses bien plus importantes pour les approches concurrentes.

Ce que cela signifie pour le déploiement de l'IA en entreprise

Un taux de réussite passant d’environ 48 % à 97 % dans des environnements contrôlés n’est pas une amélioration mineure. Le taux de généralisation de 86,6 % est également important, car les tâches d’entreprise dans le monde réel rares ressemblent exactement aux données d’entraînement.

L'optimisation sensible au coût intégrée à la phase d'entraînement GRPO répond également à une préoccupation pratique. Les appels externes au harnais ne sont pas gratuits. Ils consomment des ressources de calcul et ajoutent de la latence. En entraînant l'agent à minimiser les appels inutiles grâce à l'annéaling du harnais, le cadre devient plus efficace avec le temps sans sacrifier la précision.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.