Des chercheurs de Meta AI et de l'Université de l'Illinois à Urbana-Champaign ont publié un nouvel article présentant EvoHarness-RL, une couche de coordination entraînable qui permet aux agents basés sur des modèles de langage de grande taille de créer, accéder et gérer leur propre état externe. Résultat : un taux de réussite de 96,9 % sur un benchmark standard, contre 47,9 % pour le modèle de référence fonctionnant sans elle.
Ce que fait réellement EvoHarness-RL
Les agents LLM ont des fenêtres de contexte limitées. Lorsqu'une tâche s'étend sur de nombreuses étapes, impliquant des connexions API dynamiques, des journaux serveur, des sous-objectifs en attente et une récupération d'erreurs, la mémoire interne du modèle n'est pas suffisante. Il a besoin d'une structure externe pour suivre ce qu'il croit sur le monde, les progrès accomplis et ce qu'il a appris des erreurs passées.
Le cadre introduit un état externe structuré basé sur trois composants : Croyance, Progrès et Expérience, regroupés sous l'acronyme BPE. La Croyance capture la compréhension actuelle de l'agent concernant son environnement. Le Progrès suit les sous-objectifs accomplis et en attente afin que l'agent n'omette pas d'étapes ni ne duplique du travail. L'Expérience stocke les enseignements tirés des erreurs, comme un refus de lot par une API en raison de limites de taux, permettant à l'agent d'adapter sa méthode.
La formation se déroule en deux étapes. Tout d'abord, un raffinement supervisé à l'aide de démonstrations d'experts enseigne au modèle comment interagir avec le dispositif. Ensuite, une technique d'optimisation consciente des coûts appelée Group Relative Policy Optimization (GRPO) affine le comportement de l'agent pour équilibrer la performance de la tâche et le coût computationnel des appels au dispositif.
Les chercheurs ont testé leur approche en utilisant le modèle Qwen3-8B sur ALFWorld, un benchmark pour l'IA incarnée qui exige que les agents accomplissent des tâches domestiques en plusieurs étapes. Le taux de réussite de 96,9 % dans les environnements familiers est déjà impressionnant, mais le taux de réussite de 86,6 % dans les environnements inédits est peut-être encore plus révélateur.
Deux comportements que les chercheurs n’ont pas explicitement programmés
L'article met en lumière deux phénomènes émergents apparus pendant l'entraînement, aucun n'ayant été directement conçu.
Le premier est le « recuit de montage ». Avec le temps, l'agent commence à internaliser les opérations de montage routinières, réduisant la fréquence à laquelle il doit consulter l'état externe. Les appels de montage diminuent non pas parce que le système se dégrade, mais parce que le modèle a intégré les schémas.
Le second est « exploiter l'évolution ». Pendant que l'agent s'entraîne, il apprend à compresser et à restructurer son état externe en un format plus compact adapté à des types de tâches spécifiques. La représentation BPE devient plus légère et plus spécialisée sans aucune intervention humaine dans sa conception.
S'appuyant sur les travaux antérieurs
EvoHarness-RL s'appuie sur Meta-Harness, un projet antérieur de mars 2026 qui se concentrait sur l'optimisation du code de harness à l'aide de techniques de recherche agente. Alors que Meta-Harness considérait le harness comme un code à améliorer par recherche, EvoHarness-RL traite l'ensemble de la couche de coordination comme quelque chose que le modèle peut apprendre à construire et à affiner.
L'article signale également des améliorations par rapport aux cadres d'agents existants tels que SkillOS et SkillRL, particulièrement sur des tâches inédites. L'écart entre les performances sur des environnements familiers et novateurs est d'environ 10 points de pourcentage pour EvoHarness-RL, contre des baisses bien plus importantes pour les approches concurrentes.
Ce que cela signifie pour le déploiement de l'IA en entreprise
Un taux de réussite passant d’environ 48 % à 97 % dans des environnements contrôlés n’est pas une amélioration mineure. Le taux de généralisation de 86,6 % est également important, car les tâches d’entreprise dans le monde réel rares ressemblent exactement aux données d’entraînement.
L'optimisation sensible au coût intégrée à la phase d'entraînement GRPO répond également à une préoccupation pratique. Les appels externes au harnais ne sont pas gratuits. Ils consomment des ressources de calcul et ajoutent de la latence. En entraînant l'agent à minimiser les appels inutiles grâce à l'annéaling du harnais, le cadre devient plus efficace avec le temps sans sacrifier la précision.
