Microsoft et l'Université Jiaotong de Shanghai ouvrent le code d'Argus, système de recherche autonome de 1548 heures

icon MarsBit
Partager
AI summary iconRésumé
Microsoft et l'Université Jiao Tong de Shanghai ont open-sourcé Argus, un système d'exécution d'agent à usage général pour des tâches de recherche à long terme. Le système permet une recherche autonome sur plusieurs jours grâce à une prise de décision fondée sur des preuves. Testé sur 27 campagnes et 1 548 heures, il a atteint un taux de fonctionnement de 95,1 % à 98,7 %. Argus a produit des résultats dans les domaines de l'IA pour l'IA, l'optimisation des noyaux GPU et l'IA pour les mathématiques. L'analyse de l'intérêt ouvert révèle des niveaux de support et de résistance techniques solides dans les métriques de performance du système.

De « exécuter » à « diriger », qu'est-ce qui manque aux agents à long terme ?

Aujourd'hui, avec le développement rapide des agents, Harness a permis aux grands modèles d'interagir avec le monde réel, en appelant des outils, en modifiant du code et en exécutant des expériences. Toutefois, lorsque les tâches s'étendent de quelques dizaines de minutes à plusieurs jours, le système nécessite toujours qu'une personne reste longtemps devant l'écran pour décider de la prochaine étape à suivre.

La cause principale de ce goulot d'étranglement n'est pas seulement une capacité insuffisante du modèle, mais aussi le fait que les agents existants automatisent principalement l'« exécution », sans véritablement automatiser la « conduite » au-dessus de l'exécution. Harness donne au modèle la capacité d'agir, tandis que les humains lui fournissent la prise de décision. Dès que l'humain quitte le processus, le projet s'arrête. De plus, en l'absence de retours de récompense intensifs, l'exécution et les réactions de l'agent deviennent lentes et maladroites.

Pour résoudre ce problème, Microsoft, l'Université Jiaotong de Shanghai et d'autres institutions ont open-sourcé Argus, un runtime d'inférence d'agent général conçu pour des tâches de recherche à long terme, accompagné d'un rapport technique. Le système permet aux agents de s'étendre à plusieurs domaines et de mener des recherches continues pendant plusieurs jours sans nécessiter de retours standards intensifs, grâce à des conceptions telles que l'approche axée sur les preuves, l'autonomie évolutive, la collaboration entre plusieurs agents et la séparation entre le noyau et les domaines spécialisés.

Le rapport couvre 27 campagnes et 1 548 heures d'horloge. Une intervention humaine active est requise en moyenne toutes les 40,7 heures ; le taux d'occupation du rapport varie entre 95,1 % et 98,7 %. Ce livrable Argus ne se limite pas à un benchmark de haute performance, mais présente un ensemble complet de résultats professionnels. L'équipe a produit des résultats sur des domaines variés tels que l'IA pour l'IA, les noyaux GPU, l'entraînement de modèles, l'IA pour la science, la conception de puces, l'IA pour les mathématiques et l'IA pour les systèmes, démontrant la polyvalence et l'intelligence de niveau recherche d'Argus.

Université Jiao Tong de Shanghai

Figure 1 : Aperçu du temps d'exécution d'Argus, des références de capacité et des résultats livrés.

Université Jiao Tong de Shanghai

  • Titre de l'article : Argus : Qui pilote l'harnais pendant des jours ?
  • Article : https://arxiv.org/abs/2608.05144
  • Code : https://github.com/lbx154/Argus
  • Page du projet : https://argusbot.cn/
  • Bibliothèque open source des résultats du projet : https://github.com/Argus-AiTeam
  • Diffusion en direct de résolution de problèmes mathématiques : https://open.argusbot.cn/#counterexample-live

01

Passer d’une approche orientée objectifs à une approche orientée preuves :

Qui décide de la prochaine étape de l'agent ?

Au cours des deux dernières années, les principaux progrès du projet Agent se sont concentrés sur le Harness : en utilisant une analogie avec le FSD des véhicules autonomes, le modèle est comme le moteur, et le Harness comme la transmission, mais c’est toujours la personne assise devant l’écran qui détermine où le véhicule va. Dans les tâches courtes, comme le stationnement automatique, la tâche elle-même fournit encore des retours clairs ; dès que la tâche s’étend sur plusieurs jours, les problèmes de recherche manquent souvent de récompenses stables et d’objectifs clairement définis dès le départ. Les agents actuels révèlent ainsi leur véritable goulot d’étranglement : ils savent déjà exécuter, mais ne savent pas encore juger de manière continue dans l’incertitude.

Université Jiao Tong de Shanghai

Figure 2 : Argus, en mettant en œuvre une recherche autonome, déplace le rôle humain du siège du conducteur en permanence vers le siège passager.

Argus appelle cette position précédemment non automatisée au-dessus de Harness le « Driver ». Son rôle consiste à continuer à piloter en se basant sur des preuves, même en cas de conflit entre le plan et la réalité. Les objectifs notés au début de la recherche ne sont que des hypothèses initiales formulées lors de la phase d’information minimale ; si l’Agent ne poursuit que de manière Goal-Driven un objectif prédéfini, même lorsqu’il est inaccessible, en gaspillant inutilement des Token, cela entraîne une rigidité des objectifs. En revanche, l’approche Evidence-Driven inverse la logique de contrôle : la prochaine étape est déterminée par les preuves existantes, et non par les hypothèses initiales du plan. Tous les résultats générés pendant l’exécution constituent des preuves valables capables de modifier la trajectoire ; le système est précisément piloté par les preuves. Plus précisément, le Driver doit répondre en continu aux quatre questions suivantes en fonction des preuves actuelles :

1. Ce travail a-t-il été terminé et la qualité est-elle suffisamment bonne ?

2. En tenant compte des preuves actuelles, qu'est-ce qui mérite le plus d'être fait ensuite ?

3. Comment les expériences acquises lors de ce cycle devraient-elles modifier le comportement futur du système ?

4. Les questions restantes impliquent-elles des décisions que seuls les humains peuvent prendre ?

02

Établir un environnement d'exécution personnalisé universel à long terme

Argus organise les projets à long terme en campagnes persistantes, puis les décompose en une série de missions aux limites bien définies. Son cycle de base est : Manager → Planner → Engineer ⇄ Reviewer → Manager :

En se référant au mode /goal d'OpenAI Codex, on peut mieux cerner l'orientation de conception d'Argus. /goal étend un cycle unique d'un agent en un cycle persistant doté d'un état objectif ; Argus, quant à lui, organise des projets de recherche en tant que processus longue durée impliquant plusieurs rôles, plusieurs harness et permettant l'accumulation de connaissances. Le premier répond à la question « Comment empêcher l'agent de s'arrêter ? », le second à « Une fois que l'agent ne s'arrête plus, comment faire en sorte qu'il travaille efficacement ? ». C'est précisément la différence structurelle au niveau de l'exécution entre une approche orientée objectif et une approche orientée preuve.

1. Le gestionnaire maîtrise la transition des phases, l'approbation des processus et la stratégie globale ;

2. Le planificateur établit des tâches spécifiques en fonction des preuves actuelles ;

3. Ingénieur : accéder au dépôt de code réel, expérimenter, exécuter ;

4. L'examinateur examine les artefacts de manière indépendante, vérifie l'innovation et l'efficacité, puis rend compte au gestionnaire ou renvoie l'ingénieur.

L'accent n'est pas sur les rôles multiples en eux-mêmes, mais sur la séparation du contexte — plusieurs rôles travaillent en synergie pour éviter que l'agent ne devienne un simple algorithme de montée locale. Chaque rôle possède son propre contexte exclusif tout en partageant un espace de travail commun, ce qui évite de confier à un seul agent l'ensemble des tâches de planification, d'exécution et de validation, augmentant ainsi l'efficacité des tokens. C'est précisément pour cette raison qu'il est possible d'activer simultanément Pi, Codex et Claude Code dans une seule tâche d'Argus, DeepSeek Harness Différents harness, garantissant une haute personnalisation.

Le système enregistre un ensemble complet d'artefacts ; seules les expériences passant le seuil de preuve sont intégrées au Wiki et à Skill, et rendues réutilisables pour les tâches ultérieures selon les périmètres Project, Vertical ou Global.

Dans le même temps, Core et Vertical restent désaccouplés : Core gère les permissions de rôles, la soumission des preuves et les limites humaines, tandis que Vertical, défini par des experts du domaine, détermine ce qui constitue une preuve valide dans les tâches de mathématiques, GPU, matériaux, etc., ainsi que les compétences et connaissances humaines associées ; Vertical peut considérablement améliorer la qualité de la livraison des tâches de recherche et fournit également une interface pour la co-évolution des experts humains et des agents, ainsi que pour la personnalisation des flux de travail.

Université Jiao Tong de Shanghai

Figure 3 : Mécanisme de fonctionnement à long terme d'Argus. Quatre rôles circulent autour de l'état persistant, et la campagne peut avancer ou revenir en arrière entre huit phases de recherche.

03

1548 heures plus tard, qu'est-ce qu'Argus a laissé ?

Ce qui détermine réellement la viabilité d’un agent à long terme, c’est la capacité à transformer le temps en résultats de recherche concrets. Moins d’un mois après son ouverture source, Argus a déjà apporté des contributions remarquables dans les domaines des infrastructures, des matériaux, des puces, des mathématiques et de la recherche sur les systèmes d’IA. En outre, nous sommes la première équipe à publier l’ensemble des journaux de filtrage pour la résolution de conjectures mathématiques en bout en bout, en rendant accessibles toutes les sessions de trajectoires d’exécution. Ci-dessous, un récapitulatif des résultats obtenus après l’ouverture source d’Argus :

Université Jiao Tong de Shanghai

Figure 4 : Résultats représentatifs d'Argus, indicateurs clés et critères d'acceptation

Comme indiqué dans le tableau ci-dessus, Argus a d'abord transformé le fonctionnement continu en livrables concrets et acceptables au sein d'AI4System & Infra, accomplissant ainsi la première étape passant de l'exécution automatisée à la recherche autonome grâce à des résultats d'ingénierie clairs ; ensuite, la portée des missions s'est étendue de l'infrastructure IA à AI4Science, AI4Hardware et AI4Math, et les critères d'évaluation sont passés de « la tâche a-t-elle été accomplie ? » à « peut-on explorer des questions de recherche réelles encore non résolues » ; cela a permis de faire progresser la recherche automatisée de la livraison automatisée vers l'exploration automatisée. Sur cette base, Argus a ensuite étendu son approche dans la direction AI4AI, passant de résultats ponctuels à un processus de recherche complet, en faisant avancer les missions grâce à des preuves continues, sans nécessiter la présence constante d'un humain devant un écran, formant ainsi une trajectoire progressive allant de la livraison concrète, à l'exploration interdisciplinaire, jusqu'à la recherche entièrement autonome.

Université Jiao Tong de Shanghai

Figure 5 : Résultats livrés par Argus dans le processus complet de production d'article.

Tous ces résultats ont été obtenus en moins d'un mois. En reliant ces réalisations, Argus constitue une chaîne de valeur qui s'approfondit progressivement : les objets automatisés s'étendent d'une exécution unique à des recherches pilotées par des preuves, accélérant considérablement les progrès de la recherche. C'est également la réponse la plus directe à la question : « Qui pilote l'agent après que l'humain a quitté l'écran ? »

Conclusion

Après l’extinction de l’écran, le projet n’a pas été réinitialisé.

L'intelligence à long terme consiste à transformer les jetons en intelligence, puis à utiliser cette intelligence pour faire progresser continuellement un projet de recherche et en générer une valeur concrète. Argus organise les appels de modèles autrefois isolés en un système de recherche en continu, guidé par une approche orientée preuves, et enrichit progressivement ses capacités grâce à une auto-évolution.

Argus ne présente pas seulement un agent à exécution prolongée, mais une nouvelle façon d'organiser la recherche : Harness gère la manière dont le modèle agit, Driver détermine comment le système progresse continuellement, et la vitesse de la recherche n'est plus limitée par les horaires de travail et de loisirs des humains. Cela pourrait signifier que l'ère de l'accélération de la recherche est sur le point de commencer. L'écran peut s'éteindre, mais la recherche continue.

Présentation de l'auteur

Argus est mené par des chercheurs de Microsoft et de l'Université Jiaotong de Shanghai, avec la participation de chercheurs de plusieurs universités.

Cet article provient du compte WeChat « Machine Heart »

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.