Microsoft y la Universidad Jiaotong de Shanghái lanzan como código abierto Argus, sistema de investigación autónoma de 1548 horas

icon MarsBit
Compartir
AI summary iconResumen
Microsoft y la Universidad Jiao Tong de Shanghái han abierto el código de Argus, un sistema de ejecución de agentes de propósito general para tareas de investigación a largo plazo. El sistema admite investigación autónoma durante varios días mediante la toma de decisiones basada en evidencia. Probado en 27 campañas y 1.548 horas, logró un ciclo de trabajo del 95,1% al 98,7%. Argus produjo resultados en AI4AI, optimización de kernels de GPU y AI4Math. El análisis de interés abierto muestra niveles sólidos de soporte técnico y resistencia en las métricas de rendimiento del sistema.

De "ejecutar" a "liderar", ¿qué le falta al agente a largo plazo?

En la actualidad, con el rápido desarrollo de los agentes, Harness ha permitido que los modelos grandes interactúen con el mundo real, llamando herramientas, modificando código y ejecutando experimentos. Sin embargo, cuando las tareas se extienden de decenas de minutos a varios días, el sistema aún requiere que una persona permanezca frente a la pantalla durante mucho tiempo para decidir hacia dónde avanzar a continuación.

La clave de este cuello de botella no es solo la insuficiente capacidad del modelo, sino que los agentes actuales automatizan principalmente la «ejecución», pero no automatizan realmente la «dirección» por encima de la ejecución. Harness otorga al modelo la capacidad de actuar, mientras que los humanos otorgan al modelo la capacidad de tomar decisiones. Tan pronto como el ser humano se retira, el proyecto se detiene. Además, sin retroalimentación de recompensas densa, la ejecución y la reacción del agente también resultan lentas y torpes.

Para abordar este problema, Microsoft, la Universidad Jiao Tong de Shanghái y otras instituciones lanzaron de código abierto Argus, un entorno de ejecución de agentes genérico diseñado para tareas de investigación a largo plazo, junto con un informe técnico. El sistema permite que los agentes se extiendan a múltiples dominios y realicen investigaciones continuas durante días, sin necesidad de retroalimentación intensiva y estandarizada, mediante diseños como la conducción por evidencia, la autoevolución, la colaboración entre múltiples agentes y la desacoplación entre el núcleo y los dominios específicos.

El informe cubre 27 campañas y 1.548 horas de tiempo real. Se realizó una solicitud activa de intervención humana cada 40,7 horas promedio; la relación de trabajo del informe fue del 95,1% al 98,7%. Esta entrega de Argus no solo incluye un benchmark de alto puntaje, sino también un conjunto completo de resultados listos para producción. El equipo presentó resultados en una amplia gama de tareas, incluyendo AI4AI, GPU Kernel, entrenamiento de modelos, AI4Science, diseño de chips, AI4math y AI4System, demostrando la versatilidad y la inteligencia de nivel de investigación de Argus.

Shanghai Jiao Tong University

Figura 1: Vista general del tiempo de ejecución de Argus, el benchmark de capacidades y los resultados entregados.

Shanghai Jiao Tong University

  • Título del artículo: Argus: ¿Quién impulsa el arnés durante días?
  • Papel: https://arxiv.org/abs/2608.05144
  • Código: https://github.com/lbx154/Argus
  • Página principal del proyecto: https://argusbot.cn/
  • Repositorio de código abierto de los resultados del proyecto: https://github.com/Argus-AiTeam
  • Transmisión en vivo de resolución de problemas matemáticos del proyecto: https://open.argusbot.cn/#counterexample-live

01

De orientado a objetivos a orientado a evidencias:

¿Quién decide el siguiente paso del agente?

En los últimos dos años, el avance principal en la ingeniería de Agentes se ha centrado en el Harness: tomando como analogía el FSD de la conducción autónoma, el modelo es como el motor y el Harness como el sistema de transmisión, pero quien realmente decide hacia dónde va el vehículo sigue siendo la persona sentada frente a la pantalla. En tareas cortas, como el estacionamiento automático, la tarea misma aún puede proporcionar retroalimentación clara; sin embargo, cuando la tarea se extiende a varios días, los problemas de investigación suelen carecer de recompensas estables y de objetivos definidos desde el inicio. Esto expone el verdadero cuello de botella de los Agentes actuales: ya saben ejecutar, pero aún no pueden juzgar continuamente en condiciones de incertidumbre.

Shanghai Jiao Tong University

Figura 2: Argus transforma el papel del ser humano del asiento del conductor, que impulsa constantemente, al asiento del copiloto mediante la investigación autónoma de auto-research.

Argus denomina a esta posición previamente no automatizada encima de Harness como "Driver". Su función es mantener el rumbo basándose en evidencias, incluso cuando hay conflictos entre el plan y la realidad. Los objetivos escritos al inicio de la investigación son solo hipótesis iniciales en la fase de menor información; si el Agente solo persigue de forma Goal-Driven un destino preestablecido, incluso desperdiciando Token repetidamente en objetivos imposibles, se produce una rigidez de objetivos. En cambio, Evidence-Driven invierte la lógica de control: el siguiente paso lo determinan las evidencias existentes, no las suposiciones iniciales del plan. Todos los resultados generados durante la ejecución son evidencias válidas que pueden modificar la ruta; el sistema está impulsado precisamente por la evidencia. Concretamente, el Driver debe responder repetidamente a las siguientes cuatro preguntas según la evidencia actual:

¿Se ha completado este trabajo y es de suficiente calidad?

2. ¿Qué es lo más valioso hacer a continuación, dado la evidencia actual?

3. ¿Cómo debería cambiar el comportamiento del sistema en el futuro basándose en la experiencia de este ciclo?

4. ¿Las preguntas restantes involucran decisiones que solo los humanos pueden tomar?

02

Construir un entorno de ejecución personalizado y de largo plazo universal

Argus organiza los proyectos a largo plazo en campañas persistentes, que se dividen en una serie de misiones con límites claros. Su ciclo básico es Manager → Planner → Engineer ⇄ Reviewer → Manager:

En comparación con el modo /goal de OpenAI Codex, se puede identificar con mayor claridad la orientación de diseño de Argus. /goal extiende el ciclo de una sola ronda de un agente hasta convertirlo en un ciclo persistente con un estado objetivo; Argus, en cambio, organiza proyectos de investigación como entidades de ejecución prolongada con múltiples roles, múltiples harnesses y capacidad de acumular conocimiento. El primero responde a la pregunta: «¿Cómo hacer que el agente no se detenga?»; el segundo responde: «Una vez que el agente no se detiene, ¿cómo funciona de manera efectiva?». Esta es precisamente la diferencia estructural en la capa de ejecución entre un enfoque orientado a objetivos y uno orientado a evidencia.

1. El gerente controla la conversión de etapas, la aprobación de procesos y la estrategia global;

2. El planificador planifica tareas específicas según la evidencia actual;

3. Ingeniero entra en el repositorio de código real, experimenta, ejecuta;

4. El revisor examina los artefactos de forma independiente, verifica la innovación y la efectividad, e informa al gerente o devuelve el trabajo al ingeniero.

El enfoque aquí no es el múltiple rol en sí, sino descomponer el contexto: múltiples roles que trabajan en conjunto para evitar que el agente se convierta en un simple escalador local. Cada rol tiene su propio contexto único pero comparte un espacio de trabajo común, evitando que la planificación, ejecución y validación recaigan completamente en un solo agente, lo que mejora la eficiencia de tokens. Por esta razón, en una tarea de Argus, se pueden activar simultáneamente Pi, Codex, Claude Code, DeepSeek Harness diferentes harness, que garantizan una alta personalización.

El sistema guarda un conjunto completo de artefactos; solo aquellos con experiencia que supere el umbral de evidencia ingresarán a Wiki y Skill, y estarán disponibles para su reutilización en tareas posteriores según el ámbito de Proyecto, Vertical o Global.

Al mismo tiempo, Core y Vertical permanecen desacoplados: Core se encarga de los permisos de roles, la presentación de evidencias y los límites humanos, mientras que Vertical, definido por expertos del dominio, determina qué constituye evidencia válida en tareas de matemáticas, GPU, materiales, etc., así como las habilidades y conocimientos humanos relacionados; Vertical puede mejorar significativamente la calidad de la entrega de tareas de investigación y, al mismo tiempo, proporciona una interfaz para la coevolución de expertos humanos y agentes, así como para la personalización de flujos de trabajo.

Shanghai Jiao Tong University

Figura 3: Mecanismo de funcionamiento a largo plazo de Argus. Cuatro tipos de roles giran en torno al estado persistente, y la campaña puede avanzar o retroceder entre ocho etapas de investigación.

03

¿Qué dejó Argus después de 1548 horas?

Lo que realmente determina si un agente a largo plazo es viable es si el tiempo se puede convertir en resultados de investigación reales. Menos de un mes después de que Argus fuera de código abierto, ya ha logrado contribuciones destacadas en infraestructura, materiales, chips, matemáticas e investigación de sistemas de IA. Además, somos el primer equipo en publicar el registro completo de selección de soluciones de conjeturas matemáticas end-to-end, abriendo todos los registros de trayectorias de ejecución. A continuación, se presenta un resumen de los logros de Argus tras su lanzamiento como código abierto:

Shanghai Jiao Tong University

Figura 4: Investigaciones representativas de Argus, indicadores clave y criterios de aprobación

Como se muestra en la tabla anterior, Argus primero transformó la operación continua en entregas reales y aceptables dentro de AI4System & Infra, completando el primer paso desde la ejecución automática hacia la investigación autónoma mediante resultados de ingeniería claros; posteriormente, la tarea se extendió desde la infraestructura de IA hacia AI4Science, AI4Hardware y AI4Math, y los criterios de evaluación pasaron de “si se completó la tarea establecida” a “si se pueden explorar problemas de investigación reales pendientes”, lo que impulsó la investigación automática desde la entrega automatizada hasta la exploración automatizada; sobre esta base, Argus amplió aún más su enfoque en AI4AI, extendiéndose desde logros puntuales hasta flujos de investigación completos, impulsando continuamente las tareas con evidencia sin necesidad de que los humanos permanezcan constantemente frente a las pantallas, formando así una trayectoria progresiva que va desde entregas reales, exploración interdisciplinaria hasta investigación autónoma integral.

Shanghai Jiao Tong University

Figura 5: Resultados entregados por Argus en el proceso completo de producción de artículos.

Todos estos resultados se lograron en un plazo de un mes. Al conectar estos logros, Argus es una cadena de valor que se profundiza progresivamente: los objetos automatizados se expanden desde una ejecución única hasta la promoción de investigaciones impulsadas por evidencia, acelerando significativamente el progreso de la investigación. Esta es la respuesta más directa a la pregunta: «¿Quién maneja el agente cuando la persona se aleja de la pantalla?»

Conclusión

Después de que la pantalla se apague, el proyecto no se reduce a cero

La inteligencia a largo plazo convierte los tokens en inteligencia, y luego utiliza esa inteligencia para impulsar continuamente un proyecto de investigación y generar valor real. Argus organiza los modelos anteriormente desconectados en un sistema de investigación en funcionamiento continuo, dirigiéndolo con Evidence-Driven y consolidando la experiencia como capacidad mediante autoevolución.

Argus no solo muestra un agente con un tiempo de ejecución más largo, sino un nuevo modo de organizar la investigación: Harness resuelve cómo actúa el modelo, Driver decide cómo avanza el sistema continuamente, y la velocidad de la investigación ya no está limitada por el tiempo laboral y de ocio humano. Esto podría significar que está a punto de comenzar una era de aceleración en la investigación. La pantalla puede apagarse, pero la investigación sigue avanzando.

Presentación del autor

Argus es liderado por investigadores de Microsoft y la Universidad Jiaotong de Shanghái, y promovido conjuntamente por investigadores de varias universidades.

Este artículo proviene del canal de WeChat "Machine Heart"

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.