Un agente de IA acaba de superar a aproximadamente 3,992 equipos humanos en su propio juego. AIRA₂, un agente de investigación de IA autónomo desarrollado por investigadores del laboratorio FAIR de Meta, el University College London y la Universidad de Oxford, obtuvo el puesto 8 de 4,000 equipos en una competencia de Kaggle centrada en el razonamiento de IA, ganando una medalla de oro en el proceso.
Qué hace realmente AIRA
La línea de agentes AIRA (el nombre significa AI Research Agent) está diseñada para abordar automáticamente problemas complejos de ingeniería de aprendizaje automático. En lugar de simplemente ejecutar un solo modelo y confiar en lo mejor, AIRA utiliza una estrategia de ejecución asíncrona multi-GPU en 8 GPU Nvidia H200.
El sistema emplea lo que el equipo de investigación denomina un protocolo de "Evaluación Oculta y Consistente", un método para evitar que el agente manipule sus propios puntajes de prueba. El agente también utiliza operadores dinámicos de estilo ReAct, lo que significa que puede razonar paso a paso a través de los problemas, ajustar su enfoque en tiempo real y ejecutar código simultáneamente en múltiples procesadores.
En MLE-bench-30, un benchmark estructurado construido a partir de 30 competiciones reales de Kaggle, AIRA₂ logró un rango percentil medio del 81,5% tras 24 horas de cómputo. Al darle 72 horas, ese número aumentó al 83,1%. El mejor baseline previo de otros agentes se situaba en el 72,7%, lo que hace que la mejora de AIRA₂ sea aproximadamente 9 puntos porcentuales por encima de la competencia.
Por qué esto importa más allá de los derechos de alarde
AIRA₂ superó el rendimiento actual de vanguardia humana en 6 de 20 tareas en la evaluación AIRS-Bench. También ganó medallas de oro en tareas individuales de Kaggle donde versiones anteriores del agente no lograron obtener ningún premio.
El marco se basa en lo que el equipo denomina el enfoque AIRA-dojo, diseñado específicamente para abordar las limitaciones de agentes anteriores. Esas limitaciones incluían un rendimiento computacional limitado, sobreajuste en la evaluación, brechas de generalización entre diferentes tipos de problemas y restricciones operativas estáticas que impedían que el agente adaptara su estrategia durante la tarea.
El competitivo entorno de investigación en inteligencia artificial
La colaboración entre Meta FAIR, UCL y Oxford es notable por su peso institucional. El equipo de investigación difundió sus hallazgos a través de preimpresiones de arXiv, el canal estándar para la investigación de IA de vanguardia.
