El agente de IA AIRA₂ supera en 9 puntos porcentuales a los modelos anteriores en la prueba de ML

iconCryptoBriefing
Compartir
AI summary iconResumen
Noticias de IA y cripto: AIRA₂, un agente de investigación de IA autónomo del laboratorio FAIR de Meta, la University College London y la University of Oxford, obtuvo un 81,5% en la prueba MLE-bench-30 tras 24 horas, aumentando a 83,1% tras 72 horas. Esto representa un aumento de 9 puntos porcentuales respecto a modelos anteriores. AIRA₂ también ocupó el puesto 8º en una competencia de Kaggle con 4.000 equipos, asegurando una medalla de oro. La actividad en la cadena resalta la creciente integración de la IA en campos basados en datos.

Un agente de IA acaba de superar a aproximadamente 3,992 equipos humanos en su propio juego. AIRA₂, un agente de investigación de IA autónomo desarrollado por investigadores del laboratorio FAIR de Meta, el University College London y la Universidad de Oxford, obtuvo el puesto 8 de 4,000 equipos en una competencia de Kaggle centrada en el razonamiento de IA, ganando una medalla de oro en el proceso.

Qué hace realmente AIRA

La línea de agentes AIRA (el nombre significa AI Research Agent) está diseñada para abordar automáticamente problemas complejos de ingeniería de aprendizaje automático. En lugar de simplemente ejecutar un solo modelo y confiar en lo mejor, AIRA utiliza una estrategia de ejecución asíncrona multi-GPU en 8 GPU Nvidia H200.

Anuncio

El sistema emplea lo que el equipo de investigación denomina un protocolo de "Evaluación Oculta y Consistente", un método para evitar que el agente manipule sus propios puntajes de prueba. El agente también utiliza operadores dinámicos de estilo ReAct, lo que significa que puede razonar paso a paso a través de los problemas, ajustar su enfoque en tiempo real y ejecutar código simultáneamente en múltiples procesadores.

En MLE-bench-30, un benchmark estructurado construido a partir de 30 competiciones reales de Kaggle, AIRA₂ logró un rango percentil medio del 81,5% tras 24 horas de cómputo. Al darle 72 horas, ese número aumentó al 83,1%. El mejor baseline previo de otros agentes se situaba en el 72,7%, lo que hace que la mejora de AIRA₂ sea aproximadamente 9 puntos porcentuales por encima de la competencia.

Por qué esto importa más allá de los derechos de alarde

AIRA₂ superó el rendimiento actual de vanguardia humana en 6 de 20 tareas en la evaluación AIRS-Bench. También ganó medallas de oro en tareas individuales de Kaggle donde versiones anteriores del agente no lograron obtener ningún premio.

El marco se basa en lo que el equipo denomina el enfoque AIRA-dojo, diseñado específicamente para abordar las limitaciones de agentes anteriores. Esas limitaciones incluían un rendimiento computacional limitado, sobreajuste en la evaluación, brechas de generalización entre diferentes tipos de problemas y restricciones operativas estáticas que impedían que el agente adaptara su estrategia durante la tarea.

El competitivo entorno de investigación en inteligencia artificial

La colaboración entre Meta FAIR, UCL y Oxford es notable por su peso institucional. El equipo de investigación difundió sus hallazgos a través de preimpresiones de arXiv, el canal estándar para la investigación de IA de vanguardia.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.