Um agente de IA acabou de superar aproximadamente 3.992 equipes humanas no próprio jogo. AIRA₂, um agente de pesquisa de IA autônomo desenvolvido por pesquisadores do laboratório FAIR da Meta, do University College London e da Universidade de Oxford, ficou em 8º lugar entre 4.000 equipes em uma competição do Kaggle focada em raciocínio de IA, conquistando uma medalha de ouro no processo.
O que a AIRA realmente faz
A linha de agentes AIRA (o nome significa AI Research Agent) foi projetada para resolver autonomamente problemas complexos de engenharia de aprendizado de máquina. Em vez de apenas executar um único modelo e esperar pelo melhor resultado, a AIRA utiliza uma estratégia de execução assíncrona multi-GPU em 8 GPUs Nvidia H200.
O sistema emprega o que a equipe de pesquisa chama de protocolo de "Avaliação Oculta e Consistente", um método para impedir que o agente manipule seus próprios resultados de teste. O agente também utiliza operadores dinâmicos do estilo ReAct, o que significa que ele pode raciocinar passo a passo, ajustar sua abordagem em tempo real e executar código simultaneamente em vários processadores.
No MLE-bench-30, um benchmark estruturado construído a partir de 30 competições reais do Kaggle, o AIRA₂ alcançou uma classificação percentual média de 81,5% após 24 horas de computação. Ao fornecer 72 horas, esse número subiu para 83,1%. A melhor linha de base anterior de outros agentes estava em 72,7%, tornando a melhoria do AIRA₂ cerca de 9 pontos percentuais acima da concorrência.
Por que isso importa além dos direitos de vaidade
A AIRA₂ superou o desempenho atual humano em 6 dos 20 tasks na avaliação AIRS-Bench. Ela também conquistou medalhas de ouro em tasks individuais do Kaggle, onde versões anteriores do agente não conseguiram obter nenhum prêmio.
O framework se baseia no que a equipe chama de abordagem AIRA-dojo, projetada especificamente para superar as limitações dos agentes anteriores. Essas limitações incluíam baixa capacidade computacional, superajuste na avaliação, lacunas de generalização entre diferentes tipos de problemas e restrições operacionais estáticas que impediam o agente de adaptar sua estratégia durante a tarefa.
O cenário competitivo de pesquisa em IA
A colaboração entre Meta FAIR, UCL e Oxford é notável por seu peso institucional. A equipe de pesquisa divulgou suas descobertas por meio de preprints do arXiv, o canal padrão para pesquisas de IA de ponta.
