O agente de IA AIRA₂ supera modelos anteriores em 9 pontos percentuais no benchmark de ML

iconCryptoBriefing
Compartilhar
AI summary iconResumo
Notícias de IA + criptomoeda: AIRA₂, um agente autônomo de pesquisa de IA do laboratório FAIR da Meta, do University College London e da Universidade de Oxford, obteve 81,5% no benchmark MLE-bench-30 após 24 horas, subindo para 83,1% após 72 horas. Isso representa um aumento de 9 pontos percentuais em relação aos modelos anteriores. O AIRA₂ também ficou em 8º lugar em uma competição do Kaggle com 4.000 equipes, garantindo uma medalha de ouro. As atividades de notícias on-chain destacam a crescente integração de IA em campos baseados em dados.

Um agente de IA acabou de superar aproximadamente 3.992 equipes humanas no próprio jogo. AIRA₂, um agente de pesquisa de IA autônomo desenvolvido por pesquisadores do laboratório FAIR da Meta, do University College London e da Universidade de Oxford, ficou em 8º lugar entre 4.000 equipes em uma competição do Kaggle focada em raciocínio de IA, conquistando uma medalha de ouro no processo.

O que a AIRA realmente faz

A linha de agentes AIRA (o nome significa AI Research Agent) foi projetada para resolver autonomamente problemas complexos de engenharia de aprendizado de máquina. Em vez de apenas executar um único modelo e esperar pelo melhor resultado, a AIRA utiliza uma estratégia de execução assíncrona multi-GPU em 8 GPUs Nvidia H200.

Anúncio

O sistema emprega o que a equipe de pesquisa chama de protocolo de "Avaliação Oculta e Consistente", um método para impedir que o agente manipule seus próprios resultados de teste. O agente também utiliza operadores dinâmicos do estilo ReAct, o que significa que ele pode raciocinar passo a passo, ajustar sua abordagem em tempo real e executar código simultaneamente em vários processadores.

No MLE-bench-30, um benchmark estruturado construído a partir de 30 competições reais do Kaggle, o AIRA₂ alcançou uma classificação percentual média de 81,5% após 24 horas de computação. Ao fornecer 72 horas, esse número subiu para 83,1%. A melhor linha de base anterior de outros agentes estava em 72,7%, tornando a melhoria do AIRA₂ cerca de 9 pontos percentuais acima da concorrência.

Por que isso importa além dos direitos de vaidade

A AIRA₂ superou o desempenho atual humano em 6 dos 20 tasks na avaliação AIRS-Bench. Ela também conquistou medalhas de ouro em tasks individuais do Kaggle, onde versões anteriores do agente não conseguiram obter nenhum prêmio.

O framework se baseia no que a equipe chama de abordagem AIRA-dojo, projetada especificamente para superar as limitações dos agentes anteriores. Essas limitações incluíam baixa capacidade computacional, superajuste na avaliação, lacunas de generalização entre diferentes tipos de problemas e restrições operacionais estáticas que impediam o agente de adaptar sua estratégia durante a tarefa.

O cenário competitivo de pesquisa em IA

A colaboração entre Meta FAIR, UCL e Oxford é notável por seu peso institucional. A equipe de pesquisa divulgou suas descobertas por meio de preprints do arXiv, o canal padrão para pesquisas de IA de ponta.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.