Meta e Universidade de Illinois desenvolvem o EvoHarness-RL, aumentando a taxa de sucesso do agente de IA para 96,9%

iconCryptoBriefing
Compartilhar
AI summary iconResumo
Pesquisadores do Meta e da Universidade de Illinois desenvolveram o EvoHarness-RL, uma camada de execução autoevolutiva para agentes de IA. O sistema atingiu uma taxa de sucesso de 96,9% em um benchmark padrão, aumentando de 47,9% sem ele. O framework utiliza um estado externo estruturado de Crença, Progresso e Experiência (BPE) para lidar com tarefas complexas. Ele demonstra comportamentos emergentes, como recozimento por aparelhamento e evolução. Essa evolução pode impactar os esforços de CFT e melhorar a liquidez nos mercados de criptoativos.

Pesquisadores do Meta AI e da Universidade de Illinois em Urbana-Champaign publicaram um novo artigo apresentando o EvoHarness-RL, uma camada de coordenação treinável que permite que agentes de modelos de linguagem grandes criem, acessem e gerenciem seu próprio estado externo. O resultado: uma taxa de sucesso de 96,9% em um benchmark padrão, em comparação com 47,9% para o modelo de referência executado sem ele.

O que o EvoHarness-RL realmente faz

Agentes de LLM têm janelas de contexto limitadas. Quando uma tarefa se estende por muitos passos, envolvendo conexões dinâmicas de API, logs de servidor, submetas pendentes e recuperação de erros, a memória interna do modelo não é suficiente. Ele precisa de um suporte externo para rastrear o que acredita sobre o mundo, qual progresso já fez e o que aprendeu com erros passados.

O framework introduz um estado externo estruturado baseado em três componentes: Crença, Progresso e Experiência, coletivamente chamados de BPE. A Crença captura a compreensão atual do agente sobre seu ambiente. O Progresso rastreia submetas concluídas e pendentes para que o agente não pule etapas nem realize trabalho duplicado. A Experiência armazena lições aprendidas com erros, como uma base de dados que rejeita um lote devido a limites de taxa da API, permitindo que o agente adapte sua abordagem.

O treinamento ocorre em duas etapas. Primeiro, o ajuste supervisionado usando demonstrações de especialistas ensina ao modelo como interagir com o harness. Em seguida, uma técnica de otimização consciente de custo chamada Group Relative Policy Optimization, ou GRPO, aprimora o comportamento do agente para equilibrar o desempenho da tarefa com o custo computacional das chamadas ao harness.

Anúncio

Os pesquisadores testaram sua abordagem usando o modelo Qwen3-8B no ALFWorld, um benchmark para IA incorporada que exige que agentes completem tarefas domésticas em múltiplos passos. A taxa de sucesso de 96,9% em ambientes familiares é impressionante por si só, mas talvez mais significativa seja a taxa de sucesso de 86,6% em ambientes não vistos.

Dois comportamentos que os pesquisadores não programaram explicitamente

O artigo destaca dois fenômenos emergentes que surgiram durante o treinamento, nenhum dos quais foi diretamente projetado.

O primeiro é o “anealing de engate”. Conforme o tempo passa, o agente começa a internalizar operações de engate rotineiras, reduzindo a frequência com que precisa consultar o estado externo. As chamadas de engate diminuem não porque o sistema está se degradando, mas porque o modelo absorveu os padrões.

O segundo é “aproveitar a evolução”. À medida que o agente treina, ele aprende a comprimir e reestruturar seu estado externo em um formato mais compacto adequado para tipos específicos de tarefas. A representação BPE torna-se mais leve e mais especializada sem qualquer intervenção humana em seu design.

Construindo sobre trabalhos anteriores

EvoHarness-RL se baseia no Meta-Harness, um projeto anterior de março de 2026 que se concentrava em otimizar o código de harness por meio de técnicas de busca agente. Enquanto o Meta-Harness tratava o harness como código a ser aprimorado por busca, o EvoHarness-RL trata toda a camada de coordenação como algo que o modelo pode aprender a construir e refinar.

O artigo também relata melhorias em relação a frameworks de agentes existentes, como SkillOS e SkillRL, especialmente em tarefas não vistas. A diferença no desempenho entre ambientes familiares e novos é de aproximadamente 10 pontos percentuais para o EvoHarness-RL, em comparação com quedas muito maiores nas abordagens concorrentes.

O que isso significa para a implantação de IA empresarial

Uma taxa de sucesso que aumenta de aproximadamente 48% para 97% em ambientes controlados não é uma melhoria marginal. A taxa de generalização de 86,6% também importa, pois tarefas empresariais no mundo real raramente se parecem exatamente com os dados de treinamento.

A otimização consciente de custos incorporada à fase de treinamento GRPO também resolve uma preocupação prática. Chamadas externas de harness não são gratuitas. Elas consomem recursos de computação e adicionam latência. Ao treinar o agente para minimizar chamadas desnecessárias por meio do annealing de harness, o framework torna-se mais eficiente ao longo do tempo sem sacrificar a precisão.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.