A Perplexity AI está lançando o WANDR, um benchmark projetado para avaliar o desempenho de agentes de IA em tarefas de pesquisa complexas e multicamadas. O lançamento de código aberto oferece a desenvolvedores e pesquisadores uma maneira padronizada de medir se seus sistemas de IA realmente conseguem realizar trabalhos investigativos sérios.
WANDR, que significa Wide and Nuanced Deep Research, foi desenvolvido especificamente para tarefas de “pesquisa ampla” chamadas pelo Perplexity, que exigem busca abrangente e investigação aprofundada, alinhadas às capacidades do Perplexity Computer.
O que o WANDR realmente mede
O benchmark foi projetado para replicar as cargas de trabalho exigentes normalmente encontradas em ambientes de pesquisa profissional, indo muito além de simples perguntas e respostas ou resumos de documentos únicos.
A Perplexity posiciona WANDR como uma evolução de frameworks anteriores de avaliação, como o WideSearch, refletindo uma mudança em direção a cargas de trabalho profissionais mais realistas.
O benchmark chega junto com o framework "Search as Code" da Perplexity, ou SaC, que trata consultas de pesquisa como fluxos de trabalho programáveis, em vez de strings de busca simples. Em avaliações preliminares em 1º de junho de 2026, a implementação SaC da Perplexity obteve 0,386 no benchmark WANDR. A próxima melhor pontuação foi 0,152, o que significa que o sistema da Perplexity superou seu concorrente mais próximo em cerca de 2,5 vezes.
A conexão do Perplexity Computer
O WANDR está diretamente ligado ao Perplexity Computer, o produto de agente de IA da empresa que orquestra múltiplos modelos para realizar tarefas complexas de pesquisa e fluxo de trabalho. O benchmark serve como camada de avaliação para o tipo de trabalho para o qual o Perplexity Computer foi projetado.
Em fevereiro de 2026, a Perplexity abriu o código do benchmark DRACO, outra ferramenta de avaliação voltada para avançar a compreensão coletiva das capacidades da IA. A WANDR segue o mesmo padrão.
Em 11 de julho de 2026, o Grok 4.5 da xAI alcançou as melhores pontuações no WANDR quando usado em conjunto com o Perplexity Computer, demonstrando que sistemas de terceiros podem se sair bem no benchmark.
