Perplexity AI lance WANDR, un benchmark conçu pour évaluer la capacité des agents IA à gérer des tâches de recherche complexes et multicouches. La version open source offre aux développeurs et chercheurs un moyen standardisé de mesurer la capacité de leurs systèmes IA à effectuer véritablement un travail d'enquête sérieux.
WANDR, qui signifie Wide and Nuanced Deep Research, est spécifiquement conçu pour les tâches de « recherche large » telles que les définit Perplexity, nécessitant une recherche étendue et une investigation approfondie, en accord avec les capacités de Perplexity Computer.
Ce que mesure réellement WANDR
Le benchmark est conçu pour reproduire les charges de travail exigeantes typiquement rencontrées dans les environnements de recherche professionnelle, allant bien au-delà de la simple réponse à des questions ou de la synthèse de documents uniques.
Perplexity positionne WANDR comme une évolution des cadres d'évaluation précédents comme WideSearch, reflétant un passage vers des charges de travail professionnelles plus réalistes.
Le benchmark arrive en même temps que le cadre « Search as Code » (SaC) de Perplexity, qui traite les requêtes de recherche comme des workflows programmables plutôt que comme de simples chaînes de recherche. Lors des évaluations préliminaires du 1er juin 2026, la mise en œuvre SaC de Perplexity a obtenu un score de 0,386 sur le benchmark WANDR. Le meilleur score suivant était de 0,152, ce qui signifie que le système de Perplexity a surpassé son concurrent le plus proche d’un facteur d’environ 2,5 fois.
La connexion Perplexity Computer
WANDR est directement lié à Perplexity Computer, le produit d'agent IA de l'entreprise qui orchestre plusieurs modèles pour gérer des tâches complexes de recherche et de flux de travail. Le benchmark sert de couche d'évaluation pour le type de travail pour lequel Perplexity Computer est conçu.
En février 2026, Perplexity a open-sourcé le benchmark DRACO, un autre outil d'évaluation visant à approfondir la compréhension collective des capacités de l'IA. WANDR suit le même modèle.
Au 11 juillet 2026, Grok 4.5 de xAI a obtenu les meilleurs scores sur WANDR lorsqu'il est utilisé en conjonction avec Perplexity Computer, démontrant que les systèmes tiers peuvent bien performer sur ce benchmark.
