Perplexity AI выпускает WANDR — эталон, предназначенный для оценки того, насколько хорошо ИИ-агенты справляются со сложными многоуровневыми исследовательскими задачами. Открытый релиз предоставляет разработчикам и исследователям стандартизированный способ измерения способности их ИИ-систем выполнять серьезную исследовательскую работу.
WANDR, что означает Wide and Nuanced Deep Research, создан специально для задач, которые Perplexity называет «широкими исследованиями», требующих обширного поиска и глубокого анализа, в соответствии с возможностями Perplexity Computer.
Что на самом деле измеряет WANDR
Эталон предназначен для воспроизведения требовательных рабочих нагрузок, типичных для профессиональных исследовательских сред, и выходит далеко за рамки простого ответа на вопросы или суммирования одного документа.
Perplexity позиционирует WANDR как эволюцию предыдущих рамок оценки, таких как WideSearch, отражая сдвиг в сторону более реалистичных профессиональных рабочих нагрузок.
Эталонный тест появился вместе с рамкой Perplexity «Search as Code» (SaC), которая рассматривает исследовательские запросы как программируемые рабочие процессы, а не как простые поисковые строки. На предварительной оценке от 1 июня 2026 года реализация SaC от Perplexity показала результат 0,386 по эталону WANDR. Следующий лучший результат составил 0,152, что означает, что система Perplexity превзошла своего ближайшего конкурента примерно в 2,5 раза.
Подключение Perplexity Computer
WANDR напрямую связан с Perplexity Computer — продуктом AI-агента компании, который координирует несколько моделей для выполнения сложных задач исследования и рабочих процессов. Бенчмарк служит уровнем оценки для задач, для которых предназначена Perplexity Computer.
В феврале 2026 года Perplexity открыла исходный код бенчмарка DRACO — еще одного инструмента оценки, направленного на углубление коллективного понимания возможностей ИИ. WANDR следует той же модели.
По состоянию на 11 июля 2026 года Grok 4.5 от xAI показал наивысшие результаты на WANDR при использовании в сочетании с Perplexity Computer, продемонстрировав, что сторонние системы могут хорошо справляться с этим бенчмарком.
