Perplexity AI випускає WANDR — тестовий набір, призначений для оцінки того, наскільки добре агенти ШІ впораються зі складними, багатошаровими дослідницькими завданнями. Відкрите випускання надає розробникам і дослідникам стандартизований спосіб вимірювання здатності їхніх систем ШІ виконувати серйозну розслідувальну роботу.
WANDR, що означає Wide and Nuanced Deep Research, створений спеціально для завдань «широкого дослідження», які вимагають широкого пошуку та глибокого розслідування, у відповідність з можливостями Perplexity Computer.
Що саме вимірює WANDR
Бенчмарк створений для імітації вимогливих завантажень, які зазвичай зустрічаються в професійних дослідницьких середовищах, і значно перевищує прості завдання відповіді на запитання або резюмування одного документа.
Perplexity вважає WANDR еволюцією попередніх оціночних рамок, таких як WideSearch, що відображає зміну на більш реалістичні професійні навантаження.
Бенчмарк з’явився разом із рамкою «Пошук як код» (Search as Code, SaC) від Perplexity, яка розглядає дослідницькі запити як програмовані робочі процеси, а не прості пошукові рядки. У попередніх оцінках від 1 червня 2026 року реалізація SaC від Perplexity набрала 0,386 за бенчмарком WANDR. Найкращий наступний результат становив 0,152, що означає, що система Perplexity перевершила свого найближчого конкурента майже у 2,5 рази.
Підключення Perplexity Computer
WANDR безпосередньо пов’язаний з Perplexity Computer — продуктом AI-агенту компанії, який координує кілька моделей для вирішення складних завдань дослідження та робочих процесів. Бенчмарк слугує шаром оцінки для типу роботи, для якої призначена Perplexity Computer.
У лютому 2026 року Perplexity відкрила код бенчмарку DRACO — ще одного інструменту оцінки, спрямованого на поглиблення загального розуміння можливостей ШІ. WANDR дотримується тієї ж схеми.
На 11 липня 2026 року Grok 4.5 від xAI показав найвищі результати на WANDR у поєднанні з Perplexity Computer, що свідчить про те, що сторонні системи можуть добре впоратися з цим тестом.
