Perplexity AI відкриває вихідний код WANDR для оцінки AI-агентів

iconCryptoBriefing
Поділитися
AI summary iconКороткий зміст
Perplexity AI відкрила код WANDR — тестового набору для оцінки AI-агентів у складних дослідницьких завданнях. Інструмент, що працює разом з Perplexity Computer, показав результат 0,386 у ранніх тестах, перевершивши інші рішення. На 11 липня 2026 року xAI’s Grok 4.5 посідав перше місце на WANDR у поєднанні з Perplexity Computer. Трейдери, які використовують технічний аналіз для криптовалют та аналіз відкритого інтересу, можуть знайти цей розвиток корисним для оцінки AI-заснованих інструментів дослідження.

Perplexity AI випускає WANDR — тестовий набір, призначений для оцінки того, наскільки добре агенти ШІ впораються зі складними, багатошаровими дослідницькими завданнями. Відкрите випускання надає розробникам і дослідникам стандартизований спосіб вимірювання здатності їхніх систем ШІ виконувати серйозну розслідувальну роботу.

WANDR, що означає Wide and Nuanced Deep Research, створений спеціально для завдань «широкого дослідження», які вимагають широкого пошуку та глибокого розслідування, у відповідність з можливостями Perplexity Computer.

Що саме вимірює WANDR

Бенчмарк створений для імітації вимогливих завантажень, які зазвичай зустрічаються в професійних дослідницьких середовищах, і значно перевищує прості завдання відповіді на запитання або резюмування одного документа.

Реклама

Perplexity вважає WANDR еволюцією попередніх оціночних рамок, таких як WideSearch, що відображає зміну на більш реалістичні професійні навантаження.

Бенчмарк з’явився разом із рамкою «Пошук як код» (Search as Code, SaC) від Perplexity, яка розглядає дослідницькі запити як програмовані робочі процеси, а не прості пошукові рядки. У попередніх оцінках від 1 червня 2026 року реалізація SaC від Perplexity набрала 0,386 за бенчмарком WANDR. Найкращий наступний результат становив 0,152, що означає, що система Perplexity перевершила свого найближчого конкурента майже у 2,5 рази.

Підключення Perplexity Computer

WANDR безпосередньо пов’язаний з Perplexity Computer — продуктом AI-агенту компанії, який координує кілька моделей для вирішення складних завдань дослідження та робочих процесів. Бенчмарк слугує шаром оцінки для типу роботи, для якої призначена Perplexity Computer.

У лютому 2026 року Perplexity відкрила код бенчмарку DRACO — ще одного інструменту оцінки, спрямованого на поглиблення загального розуміння можливостей ШІ. WANDR дотримується тієї ж схеми.

На 11 липня 2026 року Grok 4.5 від xAI показав найвищі результати на WANDR у поєднанні з Perplexity Computer, що свідчить про те, що сторонні системи можуть добре впоратися з цим тестом.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.