Perplexity AI 即將推出 WANDR,這是一項用於評估 AI 代理處理複雜、多層次研究任務能力的基準測試。此開源發佈為開發者和研究人員提供了一種標準化方法,以衡量其 AI 系統是否真正能夠從事深入的調查工作。
WANDR,代表廣泛且細緻的深度研究,專為 Perplexity 所稱的「廣泛研究」任務而設計,這些任務需要廣泛搜尋與深入調查,並與 Perplexity Computer 的功能相契合。
WANDR 實際衡量的內容
該基準旨在模擬專業研究環境中常見的高強度工作負載,遠超簡單的問答或單一文件摘要。
Perplexity 將 WANDR 視為早期評估框架(如 WideSearch)的演進,反映向更真實的專業工作負載轉變。
基準測試與 Perplexity 的「Search as Code」框架(簡稱 SaC)同步推出,該框架將研究查詢視為可程式化的工作流程,而非簡單的搜尋字串。在 2026 年 6 月 1 日的初步評估中,Perplexity 的 SaC 實作在 WANDR 基準測試中獲得 0.386 分,次佳分數為 0.152,意味著 Perplexity 的系統表現優於其最接近的競爭對手約 2.5 倍。
Perplexity Computer 連接
WANDR 直接與 Perplexity Computer 相關,這是該公司推出的 AI 代理產品,能夠協調多個模型來處理複雜的研究和工作流程任務。該基準測試作為評估 Perplexity Computer 所設計任務類型的評估層。
2026 年 2 月,Perplexity 開源了 DRACO 基準測試,這是一種旨在提升對 AI 能力集體認知的評估工具。WANDR 遵循相同的模式。
截至 2026 年 7 月 11 日,xAI 的 Grok 4.5 在與 Perplexity Computer 一起使用時,在 WANDR 上取得最高分,證明第三方系統在該基準測試中表現出色。
