Perplexity AI 開源 WANDR 基準以評估 AI 代理

iconCryptoBriefing
分享
AI summary icon精華摘要
Perplexity AI 已開源 WANDR,這是一個用於評估 AI 代理在複雜研究任務中表現的基準工具。該工具與 Perplexity Computer 配合,在早期測試中得分為 0.386,表現優於其他工具。截至 2026 年 7 月 11 日,xAI 的 Grok 4.5 在與 Perplexity Computer 搭配使用時,在 WANDR 上領先。使用技術分析(TA)進行加密貨幣和未平倉合約分析的交易者,可能對此發展感興趣,以評估 AI 驅動的研究工具。

Perplexity AI 即將推出 WANDR,這是一項用於評估 AI 代理處理複雜、多層次研究任務能力的基準測試。此開源發佈為開發者和研究人員提供了一種標準化方法,以衡量其 AI 系統是否真正能夠從事深入的調查工作。

WANDR,代表廣泛且細緻的深度研究,專為 Perplexity 所稱的「廣泛研究」任務而設計,這些任務需要廣泛搜尋與深入調查,並與 Perplexity Computer 的功能相契合。

WANDR 實際衡量的內容

該基準旨在模擬專業研究環境中常見的高強度工作負載,遠超簡單的問答或單一文件摘要。

廣告

Perplexity 將 WANDR 視為早期評估框架(如 WideSearch)的演進,反映向更真實的專業工作負載轉變。

基準測試與 Perplexity 的「Search as Code」框架(簡稱 SaC)同步推出,該框架將研究查詢視為可程式化的工作流程,而非簡單的搜尋字串。在 2026 年 6 月 1 日的初步評估中,Perplexity 的 SaC 實作在 WANDR 基準測試中獲得 0.386 分,次佳分數為 0.152,意味著 Perplexity 的系統表現優於其最接近的競爭對手約 2.5 倍。

Perplexity Computer 連接

WANDR 直接與 Perplexity Computer 相關,這是該公司推出的 AI 代理產品,能夠協調多個模型來處理複雜的研究和工作流程任務。該基準測試作為評估 Perplexity Computer 所設計任務類型的評估層。

2026 年 2 月,Perplexity 開源了 DRACO 基準測試,這是一種旨在提升對 AI 能力集體認知的評估工具。WANDR 遵循相同的模式。

截至 2026 年 7 月 11 日,xAI 的 Grok 4.5 在與 Perplexity Computer 一起使用時,在 WANDR 上取得最高分,證明第三方系統在該基準測試中表現出色。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露