Perplexity AI sedang melancarkan WANDR, satu tolok ukur yang direka untuk menilai sejauh mana agen AI dapat menangani tugas penyelidikan kompleks dan berlapis-lapis. Pelancaran sumber terbuka ini memberikan cara yang tersandardkan kepada pembangun dan penyelidik untuk mengukur sama ada sistem AI mereka benar-benar mampu melakukan kerja penyiasatan serius.
WANDR, yang berdiri untuk Wide and Nuanced Deep Research, dibina khusus untuk tugas "penyelidikan luas" yang dipanggil oleh Perplexity, yang memerlukan pencarian luas dan penyelidikan mendalam, selari dengan kemampuan Perplexity Computer.
Apa yang sebenarnya diukur oleh WANDR
Benchmark ini direka untuk meniru beban kerja yang menuntut biasanya ditemui dalam persekitaran penyelidikan profesional, melampaui sekadar soal-jawab atau ringkasan dokumen tunggal.
Perplexity menempatkan WANDR sebagai evolusi kerangka kerja penilaian sebelumnya seperti WideSearch, mencerminkan peralihan kepada beban kerja profesional yang lebih realistik.
Pengukuran rujukan tiba bersama kerangka "Search as Code" Perplexity, atau SaC, yang memperlakukan soalan penyelidikan sebagai alur kerja yang boleh diprogramkan, bukan sekadar rentetan carian biasa. Dalam penilaian awal pada 1 Jun 2026, pelaksanaan SaC Perplexity mendapat skor 0.386 dalam pengukuran WANDR. Skor terbaik seterusnya ialah 0.152, bermakna sistem Perplexity mengungguli pesaing terdekatnya sebanyak kira-kira 2.5 kali.
Sambungan Perplexity Computer
WANDR secara langsung berkaitan dengan Perplexity Computer, produk agen AI syarikat yang mengkoordinasikan beberapa model untuk menangani tugas penyelidikan dan alur kerja yang kompleks. Ukuran piawai ini berfungsi sebagai lapisan penilaian untuk jenis kerja yang dirancang untuk dilakukan oleh Perplexity Computer.
Pada Februari 2026, Perplexity membuka sumber benchmark DRACO, alat penilaian lain yang bertujuan untuk memajukan pemahaman kolektif terhadap kemampuan AI. WANDR mengikuti pola yang sama.
Pada 11 Julai 2026, Grok 4.5 xAI mencapai skor tertinggi di WANDR apabila digunakan bersama Perplexity Computer, menunjukkan bahawa sistem pihak ketiga boleh berprestasi baik pada tolok ukur tersebut.
