Ang Perplexity AI ay naglalabas ng WANDR, isang benchmark na disenyo upang masukat kung gaano kahusay ang mga AI agent sa paghahandle ng mga kumplikadong, maraming-lapyar na mga gawain sa pag-aaral. Ang paglalabas na open-source ay nagbibigay sa mga developer at mananaliksik ng isang istandar na paraan upang masukat kung talagang kayang gawin ng kanilang mga sistema ng AI ang seryosong pagmamasid.
Ang WANDR, na nangangahulugan sa Wide and Nuanced Deep Research, ay binuo lalo na para sa mga gawain na “wide research” na tinatawag ng Perplexity, na nangangailangan ng malawak na paghahanap at malalim na pagsisiyasat, na tugma sa mga kakayahan ng Perplexity Computer.
Ano ang tunay na sinusukat ng WANDR
Ang benchmark ay disenyo upang magsalamin sa mga hihingin na workload na karaniwang makikita sa mga propesyonal na kapaligiran ng pananaliksik, na lumalampas sa simpleng pagtanong at pagbibigay ng sagot o pagbuo ng isang dokumento.
Ang Perplexity ay nagpapakita ng WANDR bilang evolusyon ng mga nakaraang framework para sa pag-e-evaluate tulad ng WideSearch, na nagpapakita ng paglipat patungo sa mas realistiko mga propesyonal na workload.
Ang benchmark ay dumating kasama ang “Search as Code” framework ng Perplexity, o SaC, na tumuturing sa mga query sa pag-aaral bilang programmable na workflow kaysa sa simpleng mga string ng paghahanap. Sa mga unang pagtataya noong June 1, 2026, ang implementasyon ng SaC ng Perplexity ay nakakuha ng 0.386 sa WANDR benchmark. Ang susunod na pinakamataas na marka ay 0.152, na nangangahulugan na ang sistema ng Perplexity ay lumampas sa kanyang pinakamalapit na kalaban ng isang factor na halos 2.5x.
Ang koneksyon ng Perplexity Computer
Konektado nang direkta ang WANDR sa Perplexity Computer, ang produkto ng AI agent ng kumpanya na nag-o-organisa ng maraming modelo upang harapin ang mga kumplikadong pananaliksik at mga gawain sa workflow. Ang benchmark ay nagsisilbing antas ng pagtataya para sa uri ng gawain na disenyo para sa Perplexity Computer.
Noong Pebrero 2026, binuksan ni Perplexity ang DRACO benchmark, isang iba pang kasangkapan sa pag-e-evaluate na nakatuon sa pagpapalawak ng kolektibong pag-unawa sa mga kakayahan ng AI. Sumusunod ang WANDR sa parehong pattern.
Tungkol sa Hulyo 11, 2026, nakamit ng Grok 4.5 ng xAI ang pinakamataas na puntos sa WANDR habang ginamit kasama ang Perplexity Computer, na nagpapakita na ang mga sistema mula sa ikatlong panig ay maaaring magperform nang mabuti sa benchmark.
