Perplexity AI, karmaşık, çok katmanlı araştırma görevlerini AI agenterinin ne kadar iyi yönettiğini değerlendirmek için WANDR adlı bir ölçütü yayınlıyor. Açık kaynaklı sürüm, geliştiricilere ve araştırmacılara AI sistemlerinin gerçekten ciddi bir soruşturma çalışması yapabilip yapamadığını ölçmek için standart bir yol sunuyor.
WANDR, Geniş ve Nüanslı Derin Araştırma anlamına gelir ve Perplexity'nin "geniş araştırma" olarak adlandırdığı, geniş arama ve derin inceleme gerektiren görevler için özellikle geliştirilmiştir; bu da Perplexity Computer'in yetenekleriyle uyumludur.
WANDR'in aslında neyi ölçtüğü
Benchmark, profesyonel araştırma ortamlarında genellikle bulunan talepli iş yüklerini yansıtmak üzere tasarlanmıştır ve basit soru-cevap veya tek belge özetleme işlemlerinin çok ötesindedir.
Perplexity, WANDR'ı WideSearch gibi daha önceki değerlendirme çerçevelerinin bir gelişimi olarak tanımlıyor ve daha gerçekçi profesyonel iş yüklerine doğru bir geçiş yansıtmaktadır.
Benchmark, Perplexity’nin “Arama Kod Olarak” (SaC) çerçevesiyle birlikte geliyor ve araştırmaya yönelik sorguları basit arama dizgeleri yerine programlanabilir iş akışları olarak ele alıyor. 1 Haziran 2026 tarihli ilk değerlendirmelerde, Perplexity’nin SaC uygulaması WANDR benchmark’ında 0,386 puan aldı. İkinci en iyi puan 0,152 idi, bu da Perplexity’nin sisteminin en yakın rakibini yaklaşık 2,5 kat daha iyi performansla geçtiğini gösteriyor.
Perplexity Bilgisayar bağlantısı
WANDR, şirketin çoklu modelleri orchestrating yaparak karmaşık araştırmalar ve iş akışı görevlerini yerine getiren AI ajan ürünü olan Perplexity Computer ile doğrudan ilişkilidir. Benchmark, Perplexity Computer'ın tasarlandığı iş türünün değerlendirme katmanını oluşturur.
Şubat 2026'da Perplexity, DRACO benchmark'ını açık kaynak hale getirdi ve bu, yapay zeka yetenekleri hakkındaki kolektif anlayışı geliştirmeyi hedefleyen başka bir değerlendirme aracıdır. WANDR aynı deseni takip eder.
11 Temmuz 2026 itibarıyla, xAI’nin Grok 4.5, Perplexity Computer ile birlikte kullanıldığında WANDR üzerinde en yüksek puanları elde etti ve üçüncü taraf sistemlerin bu performans ölçütünde iyi sonuçlar verebileceğini gösterdi.
