Perplexity AI Membuka Sumber WANDR Benchmark untuk Menilai Agen AI

iconCryptoBriefing
Kongsi
AI summary iconRingkasan
Perplexity AI telah membuka sumber WANDR, satu tolok ukur untuk menilai agen AI dalam tugas penyelidikan yang kompleks. Alat ini, yang selari dengan Perplexity Computer, mendapat skor 0.386 dalam ujian awal, melebihi yang lain. Sehingga 11 Julai 2026, Grok 4.5 milik xAI memimpin dalam WANDR apabila dipasangkan dengan Perplexity Computer. Pedagang yang menggunakan TA untuk analisis kripto dan minat terbuka mungkin mendapati perkembangan ini relevan untuk menilai alat penyelidikan yang digerakkan oleh AI.

Perplexity AI sedang melancarkan WANDR, satu tolok ukur yang direka untuk menilai sejauh mana agen AI dapat menangani tugas penyelidikan kompleks dan berlapis-lapis. Pelancaran sumber terbuka ini memberikan cara yang tersandardkan kepada pembangun dan penyelidik untuk mengukur sama ada sistem AI mereka benar-benar mampu melakukan kerja penyiasatan serius.

WANDR, yang berdiri untuk Wide and Nuanced Deep Research, dibina khusus untuk tugas "penyelidikan luas" yang dipanggil oleh Perplexity, yang memerlukan pencarian luas dan penyelidikan mendalam, selari dengan kemampuan Perplexity Computer.

Apa yang sebenarnya diukur oleh WANDR

Benchmark ini direka untuk meniru beban kerja yang menuntut biasanya ditemui dalam persekitaran penyelidikan profesional, melampaui sekadar soal-jawab atau ringkasan dokumen tunggal.

Iklan

Perplexity menempatkan WANDR sebagai evolusi kerangka kerja penilaian sebelumnya seperti WideSearch, mencerminkan peralihan kepada beban kerja profesional yang lebih realistik.

Pengukuran rujukan tiba bersama kerangka "Search as Code" Perplexity, atau SaC, yang memperlakukan soalan penyelidikan sebagai alur kerja yang boleh diprogramkan, bukan sekadar rentetan carian biasa. Dalam penilaian awal pada 1 Jun 2026, pelaksanaan SaC Perplexity mendapat skor 0.386 dalam pengukuran WANDR. Skor terbaik seterusnya ialah 0.152, bermakna sistem Perplexity mengungguli pesaing terdekatnya sebanyak kira-kira 2.5 kali.

Sambungan Perplexity Computer

WANDR secara langsung berkaitan dengan Perplexity Computer, produk agen AI syarikat yang mengkoordinasikan beberapa model untuk menangani tugas penyelidikan dan alur kerja yang kompleks. Ukuran piawai ini berfungsi sebagai lapisan penilaian untuk jenis kerja yang dirancang untuk dilakukan oleh Perplexity Computer.

Pada Februari 2026, Perplexity membuka sumber benchmark DRACO, alat penilaian lain yang bertujuan untuk memajukan pemahaman kolektif terhadap kemampuan AI. WANDR mengikuti pola yang sama.

Pada 11 Julai 2026, Grok 4.5 xAI mencapai skor tertinggi di WANDR apabila digunakan bersama Perplexity Computer, menunjukkan bahawa sistem pihak ketiga boleh berprestasi baik pada tolok ukur tersebut.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.