Perplexity AI Membuka Sumber WANDR Benchmark untuk Mengevaluasi Agen AI

iconCryptoBriefing
Bagikan
AI summary iconRingkasan
Perplexity AI telah melepaskan WANDR sebagai benchmark untuk mengevaluasi agen AI dalam tugas penelitian kompleks. Alat ini, yang selaras dengan Perplexity Computer, mendapatkan skor 0,386 dalam pengujian awal, mengungguli alat lainnya. Per 11 Juli 2026, Grok 4.5 dari xAI memimpin di WANDR ketika dipasangkan dengan Perplexity Computer. Pedagang yang menggunakan TA untuk analisis kripto dan open interest mungkin menemukan perkembangan ini relevan untuk menilai alat penelitian berbasis AI.

Perplexity AI akan merilis WANDR, sebuah tolok ukur yang dirancang untuk mengevaluasi seberapa baik agen AI menangani tugas penelitian kompleks dan berlapis-lapis. Rilis sumber terbuka ini memberikan cara standar bagi pengembang dan peneliti untuk mengukur apakah sistem AI mereka benar-benar mampu melakukan pekerjaan investigasi serius.

WANDR, yang merupakan singkatan dari Wide and Nuanced Deep Research, dirancang khusus untuk tugas "penelitian luas" yang menuntut pencarian luas dan investigasi mendalam, selaras dengan kemampuan Perplexity Computer.

Apa yang sebenarnya diukur oleh WANDR

Benchmark ini dirancang untuk mencerminkan beban kerja yang menuntut biasanya ditemukan di lingkungan penelitian profesional, melampaui sekadar pertanyaan-jawab atau ringkasan dokumen tunggal.

Iklan

Perplexity menempatkan WANDR sebagai evolusi dari kerangka evaluasi sebelumnya seperti WideSearch, mencerminkan pergeseran menuju beban kerja profesional yang lebih realistis.

Benchmark ini muncul bersama kerangka kerja "Search as Code" (SaC) dari Perplexity, yang memperlakukan permintaan penelitian sebagai alur kerja yang dapat diprogram, bukan sekadar string pencarian sederhana. Dalam evaluasi awal pada 1 Juni 2026, implementasi SaC dari Perplexity mendapat skor 0,386 pada benchmark WANDR. Skor terbaik berikutnya adalah 0,152, artinya sistem Perplexity unggul 2,5 kali lipat dibanding pesaing terdekatnya.

Koneksi Perplexity Computer

WANDR secara langsung terkait dengan Perplexity Computer, produk agen AI perusahaan yang mengoordinasikan beberapa model untuk menangani tugas penelitian dan alur kerja yang kompleks. Benchmark ini berfungsi sebagai lapisan evaluasi untuk jenis pekerjaan yang dirancang untuk dilakukan oleh Perplexity Computer.

Pada Februari 2026, Perplexity melepaskan DRACO benchmark sebagai alat evaluasi lain yang bertujuan memajukan pemahaman kolektif tentang kemampuan AI. WANDR mengikuti pola yang sama.

Pada 11 Juli 2026, Grok 4.5 dari xAI mencapai skor teratas di WANDR saat digunakan bersama Perplexity Computer, menunjukkan bahwa sistem pihak ketiga dapat berkinerja baik pada benchmark tersebut.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.