Evaluasi agen memiliki masalah tersembunyi: Penilainya sendiri bisa tidak dapat diandalkan. Sebuah eksperimen baru menguji Jev melawan GPT-5.6 Luna, Terra, dan Claude Sonnet 4.6. Hasilnya: → 500/500 keputusan biner sesuai dengan oracle manusia → Variansi skor 92–913× lebih rendah → Latensi rata-rata 0,44 detik → $0,00035 per evaluasi Jev tidak menghasilkan paragraf lalu mengubahnya menjadi skor. Ia membuat keputusan terstruktur secara langsung. Ini bisa mengubah ekonomi evaluasi agen. Penilai yang lebih murah dan lebih cepat berarti tim dapat mengevaluasi lebih banyak jejak, menjalankan lebih banyak pemeriksaan regresi, dan memperketat loop umpan balik setiap pembaruan agen. Catatan penting: ini adalah eksperimen awal yang sempit. Namun arahnya sangat menarik: Agen yang andal mungkin memerlukan penilai yang lebih baik, bukan hanya model yang lebih baik.
Dami-DefiBagikan
Sumber:Tampilkan versi asli
Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini.
Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.