Agent boleh berjalan, tetapi itu hanya langkah pertama.Penulis artikel: elune
Artikel diterjemahkan, sumber: ME News
Agent boleh berjalan, tetapi itu hanya langkah pertama.
Yang benar-benar sukar ialah menilai: ia stabil atau tidak, betul atau tidak, atau sama ada ia secara perlahan menurun kerana satu petunjuk atau kemas kini model.
10 kaedah penilaian berikut, setiap jurutera AI patut memahami.
1. Golden Set
Sediakan satu set kes ujian yang tetap dan dibekukan.
Selepas setiap pengubahsuaian petunjuk, model, alat, atau aliran kerja, jalankan semula kes-kes ini untuk menilai sama ada sistem menjadi lebih baik atau gagal secara halus dalam beberapa senario.
Ia adalah garis dasar paling asas dalam sistem penilaian Agen.
Alat disarankan: OpenAI Evals
Digunakan untuk membina set ujian bersepadu yang boleh diulang dan membandingkan prestasi model atau versi sistem yang berbeza.
2. Hakim LLM|LLM sebagai Hakim
Menggunakan model bahasa besar lain, menilai jawapan terbuka berdasarkan kriteria penilaian yang telah ditulis sebelumnya.
Kaedah ini terutama berkesan apabila tugas tidak mempunyai jawapan standard unik, dan tidak dapat dinilai betul atau salah melalui pencocokan rentetan atau output tetap.
Sebagai contoh, model penilai boleh menilai sama ada jawapan itu tepat, lengkap, relevan, dan mematuhi kehendak pengguna.
Alat disarankan: OpenEvals
Menyediakan penilai siap pakai untuk aplikasi LLM untuk membina proses penilaian automatik dengan pantas.
3. Penilaian Berbilang Dimensi | Rubric Scoring
Jangan hanya memberikan Agent satu “skor kualiti” yang umum.
Perlu dinilai secara berasingan:
- Kebenaran
- Integriti
- Gaya ekspresi
- Keselamatan
- Response speed
- Kos panggilan
Satu skor komprehensif mungkin menutupi masalah sebenar.
Sebagai contoh, penurunan skor keseluruhan mungkin bukan disebabkan oleh jawapan yang salah, tetapi kerana kos pemanggilan alat meningkat secara tiba-tiba; peningkatan skor keseluruhan mungkin juga didasarkan pada penurunan keselamatan.
Alat disarankan: DeepEval
Menyokong penciptaan indikator tersuai dan pemberian skor bebas untuk dimensi kualiti yang berbeza.
4. Penilaian Trajektori|Trajectory Eval
Jangan hanya menilai jawapan akhir yang diberikan oleh Agen, tetapi juga proses keseluruhan yang dilaluinya untuk menyelesaikan tugas tersebut.
Termasuk:
- Adakah alat yang betul dipilih?
- Adakah alat dipanggil mengikut urutan yang munasabah?
- Adakah tindakan tidak berkesan diulang?
- Adakah langkah yang diperlukan dilupakan?
- Adakah keputusan disesuaikan dengan betul berdasarkan keputusan alat?
Agen mungkin akhirnya mendapat jawapan yang betul, tetapi proses pertengahan tidak efisien, rapuh, atau bahkan berisiko.
Alat yang disarankan: AgentEvals
Boleh semak tindakan, keputusan, dan panggilan alat agen dalam trajektori pelaksanaan penuh.
5. Ujian Unit Alat | Tool Unit Tests
Tulis ujian berasingan untuk setiap alat yang digunakan oleh Agent.
Gunakan input tetap, sahkan output tetap, jangan melibatkan model.
Dengan cara ini, masalah boleh dibahagikan:
Adakah masalahnya terletak pada penalaran Agent, atau pada alat, antaramuka, atau MCP Server asas?
Hanya dengan memastikan alat itu sendiri boleh dipercayai, ia bermakna untuk menilai sama ada Agent memanggil alat dengan betul.
Alat disarankan: MCP Inspector
Boleh digunakan untuk memeriksa dan menguji MCP Server, parameter alat, dan hasil balikan.
6. Set Ujian Regresi|Regression Suite
Simpan kes pengeluaran sebenar sebelumnya, dan jalankan semula setiap kali mengemas kini prompt, model, atau set alat.
Seterusnya bandingkan hasil versi baru dan lama, semak:
- Adakah tugas yang sepatutnya betul gagal
- Apakah format output berubah?
- Adakah panggilan alat ditambahkan?
- Adakah kelewatan dan kos meningkat
- Adakah kes-kes pinggir tertentu merosot
Versi baharu menunjukkan prestasi yang lebih baik secara purata, tetapi ini tidak bermakna ia tidak merosakkan kemampuan lama.
Alat disarankan: Promptfoo
Menyokong pelaksanaan set penilaian yang boleh diulang, menangkap isu regresi, dan mengintegrasikan proses pemeriksaan ke dalam CI.
7. Ujian A/B dalam persekitaran pengeluaran|A/B Testing in Production
Alokkan lalu lintas pengguna sebenar secara rawak kepada dua versi berbeza, dan bandingkan prestasi mereka dalam persekitaran sebenar.
Boleh uji:
- Dua set prompt
- Dua model
- Dua alur kerja Agent
- Kombinasi alat yang berbeza
- Strategi balasan yang berbeza
Versi dengan penilaian luar talian yang lebih tinggi tidak semestinya membawa kepada kejayaan pengguna yang lebih tinggi.
Yang benar-benar penting adalah hasil sebenarnya, seperti kadar penyelesaian tugas, kadar penerimaan pengguna, kadar konversi, kadar pengambilalihan manusia, dan kadar penyelesaian masalah.
Alat yang disarankan: GrowthBook
Menyediakan fungsi suis, eksperimen terkawal, dan kemampuan analisis produk.
8. Semakan manual|Human Review
Sampel berkala rekod operasi sebenar akan dinilai oleh pemeriksa manusia.
Pemeriksaan manual tidak hanya boleh mengesan isu yang terlepas daripada penilaian automatik, tetapi juga boleh digunakan untuk menyesuaikan penghakim LLM.
Perlu diperiksa dengan teliti:
- Adakah penilaian model sejajar dengan penilaian manusia
- Apakah kriteria penilaian cukup jelas
- Adakah model penilai cenderung kepada jawapan yang panjang?
- Menilai automatik sama ada terdapat kesalahan serius yang terlepas
Penilaian automatik tidak boleh menggantikan penilaian manusia sepenuhnya.
Alat disarankan: Argilla
Bantu pasukan mengumpul maklum balas manual, mengesahkan output model, dan menerbitkan hasil sebagai set data berkualiti tinggi.
9. Shadow Run
Jalankan versi kandidat secara serentak pada trafik sebenar, tetapi jangan paparkan outputnya kepada pengguna.
Lingkungan pengeluaran masih menggunakan versi lama, manakala versi baharu hanya dijalankan di latar belakang untuk membandingkan prestasi kedua-duanya.
Cara ini sesuai untuk kemas kini berisiko tinggi, contohnya:
- Tukar model utama
- Rewrite system prompt
- Menghubungkan alat luar baru
- Ubah logik pengambilan keputusan Agent
- Perluaskan kuasa alat
Shadow running membantu pasukan mengenal pasti masalah dalam trafik sebenar sebelum pelancaran rasmi, sambil mengelakkan kesan langsung terhadap pengguna.
Alat disarankan: Langfuse
Lacak operasi penghasilan, bandingkan versi kandidat, dan pantau hasil penilaian.
10. Ujian Pasukan Merah | Red Teaming
Serang sistem anda sendiri sebelum penyerang melakukannya.
Ruang ujian termasuk:
- Jailbreak attack
- Prompt injection
- Bocoran data sensitif
- Bypass kuasa
- Penyalahgunaan alat
- Fail atau kandungan laman web jahat
- Operasi luar yang tidak dijangka
Ujian tim merah sangat penting untuk Agent yang mampu memanggil pangkalan data, menghantar e-mel, mengubah fail, menjalankan kod, atau mengakses sistem dalaman.
Alat disarankan: Garak
Boleh memindai kelemahan keselamatan dan tingkah laku tidak selamat dalam sistem LLM.
Penilaian luar talian memberitahu anda: sistem berfungsi dengan baik dalam persekitaran ujian.
Penilaian dalam talian memberitahu anda: sistem akan terus berfungsi dengan baik selepas dilancarkan.
Anda mungkin tidak perlu membina kesemua 10 mekanisme penilaian sekaligus sekarang.
Pendekatan yang lebih praktikal ialah:
Tinjau kegagalan Agent terkini, kemudian utamakan pelaksanaan dua kaedah penilaian yang sepatutnya dapat mengesan masalah tersebut lebih awal.
Membina set ujian emas terlebih dahulu, kemudian menambahkan ujian regresi atau pemeriksaan manual, seringkali dapat mengelakkan banyak kejadian rendah.
Patut disimpan.
