Agent çalıştırmak sadece ilk adımdır.Yazan: elune
Makale çevirisi, kaynak: ME News
Agent çalıştırmak sadece ilk adımdır.
Gerçekten zor olan, bunun kararlı olup olmadığını, doğru olup olmadığını veya bir ipucu veya model güncellemesi nedeniyle gizlice bozulup bozulmadığını belirlemektir.
Her AI mühendisi tarafından bilinmesi gereken 10 değerlendirme yöntemi.
1. Altın Seti | Golden Set
Sabit ve donmuş bir test durumu seti hazırlayın.
Her uyarı metni, model, araç veya iş akışı değişikliğinden sonra bu örnek setini yeniden çalıştırın ve sistemin gerçekten iyileşip iyileşmediğini veya bazı senaryolarda gizlice başarısız olup olmadığını belirleyin.
Bu, Agent değerlendirme sistemindeki en temel referans noktasıdır.
Önerilen Araç: OpenAI Evals
Tekrarlanabilir bir benchmark seti oluşturmak ve farklı modellerin veya sistem sürümlerinin performansını karşılaştırmak için kullanılabilir.
2. LLM Hakemi|LLM Hakem Olarak
Önceden yazılan değerlendirme kriterlerine göre, açık uçlu cevapları başka bir büyük dil modeliyle değerlendirin.
Görevin tek bir doğru cevabı yoksa ve doğru/yanlış kararı metin eşleştirme veya sabit çıktı ile verilemiyorsa, bu yöntem özellikle etkilidir.
Örneğin, bir yargı modeli, cevapların doğruluğunu, tamamlılığını, ilgililiğini ve kullanıcı taleplerine uyumunu değerlendirebilir.
Önerilen Araç: OpenEvals
LLM uygulamaları için hazır değerlendirme araçları sunarak otomatik değerlendirme süreçlerini hızlıca kurun.
3. Çok Boyutlu Puanlama | Rubric Scoring
Agent'e yalnızca genel bir "kalite puanı" vermeyin.
Ayrı ayrı değerlendirilmelidir:
- Doğruluk
- Bütünlük
- İfade stili
- Güvenlik
- Yanıt süresi
- İşlem maliyeti
Birleşik bir puan, gerçek sorunları gizleyebilir.
Örneğin, toplam puanın düşmesi, cevabın yanlış olmasından ziyade araç çağırma maliyetinin ani artışı olabilir; toplam puanın yükselmesi, güvenlik düzeyindeki düşüşe dayanıyor olabilir.
Önerilen Araç: DeepEval
Özel metrikler oluşturmayı ve farklı kalite boyutlarını bağımsız olarak puanlamayı destekler.
4. İzleme Değerlendirmesi|Trajectory Eval
Agent'in sadece son verdiği yanıtı değil, görevi tamamlama sürecini de değerlendirin.
Şunları içerir:
- Doğru aracı seçtiniz mi?
- Araçlar mantıklı sırayla çağrılıyor mu?
- Yanlış işlemi tekrarlamak geçersizdir
- Gerekli adımlar eksik mi?
- Araç sonuçlarına göre kararlar doğru şekilde ayarlandı mı
Ajan doğru sonuca ulaşabilir, ancak ara süreçler verimsiz, kırılgan veya riskli olabilir.
Önerilen Araç: AgentEvals
Agent'in tam yürütme yolundaki eylemlerini, kararlarını ve araç çağrılarını inceleyebilirsiniz.
5. Araç Birim Testleri
Ajanın kullandığı her bir araç için ayrı testler yazın.
Sabit girdiyi kullanarak sabit çıktıyı doğrulayın, modeli dahil etmeyin.
Soruyu parçalara ayırabilirsiniz:
Agent'in çıkarımında mı sorun var, yoksa alt katman araçlarında, arayüzlerde mi ya da MCP Sunucusu mu sorun yaşıyor?
Ajanın aracın doğru şekilde çağrılıp çağrılmadığını değerlendirmekten önce, aracın kendisinin güvenilir olduğundan emin olmak gerekir.
Önerilen Araç: MCP Inspector
MCP Sunucusu, araç parametreleri ve dönüş sonuçlarını kontrol etmek ve test etmek için kullanılabilir.
6. Geri Dönüş Test Seti | Regression Suite
Geçmişteki gerçek çalışma örneklerini kaydedin ve her prompt, model veya araç seti güncellemesinden sonra tekrar çalıştırın.
Sonrasında yeni ve eski versiyon sonuçlarını karşılaştırarak kontrol edin:
- Doğru olan görev başarısız mı oldu
- Output format changed?
- Araç çağrısı artırıldı mı
- Gecikme ve maliyetler arttı mı
- Bazı kenar durumlar bozuluyor mu
Yeni sürümün ortalama performansının daha iyi olması, eski yetenekleri bozmadığı anlamına gelmez.
Önerilen Araç: Promptfoo
Tekrarlanabilir değerlendirme paketlerini çalıştırmayı, regresyon sorunlarını tespit etmeyi ve kontrol süreçlerini CI'ye entegre etmeyi destekleyin.
7. Üretim Ortamında A/B Testi | A/B Testing in Production
Gerçek kullanıcı trafiğini iki farklı versiyona rastgele dağıtarak, bunların gerçek ortamdaki performanslarını karşılaştırın.
Test edilebilir:
- İki adet ipucu metni
- İki model
- İki Agent iş akışı
- Farklı araç kombinasyonları
- Farklı yanıt stratejileri
Daha yüksek ofline puanı, mutlaka daha yüksek kullanıcı başarı oranını getirmez.
Gerçek sonuçlar, örneğin görev tamamlama oranı, kullanıcı kabul oranı, dönüşüm oranı, insan müdahalesi oranı ve sorun çözme oranıdır.
Önerilen Araç: GrowthBook
İşlev açma/kapatma, kontrollü deneyler ve ürün analizi yetenekleri sağlar.
8. İnsanlı denetim | Human Review
Düzenli örnekleme ile gerçek çalışma kayıtları insan denetçiler tarafından puanlanmaktadır.
Elle denetim, otomatik değerlendirme tarafından kaçırılan sorunları tespit edebilir ve LLM hakemlerini ayarlamak için kullanılabilir.
Önemli kontrol edilmesi gerekenler:
- Model puanlaması insan yargılarıyla uyumlu mu
- Puanlama kriterleri yeterince net mi
- Yargı modeli uzun cevapları tercih ediyor mu?
- Otomatik olarak ciddi hataların atlanıp atlanmadığı değerlendiriliyor
Otomatik değerlendirme, insan kararı tamamen yerine geçemez.
Önerilen Araç: Argilla
Yapay geri bildirim toplamak, model çıktılarını denetlemek ve sonuçları kaliteli bir veri setine dönüştürmek için ekip yardımcı olun.
9. Gölge Koşusu | Shadow Run
Aday sürümü gerçek trafiğe senkronize olarak çalıştırmak, ancak çıktısını kullanıcılara göstermemek.
Üretim ortamı hâlâ eski sürümü kullanıyor, yeni sürüm ise arka planda yalnızca ikisinin performansını karşılaştırmak için çalışıyor.
Bu yöntem, yüksek riskli güncellemeler için uygundur:
- Temel modeli değiştirin
- Yeniden yazma sistemi talimatı
- Yeni dış araçlar bağlanıyor
- Agent karar mantığını değiştir
- Araç yetkilerini genişletin
Gölge çalıştırma, takıma resmi yayımdan önce gerçek trafiğdeki sorunları tespit etme imkanı tanırken kullanıcıları doğrudan etkilememesini sağlar.
Önerilen Araç: Langfuse
Üretim süreçlerini izleyin, aday sürümleri karşılaştırın ve değerlendirme sonuçlarını izleyin.
10. Kırmızı Takım Testi | Red Teaming
Sisteminize saldırmadan önce kendi sisteminize saldırmak.
Test kapsamı şunları içerir:
- Kaçış saldırısı
- Prompt injection
- Hassas veri sızıntısı
- Yetki atlatma
- Araç kötüye kullanımı
- Kötü niyetli dosya veya web içeriği
- Beklenmeyen harici işlem
Veritabanına erişebilen, e-posta gönderebilen, dosyaları değiştirebilen, kod çalıştırabilen veya iç sistemlere erişebilen Agent'lar için kırmızı takım testleri özellikle önemlidir.
Önerilen Araç: Garak
LLM sistemindeki güvenlik açıklarını ve güvenli olmayan davranışları tarayabilir.
Offline evaluation tells you: the system works properly in the testing environment.
Çevrimiçi değerlendirme, sistemin başlatıldıktan sonra da sorunsuz çalıştığını gösteriyor.
Şu anda tüm 10 değerlendirme mekanizmasını aynı anda kurmanıza gerek olmayabilir.
Daha gerçekçi yaklaşım:
Son Agent arızasını gözden geçirin ve öncelikle bu arızayı önceden tespit edebilirdiğiniz iki değerlendirme yöntemini dağıtın.
Genellikle, altın test setini önce oluşturup, ardından regresyon testlerini veya el ile denetimi eklemek, birçok basit kaza önlenmesini sağlar.
Kaydetmeye değer.
