Her AI Mühendisi'nin Öğrenmesi Gereken 10 Ajan Değerlendirme Yöntemi

iconMetaEra
Paylaş
AI summary iconÖzet
MetaEra, AI mühendisleri için bir ajant performansını değerlendirmek üzere 10 temel değerlendirme yöntemini tanımlıyor. Bunlar arasında Golden Set, LLM as Judge, Rubric Scoring ve Trajectory Eval yer alıyor. OpenAI Evals ve DeepEval gibi araçlar öneriliyor. Çevrimdışı ve çevrimiçi testler, sistemin kararlılığını sağlıyor. Korku ve açgözlülük endeksi ve açık pozisyon, trader'ların piyasa duygusunu ve pozisyon değişimlerini izlemesi için önemli göstergelerdir.
Agent çalıştırmak sadece ilk adımdır.

Yazan: elune

Makale çevirisi, kaynak: ME News

Agent çalıştırmak sadece ilk adımdır.

Gerçekten zor olan, bunun kararlı olup olmadığını, doğru olup olmadığını veya bir ipucu veya model güncellemesi nedeniyle gizlice bozulup bozulmadığını belirlemektir.

Her AI mühendisi tarafından bilinmesi gereken 10 değerlendirme yöntemi.

1. Altın Seti | Golden Set

Sabit ve donmuş bir test durumu seti hazırlayın.

Her uyarı metni, model, araç veya iş akışı değişikliğinden sonra bu örnek setini yeniden çalıştırın ve sistemin gerçekten iyileşip iyileşmediğini veya bazı senaryolarda gizlice başarısız olup olmadığını belirleyin.

Bu, Agent değerlendirme sistemindeki en temel referans noktasıdır.

Önerilen Araç: OpenAI Evals

Tekrarlanabilir bir benchmark seti oluşturmak ve farklı modellerin veya sistem sürümlerinin performansını karşılaştırmak için kullanılabilir.

https://t.co/dr1GZlC75R

2. LLM Hakemi|LLM Hakem Olarak

Önceden yazılan değerlendirme kriterlerine göre, açık uçlu cevapları başka bir büyük dil modeliyle değerlendirin.

Görevin tek bir doğru cevabı yoksa ve doğru/yanlış kararı metin eşleştirme veya sabit çıktı ile verilemiyorsa, bu yöntem özellikle etkilidir.

Örneğin, bir yargı modeli, cevapların doğruluğunu, tamamlılığını, ilgililiğini ve kullanıcı taleplerine uyumunu değerlendirebilir.

Önerilen Araç: OpenEvals

LLM uygulamaları için hazır değerlendirme araçları sunarak otomatik değerlendirme süreçlerini hızlıca kurun.

https://t.co/S2yhnByFIP

3. Çok Boyutlu Puanlama | Rubric Scoring

Agent'e yalnızca genel bir "kalite puanı" vermeyin.

Ayrı ayrı değerlendirilmelidir:

  • Doğruluk
  • Bütünlük
  • İfade stili
  • Güvenlik
  • Yanıt süresi
  • İşlem maliyeti

Birleşik bir puan, gerçek sorunları gizleyebilir.

Örneğin, toplam puanın düşmesi, cevabın yanlış olmasından ziyade araç çağırma maliyetinin ani artışı olabilir; toplam puanın yükselmesi, güvenlik düzeyindeki düşüşe dayanıyor olabilir.

Önerilen Araç: DeepEval

Özel metrikler oluşturmayı ve farklı kalite boyutlarını bağımsız olarak puanlamayı destekler.

https://t.co/q9Z6Xmixia

4. İzleme Değerlendirmesi|Trajectory Eval

Agent'in sadece son verdiği yanıtı değil, görevi tamamlama sürecini de değerlendirin.

Şunları içerir:

  • Doğru aracı seçtiniz mi?
  • Araçlar mantıklı sırayla çağrılıyor mu?
  • Yanlış işlemi tekrarlamak geçersizdir
  • Gerekli adımlar eksik mi?
  • Araç sonuçlarına göre kararlar doğru şekilde ayarlandı mı

Ajan doğru sonuca ulaşabilir, ancak ara süreçler verimsiz, kırılgan veya riskli olabilir.

Önerilen Araç: AgentEvals

Agent'in tam yürütme yolundaki eylemlerini, kararlarını ve araç çağrılarını inceleyebilirsiniz.

https://t.co/0oziAl54az

5. Araç Birim Testleri

Ajanın kullandığı her bir araç için ayrı testler yazın.

Sabit girdiyi kullanarak sabit çıktıyı doğrulayın, modeli dahil etmeyin.

Soruyu parçalara ayırabilirsiniz:

Agent'in çıkarımında mı sorun var, yoksa alt katman araçlarında, arayüzlerde mi ya da MCP Sunucusu mu sorun yaşıyor?

Ajanın aracın doğru şekilde çağrılıp çağrılmadığını değerlendirmekten önce, aracın kendisinin güvenilir olduğundan emin olmak gerekir.

Önerilen Araç: MCP Inspector

MCP Sunucusu, araç parametreleri ve dönüş sonuçlarını kontrol etmek ve test etmek için kullanılabilir.

https://t.co/IVmt5qpWIN

6. Geri Dönüş Test Seti | Regression Suite

Geçmişteki gerçek çalışma örneklerini kaydedin ve her prompt, model veya araç seti güncellemesinden sonra tekrar çalıştırın.

Sonrasında yeni ve eski versiyon sonuçlarını karşılaştırarak kontrol edin:

  • Doğru olan görev başarısız mı oldu
  • Output format changed?
  • Araç çağrısı artırıldı mı
  • Gecikme ve maliyetler arttı mı
  • Bazı kenar durumlar bozuluyor mu

Yeni sürümün ortalama performansının daha iyi olması, eski yetenekleri bozmadığı anlamına gelmez.

Önerilen Araç: Promptfoo

Tekrarlanabilir değerlendirme paketlerini çalıştırmayı, regresyon sorunlarını tespit etmeyi ve kontrol süreçlerini CI'ye entegre etmeyi destekleyin.

https://t.co/zxi2PuWuhe

7. Üretim Ortamında A/B Testi | A/B Testing in Production

Gerçek kullanıcı trafiğini iki farklı versiyona rastgele dağıtarak, bunların gerçek ortamdaki performanslarını karşılaştırın.

Test edilebilir:

  • İki adet ipucu metni
  • İki model
  • İki Agent iş akışı
  • Farklı araç kombinasyonları
  • Farklı yanıt stratejileri

Daha yüksek ofline puanı, mutlaka daha yüksek kullanıcı başarı oranını getirmez.

Gerçek sonuçlar, örneğin görev tamamlama oranı, kullanıcı kabul oranı, dönüşüm oranı, insan müdahalesi oranı ve sorun çözme oranıdır.

Önerilen Araç: GrowthBook

İşlev açma/kapatma, kontrollü deneyler ve ürün analizi yetenekleri sağlar.

https://t.co/DGlE3JjDD3

8. İnsanlı denetim | Human Review

Düzenli örnekleme ile gerçek çalışma kayıtları insan denetçiler tarafından puanlanmaktadır.

Elle denetim, otomatik değerlendirme tarafından kaçırılan sorunları tespit edebilir ve LLM hakemlerini ayarlamak için kullanılabilir.

Önemli kontrol edilmesi gerekenler:

  • Model puanlaması insan yargılarıyla uyumlu mu
  • Puanlama kriterleri yeterince net mi
  • Yargı modeli uzun cevapları tercih ediyor mu?
  • Otomatik olarak ciddi hataların atlanıp atlanmadığı değerlendiriliyor

Otomatik değerlendirme, insan kararı tamamen yerine geçemez.

Önerilen Araç: Argilla

Yapay geri bildirim toplamak, model çıktılarını denetlemek ve sonuçları kaliteli bir veri setine dönüştürmek için ekip yardımcı olun.

https://t.co/QHWb7skWjr

9. Gölge Koşusu | Shadow Run

Aday sürümü gerçek trafiğe senkronize olarak çalıştırmak, ancak çıktısını kullanıcılara göstermemek.

Üretim ortamı hâlâ eski sürümü kullanıyor, yeni sürüm ise arka planda yalnızca ikisinin performansını karşılaştırmak için çalışıyor.

Bu yöntem, yüksek riskli güncellemeler için uygundur:

  • Temel modeli değiştirin
  • Yeniden yazma sistemi talimatı
  • Yeni dış araçlar bağlanıyor
  • Agent karar mantığını değiştir
  • Araç yetkilerini genişletin

Gölge çalıştırma, takıma resmi yayımdan önce gerçek trafiğdeki sorunları tespit etme imkanı tanırken kullanıcıları doğrudan etkilememesini sağlar.

Önerilen Araç: Langfuse

Üretim süreçlerini izleyin, aday sürümleri karşılaştırın ve değerlendirme sonuçlarını izleyin.

https://t.co/IrhDf38tRn

10. Kırmızı Takım Testi | Red Teaming

Sisteminize saldırmadan önce kendi sisteminize saldırmak.

Test kapsamı şunları içerir:

  • Kaçış saldırısı
  • Prompt injection
  • Hassas veri sızıntısı
  • Yetki atlatma
  • Araç kötüye kullanımı
  • Kötü niyetli dosya veya web içeriği
  • Beklenmeyen harici işlem

Veritabanına erişebilen, e-posta gönderebilen, dosyaları değiştirebilen, kod çalıştırabilen veya iç sistemlere erişebilen Agent'lar için kırmızı takım testleri özellikle önemlidir.

Önerilen Araç: Garak

LLM sistemindeki güvenlik açıklarını ve güvenli olmayan davranışları tarayabilir.

https://t.co/w8ObyW4ZKv

Offline evaluation tells you: the system works properly in the testing environment.

Çevrimiçi değerlendirme, sistemin başlatıldıktan sonra da sorunsuz çalıştığını gösteriyor.

Şu anda tüm 10 değerlendirme mekanizmasını aynı anda kurmanıza gerek olmayabilir.

Daha gerçekçi yaklaşım:

Son Agent arızasını gözden geçirin ve öncelikle bu arızayı önceden tespit edebilirdiğiniz iki değerlendirme yöntemini dağıtın.

Genellikle, altın test setini önce oluşturup, ardından regresyon testlerini veya el ile denetimi eklemek, birçok basit kaza önlenmesini sağlar.

Kaydetmeye değer.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.