Agent değerlendirmelerinin gizli bir sorunu var: Değerlendirici kendisi güvenilir olmayabilir. Yeni bir deney, Jev’i GPT-5.6 Luna, Terra ve Claude Sonnet 4.6 ile test etti. Sonuçlar: → 500/500 ikili karar, insan oracle ile eşleşti → 92–913× daha düşük puan varyansı → 0,44 saniye ortalama gecikme → Her değerlendirme için $0,00035 maliyet Jev, bir paragraf üretip sonra bunu bir puana dönüştürmez. Doğrudan yapılandırılmış bir karar verir. Bu, agent değerlendirme ekonomisini değiştirebilir. Daha ucuz, daha hızlı değerlendirme araçları, takımların daha fazla izi değerlendirmesine, daha fazla regresyon kontrolü çalıştırmasına ve her agent güncellemesi etrafında geri bildirim döngüsünü sıkılaştırmalarına olanak tanır. Önemli uyarı: Bu, dar bir erken deneydi. Ancak yön oldukça ilginç: Güvenilir agentler, sadece daha iyi modeller değil, daha iyi değerlendirme araçları gerektirebilir.
Dami-DefiPaylaş
Kaynak:Orijinalini göster
Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir.
Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.