source avatarDami-Defi

Partager

Les évaluations d'agents présentent un problème caché : Le juge lui-même peut être peu fiable. Une nouvelle expérience a testé Jev contre GPT-5.6 Luna, Terra et Claude Sonnet 4.6. Les résultats : → 500/500 décisions binaires correspondaient à l'oracle humain → Variance du score réduite de 92 à 913 fois → Latence moyenne de 0,44 s → Coût de 0,00035 $ par évaluation Jev ne génère pas un paragraphe puis ne le transforme pas en note. Il prend une décision structurée directement. Cela pourrait modifier l'économie de l'évaluation d'agents. Des juges moins chers et plus rapides permettent aux équipes d'évaluer davantage de traces, d'exécuter plus de vérifications de régression et de resserrer la boucle de rétroaction autour de chaque mise à jour d'agent. La précision importante : il s'agissait d'une expérience initiale et limitée. Mais la direction est fascinante : Des agents fiables peuvent nécessiter de meilleurs juges, et non seulement de meilleurs modèles.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.