Las evaluaciones de agentes tienen un problema oculto: El juez mismo puede ser poco fiable. Un nuevo experimento comparó a Jev con GPT-5.6 Luna, Terra y Claude Sonnet 4.6. Los resultados: → 500/500 decisiones binarias coincidieron con el oráculo humano → varianza de puntuación 92–913 veces menor → latencia promedio de 0.44s → $0.00035 por evaluación Jev no genera un párrafo y luego lo convierte en una puntuación. Toma una decisión estructurada directamente. Esto podría cambiar la economía de la evaluación de agentes. Jueces más baratos y más rápidos permiten a los equipos evaluar más trazas, ejecutar más pruebas de regresión y acortar el bucle de retroalimentación en cada actualización del agente. La advertencia importante: este fue un experimento inicial y limitado. Pero la dirección es fascinante: Los agentes confiables pueden requerir jueces mejores, no solo modelos mejores.
Dami-DefiCompartir
Fuente:Mostrar original
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información.
Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.