source avatarDami-Defi

Compartilhar

As avaliações de agentes têm um problema oculto: O próprio julgador pode ser inconfiável. Um novo experimento testou o Jev contra o GPT-5.6 Luna, Terra e Claude Sonnet 4.6. Os resultados: → 500/500 decisões binárias coincidiram com o oráculo humano → variação de pontuação 92–913× menor → latência média de 0,44s → $0,00035 por avaliação O Jev não gera um parágrafo e depois o converte em uma pontuação. Ele toma uma decisão estruturada diretamente. Isso pode mudar a economia das avaliações de agentes. Julgadores mais baratos e mais rápidos permitem que equipes avaliem mais traços, executem mais verificações de regressão e apertem o ciclo de feedback em cada atualização de agente. A observação importante: este foi um experimento inicial e limitado. Mas a direção é fascinante: Agentes confiáveis podem exigir julgadores melhores, não apenas modelos melhores.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.