source avatarDami-Defi

共有

エージェント評価には隠された問題がある: 評価者自体が信頼できない可能性がある。 新しい実験では、JevをGPT-5.6 Luna、Terra、Claude Sonnet 4.6と比較した。 結果: → 500/500の二値判断が人間のオラクルと一致 → スコアの分散が92–913倍低減 → 平均レイテンシ:0.44秒 → 1回の評価あたり$0.00035 Jevは段落を生成してからスコアに変換するのではなく、構造化された判断を直接行う。 これにより、エージェント評価の経済モデルが変わる可能性がある。 より安価で高速な評価者により、チームはより多くのトレースを評価し、より多くの回帰チェックを実行し、エージェントの更新ごとにフィードバックループをより密にできるようになる。 重要な注意点:これは狭範囲の初期実験である。 しかし、その方向性は非常に興味深い: 信頼できるエージェントには、より優れたモデルだけでなく、より優れた評価者が求められるかもしれない。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。