エージェント評価には隠された問題がある: 評価者自体が信頼できない可能性がある。 新しい実験では、JevをGPT-5.6 Luna、Terra、Claude Sonnet 4.6と比較した。 結果: → 500/500の二値判断が人間のオラクルと一致 → スコアの分散が92–913倍低減 → 平均レイテンシ:0.44秒 → 1回の評価あたり$0.00035 Jevは段落を生成してからスコアに変換するのではなく、構造化された判断を直接行う。 これにより、エージェント評価の経済モデルが変わる可能性がある。 より安価で高速な評価者により、チームはより多くのトレースを評価し、より多くの回帰チェックを実行し、エージェントの更新ごとにフィードバックループをより密にできるようになる。 重要な注意点:これは狭範囲の初期実験である。 しかし、その方向性は非常に興味深い: 信頼できるエージェントには、より優れたモデルだけでなく、より優れた評価者が求められるかもしれない。

