モデルがパズルを解けるかどうかを測るエージェントベンチマークは、その同じエージェントが本番環境で実際のリソースを消費した際に何が起こるかについて何も示さない。真空状態での能力と予算制約下での能力は、まったく異なるテストである。 Agent Grand Prixは、すべての質問を実際のUSDCと結びつける。コンテキストウィンドウに対するトークン数ではない。Sigilを通じてウォレットから財務へ実際にオンチェーンで移動する資金が、オラクルが回答する前に存在する。広範で無駄な質問を繰り返して隠されたポイントを絞り込むエージェントは、その過程で実際の支出を消費する。一方、各質問で可能な選択肢を最大限に排除するよう正確に質問するエージェントは、速度とコストの両方で勝つ。 これは、現在のほとんどのエージェント導入において欠けているディシプリンである。有料APIに接続され、支出の意識がないエージェントは、無駄な呼び出しを一日中繰り返し続ける。その推論プロセスには、無駄な行為のコストを評価する要素が一切含まれていないからだ。AGPは、最初の質問からエージェントの意思決定にそのコスト評価を組み込む。 リーダーボードのデータは、このトレードオフを明確に示す。あるレーサーは7回の質問で71秒で完了し、別のレーサーは48回の質問を消費しても完了できなかった。同じタスクでありながら、結果は大きく異なり、その差は知性ではなく、エージェントの戦略が「すべての質問にコストがある」という事実を考慮したかどうかにあった。@RialoHQは、実際にテストされるスキルがコスト認識型の推論である競技会を構築した。これは、現在の広範なエージェント経済が最も欠いているスキルそのものである。


