一個用來測試模型能否解開謎題的代理基準,並不能說明當同一個代理在生產環境中使用真實資源時會發生什麼情況。在真空環境中的能力與在預算限制下的能力是完全不同的測試。 Agent Grand Prix 將每個問題與真實的 USDC 挂鉤,而非僅僅對照上下文視窗的代幣數量。實際資金會透過 Sigil,從錢包轉至財政庫,然後 Oracle 才會回答。一個提出廣泛且浪費性問題以縮小隱藏目標的代理,會在過程中消耗真實開支;而一個精準提問、每次提問都盡可能排除最多可能性的代理,則能在速度與成本上雙雙勝出。 這正是當今大多數代理部署所缺乏的紀律。一個連接到付費 API 但無成本意識的代理,會一整天樂此不疲地進行低效呼叫,因為它的推理過程從未將浪費的代價納入考量。AGP 從第一個問題起,就將這種定價機制強制融入代理的決策過程中。 排行榜數據讓這項權衡變得清晰可見:一位競賽者以 7 個問題在 71 秒內完成,另一位則耗盡 48 個問題仍未完成。同樣的任務,截然不同的結果,差異不在於智慧,而在於代理的策略是否考慮到每個問題都有其代價。@RialoHQ 建立了一場競賽,真正測試的技能是成本意識推理——這正是當前整個代理經濟體所嚴重缺乏的技能。


