自主代理的真正考驗,不在於它能完成多少動作, 而在於當它失敗時會發生什麼。 @TheARCTERMINAL 表示,他在以太坊上運行了五個自主代理,涵蓋 27 種動作類型,並採用鏈上結算且無中央控制器。 這 27 種動作很有趣, 但失敗的路徑更有趣。 代理能否檢測到失敗? 能否安全地重試? 能否在一個錯誤步驟引發連鎖反應前停止? 其他代理能否在不繼承錯誤的情況下繼續運行? 記錄是否能讓失敗在事後變得顯而易見? 當一切運作順利時,自主性看起來令人印象深刻; 但可靠性,只在失敗時才顯現出來。 這正是我認為代理基準測試應包含恢復品質,而不僅僅是成功執行的原因。 AI 代理正從聊天介面,進入能改變外部狀態的系統。 在這個階段,優雅的失敗成為一項能力。 如果你正在評估一個自主代理,你會更關注成功率,還是恢復行為?


