自律エージェントの真の試練は、どれだけ多くのアクションを完了できるかではない。 それは、一つが失敗したときに何が起こるかだ。 @TheARCTERMINALは、Ethereum上で27種類のアクションを実行し、オンチェーン決済を行い、中央管理者なしで5つの自律エージェントを運用したという。 27のアクションは興味深い。 しかし、失敗時の経路の方がさらに興味深い。 エージェントは失敗を検出できるか? 安全に再試行できるか? 一つの悪いステップが連鎖する前に停止できるか? 他のエージェントはエラーを引き継がずに継続できるか? 記録は失敗を後から明確に示せるか? すべてがうまく機能しているとき、自律性は印象的に見える。 信頼性は、うまくいかないときに現れる。 だからこそ、私はエージェントのベンチマークに、成功した実行だけでなく、回復の質も含めることを望む。 AIエージェントは、チャットインターフェースから外部の状態を変更するシステムへと移行している。 その段階で、優雅な失敗こそが能力となる。 もし自律エージェントを評価するなら、成功率よりも回復行動のほうに注目するだろうか?


