IBMは、1つの「完璧な」プロンプトが、4つの地味なプロンプトに劣る理由を示した。 タスクは単純だった:欠けている食品アイテムを宅配ノートと一致させ、「まあ」のような意味のない理由を拒否し、クリーンなレポートを生成する。 1つの大規模なプロンプトは、エッジケースで常に失敗していた。モデルが小さすぎるからではなく、抽出・判断・比較・作成を同時に求められていたためだ。 そこでIBMはこれを4つのステップに分割した:抽出、検証、比較、生成。 同じモデル。同じデータ。各ステップで必要な知性は減った。すべての失敗が可視化され、修正可能になった。 これは多くのチームがエージェントについて誤解している点だ。利点は、20人のAIエージェントをグループチャットに集めることではない。1つのあいまいなタスクを、狭く、テスト可能な決定に分割することである。 より大きなモデルはデモを改善する。しかし、優れたワークフローだけが本番環境で生き残る。
