IBM 剛剛展示了為何一個「完美」的提示詞輸給了四個單調的提示詞。 任務很簡單:將缺失的雜貨項目與快遞備註匹配,拒絕「還好」之類的無意義理由,並生成一份乾淨的報告。 一個大型提示詞在邊緣情況下反覆失敗,並非因為模型太小,而是它被要求同時進行提取、判斷、比較和撰寫。 因此,IBM 將其拆分為四個步驟:提取、驗證、比較和生成。 相同的模型,相同的資料,每個步驟所需的智能更少。每個失敗都變得可見且可修正。 這正是大多數團隊對代理(agents)的誤解:優勢不在於將 20 個 AI 角色放入群組聊天中,而在於將一個模糊的任務轉化為明確、可測試的決策。 更大的模型改善了演示效果,更好的工作流程才能在生產環境中生存。
