您的用戶以40種不同方式詢問同樣的問題,而您卻讓LLM為每一個問題從頭開始回答。 「如何重設密碼?」 「忘記登入了,幫幫我」 「無法登入我的帳戶」 同一個答案。三次完整的模型調用。 普通快取無法捕捉這種情況,它僅在文字完全一致、逐字匹配時才有效。 語義快取則根據意義進行匹配。 當一個問題進入時,它會被轉換為嵌入向量,快取會檢查您是否已回答過意義足夠接近的問題。 命中?保存的答案會立即返回,無需調用LLM。 未命中?模型進行回答,並將該答案保存以供下次使用。 Redis 現已將此功能作為託管服務 LangCache 提供,無需額外部署資料庫,TTL 和淘汰機制均由系統自動處理。 他們聲稱快取命中速度可提升高達15倍,並大幅降低您的API費用。 但這裡有一個沒人提到的關鍵點: 相似度閾值才是這個系統失敗的關鍵。 設定得太寬鬆,「如何輪換我的API密鑰」可能會返回「如何撤銷我的API密鑰」的答案。 意義接近,但結果截然不同。 因此,請從嚴格設定開始。記錄一週內的所有命中情況,僅在確認答案確實可互換時才放寬限制。 您的節省取決於您的流量實際有多重複。支援機器人和內部文件助手將獲得巨大收益,而創意性或一次性查詢幾乎不會有影響。 在查看定價頁面之前,先檢查您的日誌。 關注 @cyrilXBT https://t.co/tQmQCsxVlo


