source avatarCyrilXBT

分享

您的用戶以40種不同方式詢問同樣的問題,而您卻讓LLM為每一個問題從頭開始回答。 「如何重設密碼?」 「忘記登入了,幫幫我」 「無法登入我的帳戶」 同一個答案。三次完整的模型調用。 普通快取無法捕捉這種情況,它僅在文字完全一致、逐字匹配時才有效。 語義快取則根據意義進行匹配。 當一個問題進入時,它會被轉換為嵌入向量,快取會檢查您是否已回答過意義足夠接近的問題。 命中?保存的答案會立即返回,無需調用LLM。 未命中?模型進行回答,並將該答案保存以供下次使用。 Redis 現已將此功能作為託管服務 LangCache 提供,無需額外部署資料庫,TTL 和淘汰機制均由系統自動處理。 他們聲稱快取命中速度可提升高達15倍,並大幅降低您的API費用。 但這裡有一個沒人提到的關鍵點: 相似度閾值才是這個系統失敗的關鍵。 設定得太寬鬆,「如何輪換我的API密鑰」可能會返回「如何撤銷我的API密鑰」的答案。 意義接近,但結果截然不同。 因此,請從嚴格設定開始。記錄一週內的所有命中情況,僅在確認答案確實可互換時才放寬限制。 您的節省取決於您的流量實際有多重複。支援機器人和內部文件助手將獲得巨大收益,而創意性或一次性查詢幾乎不會有影響。 在查看定價頁面之前,先檢查您的日誌。 關注 @cyrilXBT https://t.co/tQmQCsxVlo

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露