llama.cpp 的猜測性預填充 PR 顯示,透過向目標模型展示提示的 15%,使長上下文 TTFT 加快了 4.46 倍。在 8% 時,測試會默默遺失事實並虛構 ID。更快的上下文正變得像選擇性記憶。誰來設定閾值?