llama.cppの推測的プリフィルPRは、ターゲットモデルにプロンプトの15%を提示することで、長コンテキストTTFTを4.46倍速くすると報告している。8%では、テストが静かに事実を失い、IDを創造した。より速いコンテキストは選択的記憶になりつつある。誰がカットオフを決定するのか?
The Upsider²llama.cppの推測的プリフィルPRは、ターゲットモデルにプロンプトの15%を提示することで、長コンテキストTTFTを4.46倍速くすると報告している。8%では、テストが静かに事実を失い、IDを創造した。より速いコンテキストは選択的記憶になりつつある。誰がカットオフを決定するのか?