一個用於開放推論的 NUMA 鏡像 PR 在 5×3090 上報告預填充為 128.6 tok/s、解碼為 18.2 tok/s——而當暫存記憶體失去局部性時,則為 125.1/11.5。下一場 AI 成本之戰,可能將在記憶體拓撲而非模型權重上決出勝負。同意嗎?
The Upsider²一個用於開放推論的 NUMA 鏡像 PR 在 5×3090 上報告預填充為 128.6 tok/s、解碼為 18.2 tok/s——而當暫存記憶體失去局部性時,則為 125.1/11.5。下一場 AI 成本之戰,可能將在記憶體拓撲而非模型權重上決出勝負。同意嗎?