將一個 33B 模型部署到 12GB GPU 上聽起來像是最困難的部分,但實際上,關鍵在於決定哪些地方可以妥協。 這正是 Apodex 1.1 在 MiniMax H3 上測試時最突出的發現。 測試需求不斷變化:一開始是速度與品質,接著音訊變為不可妥協,然後又交出現有設定進行審查。 結果也隨之改變:選擇修剪過的 Q4 而非完整的 Q4,不使用 TeaCache,SageAttention 僅在實際證明有用時才採用,而 8 秒影片的處理時間也從原本樂觀的 4–8 分鐘大幅調整為 8–15 分鐘。 有時,最有用的答案,是知道該放棄哪項優化。

