ChainThink 消息,7 月 31 日,據官方消息,MiniMax 發布全模態生成模型 H3,可同時理解文字、圖片、影片和聲音,並根據一條自然語言指令生成或編輯影片。
H3 支持將動作遷移、人物參考、聲音參考和視頻編輯放入同一項任務。例如,用戶可讓模型參考一段視頻的鏡頭運動、另一張圖片中的人物,以及第三段音頻的聲音。
該模型最長可生成 15 秒視頻,支援 2K 分辨率和原生雙聲道聲音。官方 API 價格方面,2K 為每秒 0.13 美元,生成 15 秒視頻約 1.95 美元;
768P 為每秒 0.09 美元。單次任務最多可上傳 9 張圖片、3 段影片和 3 段音訊,總數不超過 12 個檔案。
MiniMax 計劃在未來幾天開放模型權重,官方尚未公佈其與 Seedance、Veo 等模型的統一評測。
