ChainThinkのメッセージによると、7月31日、公式発表によりMiniMaxは、テキスト、画像、動画、音声を同時に理解し、自然言語の指示に基づいて動画を生成または編集できるマルチモーダル生成モデルH3をリリースしました。
H3は、アクションの移行、人物の参照、音声の参照、および動画編集を単一のタスクに統合できます。たとえば、ユーザーは、ある動画のカメラムーブメント、別の画像の人物、および別の音声ファイルの音声を参照してモデルに指示できます。
このモデルは最大15秒の動画を生成でき、2K解像度とネイティブステレオ音声をサポートしています。公式APIの料金では、2Kは1秒あたり0.13ドルで、15秒の動画を生成すると約1.95ドルです。
768Pは毎秒0.09ドルです。1回のタスクで最大9枚の画像、3本の動画、3つのオーディオファイルを入力でき、合計で12ファイルまでです。
MiniMaxは今後数日以内にモデルの重みを公開する予定ですが、SeedanceやVeoなどのモデルとの統一された評価はまだ公式に発表されていません。
