MiniMax、動画・画像・音声生成用のH3マルチモーダルモデルを発表

iconChainthink
共有
AI summary icon概要
オンチェーンデータによると、MiniMaxは2026年7月31日にH3マルチモーダルモデルをリリースし、自然言語を通じて動画、画像、音声の生成をサポートしています。このモデルは、モーション振替、キャラクター参照、動画編集を1ステップで処理できます。ステレオ音声付きの2K動画を1秒あたり0.13ドルで15秒生成可能です。MiniMaxはまもなくモデルの重みを公開する予定です。AI生成分野におけるフィアンドグリードインデックスは、新しいツールの登場により依然として高水準です。

ChainThinkのメッセージによると、7月31日、公式発表によりMiniMaxは、テキスト、画像、動画、音声を同時に理解し、自然言語の指示に基づいて動画を生成または編集できるマルチモーダル生成モデルH3をリリースしました。

H3は、アクションの移行、人物の参照、音声の参照、および動画編集を単一のタスクに統合できます。たとえば、ユーザーは、ある動画のカメラムーブメント、別の画像の人物、および別の音声ファイルの音声を参照してモデルに指示できます。

このモデルは最大15秒の動画を生成でき、2K解像度とネイティブステレオ音声をサポートしています。公式APIの料金では、2Kは1秒あたり0.13ドルで、15秒の動画を生成すると約1.95ドルです。

768Pは毎秒0.09ドルです。1回のタスクで最大9枚の画像、3本の動画、3つのオーディオファイルを入力でき、合計で12ファイルまでです。

MiniMaxは今後数日以内にモデルの重みを公開する予定ですが、SeedanceやVeoなどのモデルとの統一された評価はまだ公式に発表されていません。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。