ChainThink, le 31 juillet, selon un communiqué officiel, MiniMax a lancé le modèle de génération multimodal H3, capable de comprendre simultanément le texte, les images, les vidéos et les sons, et de générer ou d'éditer des vidéos selon une instruction en langage naturel.
H3 prend en charge le regroupement de la migration d'actions, de références de personnages, de références sonores et de montage vidéo au sein d'une même tâche. Par exemple, l'utilisateur peut demander au modèle de s'inspirer du mouvement de caméra d'une vidéo, d'un personnage présent sur une autre image et du son d'une troisième piste audio.
Le modèle peut générer des vidéos d'une durée maximale de 15 secondes, avec une résolution 2K et un son stéréo natif. En ce qui concerne les tarifs de l'API officielle, le coût est de 0,13 $ par seconde pour la résolution 2K, soit environ 1,95 $ pour une vidéo de 15 secondes ;
768P coûte 0,09 USD par seconde. Une seule tâche peut inclure jusqu'à 9 images, 3 vidéos et 3 fichiers audio, pour un total maximum de 12 fichiers.
MiniMax prévoit de rendre les poids du modèle disponibles dans les prochains jours ; l'entreprise n'a pas encore publié d'évaluation unifiée comparant ce modèle à des modèles tels que Seedance ou Veo.
