ChainThink mesajı, 31 Temmuz'da resmi açıklamaya göre, MiniMax, metin, resim, video ve sesi aynı anda anlayabilen ve bir doğal dil komutuna göre video oluşturabilen veya düzenleyebilen tam modlu üretim modeli H3'ü yayınladı.
H3, hareket geçişi, karakter referansı, ses referansı ve video düzenlemeyi aynı görev içinde birleştirmeyi destekler. Örneğin, kullanıcı modeli bir videonun kamera hareketine, başka bir resimdeki karaktere ve üçüncü bir ses kaydına referans vermesini sağlayabilir.
Bu model, en fazla 15 saniyelik videolar oluşturabilir ve 2K çözünürlüğü ile yerel stereo sesi destekler. Resmi API fiyatlarına göre 2K için saniye başına 0,13 dolar olup, 15 saniyelik bir video oluşturmak yaklaşık 1,95 dolar eder;
768P, saniyede 0,09 dolar. Tek bir görevde en fazla 9 resim, 3 video ve 3 ses dosyası girilebilir; toplam 12 dosyayı geçmemelidir.
MiniMax, önümüzdeki günlerde model ağırlıklarını açmayı planlıyor; resmi olarak Seedance, Veo ve diğer modellerle birlikte standartlaştırılmış bir değerlendirme yayınlamadı.
