ChainThink melaporkan, pada 31 Julai, menurut pengumuman rasmi, MiniMax melancarkan model generasi multimodal H3, yang mampu memahami teks, gambar, video, dan suara secara serentak, serta menghasilkan atau menyunting video berdasarkan arahan bahasa semula jadi.
H3 menyokong penggabungan tindakan, rujukan tokoh, rujukan suara, dan penyuntingan video dalam satu tugas sahaja. Sebagai contoh, pengguna boleh meminta model merujuk kepada pergerakan kamera daripada satu video, tokoh daripada satu gambar, dan suara daripada satu audio ketiga.
Model ini boleh menghasilkan video sehingga 15 saat, menyokong resolusi 2K dan suara stereo asli. Dari segi harga API rasmi, 2K ialah $0.13 per saat, menghasilkan video 15 saat kira-kira $1.95;
768P ialah $0.09 per saat. Satu tugas boleh memasukkan sehingga 9 gambar, 3 video, dan 3 audio, dengan jumlah keseluruhan tidak melebihi 12 fail.
MiniMax merancang untuk membuka timbangan model dalam beberapa hari mendatang, tetapi pihak rasmi belum mengumumkan penilaian seragamnya terhadap model seperti Seedance dan Veo.
