Pesan ChainThink, 31 Juli, menurut pengumuman resmi, MiniMax meluncurkan model generasi multimodal H3 yang dapat memahami teks, gambar, video, dan suara secara bersamaan, serta menghasilkan atau mengedit video berdasarkan perintah bahasa alami.
H3 mendukung penggabungan aksi migrasi, referensi tokoh, referensi suara, dan pengeditan video dalam satu tugas yang sama. Misalnya, pengguna dapat meminta model untuk merujuk pada gerakan kamera dari sebuah video, tokoh dari gambar lain, dan suara dari audio ketiga.
Model ini dapat menghasilkan video hingga 15 detik, mendukung resolusi 2K dan suara stereo asli. Dari segi harga API resmi, 2K seharga $0,13 per detik, sehingga menghasilkan video 15 detik sekitar $1,95;
768P seharga $0,09 per detik. Satu tugas dapat memasukkan hingga 9 gambar, 3 video, dan 3 audio, dengan total tidak lebih dari 12 file.
MiniMax berencana membuka bobot model dalam beberapa hari mendatang, namun pihak resmi belum mengumumkan evaluasi terpadu dengan model seperti Seedance dan Veo.
