Mensahe ng ChainThink, noong Hulyo 31, ayon sa opisyal na ulat, ang MiniMax ay naglunsad ng H3, ang buong modal na generatibong modelo, na nakakaintindi ng teksto, larawan, video, at tunog nang sabay-sabay, at nakakagawa o nagpapabago ng video batay sa isang natural na pagsasalita.
H3 ay sumusuporta sa pagpapalipat ng aksyon, pagtatala ng tauhan, pagtatala ng tunog, at pag-edit ng video sa iisang gawain. Halimbawa, maaaring hilingin ng user sa modelo na gamitin ang galaw ng kamera mula sa isang video, ang tauhan mula sa isang larawan, at ang tunog mula sa isang audio.
Ang modelo ay maaaring mag-generate ng video hanggang 15 segundo, na sumusuporta sa 2K resolution at native stereo audio. Sa presyo ng opisyal na API, ang 2K ay $0.13 bawat segundo, kaya ang pag-generate ng 15-segundong video ay humigit-kumulang $1.95;
768P ay $0.09 bawat segundo. Maaaring mag-input ng pinakamaraming 9 na larawan, 3 video, at 3 audio sa isang task, na may kabuuang hindi hihigit sa 12 na file.
Planong buksan ng MiniMax ang model weights sa susunod na mga araw, hindi pa ipinahayag ng opisyal ang kanilang isang pagtataya kasama ang mga model tulad ng Seedance at Veo.
