ChainThink повідомляє, 31 липня, за офіційними даними, MiniMax представила повномодальну генеративну модель H3, яка може одночасно розуміти текст, зображення, відео та звук і генерувати або редагувати відео за допомогою однієї команди на природній мові.
H3 підтримує об’єднання міграції дій, посилань на персонажів, посилань на звук та редагування відео в одній завданні. Наприклад, користувач може надати моделі посилання на рух камери з відео, персонажа з зображення та звук з третього аудіофайлу.
Ця модель може створювати відео довжиною до 15 секунд, підтримує роздільну здатність 2K та нативний стереозвук. Ціна офіційного API: для 2K — 0,13 долара за секунду, отже, генерація відео тривалістю 15 секунд коштує приблизно 1,95 долара;
768P — 0,09 долара за секунду. За одну задачу можна завантажити до 9 зображень, 3 відео та 3 аудіофайли, загальна кількість файлів не більше 12.
MiniMax планує відкрити ваги моделей у найближчі дні, офіційно ще не опубліковано єдину оцінку цих моделей разом із Seedance, Veo тощо.
