ChainThink, 31 июля, по официальным данным, MiniMax выпустила многомодельную генеративную модель H3, способную одновременно понимать текст, изображения, видео и звук, а также генерировать или редактировать видео по одной команде на естественном языке.
H3 поддерживает объединение миграции действий, ссылок на персонажей, ссылок на звук и редактирования видео в одну задачу. Например, пользователь может заставить модель использовать движение камеры из одного видео, персонажа из другой картинки и звук из третьего аудиофайла.
Эта модель может генерировать видео длительностью до 15 секунд с поддержкой разрешения 2K и нативного стереозвука. Стоимость по официальному API: 2K — 0,13 доллара США за секунду, генерация 15-секундного видео составляет около 1,95 доллара США;
768P стоит 0,09 доллара США за секунду. За одну задачу можно загрузить до 9 изображений, 3 видео и 3 аудиофайла, всего не более 12 файлов.
MiniMax планирует открыть веса моделей в ближайшие дни; официально не опубликовано их единое сравнение с такими моделями, как Seedance и Veo.
