Mensaje de ChainThink, 31 de julio: según el anuncio oficial, MiniMax lanzó el modelo generativo multimodal H3, capaz de comprender simultáneamente texto, imágenes, videos y sonido, y generar o editar videos según una instrucción en lenguaje natural.
H3 admite la incorporación de migración de acciones, referencia de personajes, referencia de sonido y edición de video en una sola tarea. Por ejemplo, el usuario puede hacer que el modelo se refiera al movimiento de cámara de un video, a un personaje de una imagen y al sonido de un tercer audio.
El modelo puede generar videos de hasta 15 segundos, con soporte para resolución 2K y audio estéreo nativo. En cuanto a los precios de la API oficial, 2K cuesta $0.13 por segundo, lo que equivale a aproximadamente $1.95 para generar un video de 15 segundos;
768P cuesta 0.09 dólares por segundo. Por tarea, puedes ingresar hasta 9 imágenes, 3 videos y 3 audios, con un total máximo de 12 archivos.
MiniMax planea abrir los pesos del modelo en los próximos días; aún no se ha publicado una evaluación unificada con modelos como Seedance o Veo.
