ChainThink mensagem, 31 de julho, segundo informações oficiais, a MiniMax lançou o modelo de geração multimodal H3, capaz de compreender simultaneamente texto, imagens, vídeos e áudio, e gerar ou editar vídeos com base em um comando em linguagem natural.
O H3 permite agrupar movimento de ação, referência de personagem, referência de som e edição de vídeo em uma única tarefa. Por exemplo, o usuário pode fazer com que o modelo se refira ao movimento da câmera de um vídeo, ao personagem de uma imagem e ao som de um terceiro áudio.
O modelo pode gerar vídeos de até 15 segundos, com suporte a resolução 2K e áudio estéreo nativo. Em termos de preço da API oficial, o 2K custa US$ 0,13 por segundo, resultando em aproximadamente US$ 1,95 para gerar um vídeo de 15 segundos;
768P custa US$ 0,09 por segundo. Cada tarefa pode incluir até 9 imagens, 3 vídeos e 3 áudios, com um total máximo de 12 arquivos.
A MiniMax planeja abrir os pesos do modelo nos próximos dias; ainda não foi divulgada avaliação unificada com modelos como Seedance e Veo.
