ChainThink thông báo, ngày 31 tháng 7, theo thông tin chính thức, MiniMax đã ra mắt mô hình sinh toàn modal H3, có khả năng đồng thời hiểu văn bản, hình ảnh, video và âm thanh, đồng thời tạo hoặc chỉnh sửa video dựa trên một lệnh ngôn ngữ tự nhiên.
H3 hỗ trợ gộp hành động di chuyển, tham chiếu nhân vật, tham chiếu âm thanh và chỉnh sửa video vào cùng một nhiệm vụ. Ví dụ: người dùng có thể yêu cầu mô hình tham chiếu chuyển động镜头 từ một đoạn video, nhân vật từ một hình ảnh khác và âm thanh từ một đoạn âm thanh thứ ba.
Mô hình này có thể tạo video dài tối đa 15 giây, hỗ trợ độ phân giải 2K và âm thanh stereo bản địa. Về giá API chính thức, 2K là 0,13 USD mỗi giây, tạo video 15 giây khoảng 1,95 USD;
768P là 0,09 USD mỗi giây. Mỗi nhiệm vụ có thể nhập tối đa 9 hình ảnh, 3 đoạn video và 3 đoạn âm thanh, tổng cộng không quá 12 tệp.
MiniMax dự kiến sẽ mở trọng số mô hình trong vài ngày tới, nhưng chính thức chưa công bố đánh giá thống nhất với các mô hình như Seedance, Veo, v.v.
