رسالة ChainThink، 31 يوليو، وفقًا للإعلان الرسمي، أطلقت MiniMax نموذج التوليد متعدد الوسائط H3، الذي يمكنه فهم النصوص والصور والفيديوهات والأصوات في آنٍ واحد، وتوليد أو تحرير الفيديوهات بناءً على أمر لغوي طبيعي.
تدعم H3 دمج نقل الإجراءات، ومراجع الشخصيات، ومراجع الصوت، وتحرير الفيديو في مهمة واحدة. على سبيل المثال، يمكن للمستخدم أن يطلب من النموذج الاعتماد على حركة الكاميرا من فيديو، وشخصية من صورة أخرى، وصوت من مقطع صوتي ثالث.
يُمكن لهذا النموذج إنشاء فيديو بحد أقصى 15 ثانية، ويدعم دقة 2K وصوت ستيريو أصلي. من حيث أسعار الواجهة البرمجية الرسمية، تكون تكلفة 2K عند 0.13 دولار لكل ثانية، أي حوالي 1.95 دولار لإنشاء فيديو مدته 15 ثانية؛
768P بسعر 0.09 دولار لكل ثانية. يمكن إدخال ما يصل إلى 9 صور و3 مقاطع فيديو و3 مقاطع صوتية في مهمة واحدة، بحد أقصى 12 ملفًا.
تخطط MiniMax لفتح أوزان النموذج خلال الأيام القادمة، ولم تُعلن الشركة الرسمية بعد عن تقييم موحد للنموذج مقارنةً بـ Seedance و Veo وغيرها.
