ChainThink संदेश, 31 जुलाई, आधिकारिक सूचना के अनुसार, MiniMax ने होलिस्टिक मॉडल H3 जारी किया है, जो पाठ, छवियों, वीडियो और ध्वनि को एक साथ समझ सकता है और एक प्राकृतिक भाषा निर्देश के आधार पर वीडियो बना सकता है या संपादित कर सकता है।
H3 सक्षम है कि एक ही कार्य में एक्शन माइग्रेशन, पर्सन रेफरेंस, साउंड रेफरेंस और वीडियो एडिटिंग शामिल किया जाए। उदाहरण के लिए, उपयोगकर्ता मॉडल को एक वीडियो के लेंस मूवमेंट, एक अन्य चित्र में व्यक्ति और तीसरी ऑडियो की आवाज़ का संदर्भ लेने के लिए प्रेरित कर सकता है।
यह मॉडल अधिकतम 15 सेकंड का वीडियो उत्पन्न कर सकता है, जो 2K रिज़ॉल्यूशन और नेटिव स्टीरियो ऑडियो का समर्थन करता है। आधिकारिक API मूल्य के अनुसार, 2K के लिए प्रति सेकंड 0.13 डॉलर है, जिससे 15 सेकंड के वीडियो का उत्पादन लगभग 1.95 डॉलर का होता है;
768P की दर 0.09 डॉलर प्रति सेकंड है। एक टास्क में अधिकतम 9 छवियाँ, 3 वीडियो और 3 ऑडियो फ़ाइलें अपलोड की जा सकती हैं, जिसका कुल योग 12 फ़ाइलों से अधिक नहीं होना चाहिए।
MiniMax अगले कुछ दिनों में मॉडल वेट्स खोलने की योजना बना रहा है, और आधिकारिक तौर पर इसकी Seedance, Veo आदि मॉडल्स के साथ एकीकृत मूल्यांकन की घोषणा नहीं की गई है।
