চেইনথিংক সংবাদ, ৩১ জুলাই, অফিসিয়াল ঘোষণা অনুযায়ী, মিনিম্যাক্স সম্পূর্ণ মডাল জেনারেটিভ মডেল H3 প্রকাশ করেছে, যা পাঠ্য, ছবি, ভিডিও এবং শব্দ একসাথে বুঝতে পারে এবং একটি প্রাকৃতিক ভাষার নির্দেশ অনুযায়ী ভিডিও তৈরি বা সম্পাদনা করতে পারে।
H3 একটি টাস্কের মধ্যে অ্যাকশন মিগ্রেশন, চরিত্র রেফারেন্স, সাউন্ড রেফারেন্স এবং ভিডিও এডিটিং একসাথে রাখতে সক্ষম। উদাহরণস্বরূপ, ব্যবহারকারী মডেলকে একটি ভিডিওর ক্যামেরা মোশন, অন্য একটি ছবির চরিত্র এবং তৃতীয় একটি অডিওর শব্দ রেফারেন্স হিসাবে ব্যবহার করতে পারেন।
এই মডেলটি সর্বাধিক 15 সেকেন্ডের ভিডিও তৈরি করতে পারে, 2K রেজোলিউশন এবং ন্যাটিভ স্টেরিও অডিও সমর্থন করে। অফিসিয়াল API মূল্যের ক্ষেত্রে, 2K-এর জন্য প্রতি সেকেন্ড 0.13 ডলার, যা 15 সেকেন্ডের ভিডিও তৈরির জন্য প্রায় 1.95 ডলার;
768P প্রতি সেকেন্ডে 0.09 ডলার। একটি টাস্কে সর্বোচ্চ 9টি ছবি, 3টি ভিডিও এবং 3টি অডিও আপলোড করা যাবে, যার মোট ফাইল সংখ্যা 12টির বেশি হবে না।
মিনিম্যাক্স পরবর্তী কয়েক দিনের মধ্যে মডেল ওয়েট খোলার পরিকল্পনা করছে, যদিও অফিসিয়ালি এটিকে সিডেন্স, ভিও ইত্যাদি মডেলের সাথে একীভূত মূল্যায়ন করার ঘোষণা করেননি।
