گوگل کل جیمینی 3.8 فلیش لانچ کرے گا، جس کا توجہ کوڈنگ اور ویڈیو سمجھنے پر ہوگا

icon MarsBit
بانٹیں
AI summary iconخلاصہ
گوگل کل جیمینی 3.8 فلیش لانچ کرنے جا رہا ہے، جو AI کے شعبے میں ایک بڑا ٹوکن لانچ کی خبر ہے۔ اس ماڈل کا کوڈ نام 'اسکیماکی' ہے، جو کوڈنگ اور ویڈیو سمجھ میں بہتری لاتا ہے اور ٹوکن استعمال میں تکریباً 88% تک کمی لاتا ہے۔ جیمینی 3.5 پرو کو منسوخ کر دیا گیا ہے، اور ترقی کو جیمینی 4.0 پر منتقل کر دیا گیا ہے۔ آن چین خبروں سے پتہ چلتا ہے کہ گوگل ایجنٹک ویڈیو سمجھ کو بھی ڈائنامک مواد کے تجزیہ کے لیے متعارف کر رہا ہے۔

کلوڈ 5.1 صرف شروع ہوا، جبکہ دوسری طرف اوپن اے آئی اسٹرا فوراً آ گیا۔

اب، گوگل بھی نئے اقدامات کر رہا ہے۔ تازہ خبروں کے مطابق، جیمنی 3.8 فلیش کل متعارف کرایا جائے گا۔

گوگل

گوگل

لگتا ہے کہ AI دنیا میں دوبارہ "سالانہ تقریب" شروع ہو رہی ہے۔

جیمنی 3.5 پرو کو منسوخ کر دیا گیا، اگلا بڑا ورژن 4.0

جیمنی 3.8 فلیش کے اطلاق کے مقابلے میں، بہت سے لوگ زیادہ تر یہ جاننا چاہتے ہیں کہ جیمنی 3.5 پرو کب آئے گا؟!

معذرت، انتظار نہ کریں، گوگل نے چھوڑ دیا ہے......

گوگل

اس سال مئی کے I/O کانفرنس کے اعلان کے بعد تقریباً 4 ماہ گزر چکے ہیں، اور Gemini 3.5 Pro کی ترقی Flash سے بھی کم ہے۔

گوگل بھی مجبور تھا، براہ راست "کھو گیا"۔

خوش قسمتی سے، جیمنی 4.0 کی پری ٹریننگ میں بہترین ادائیگی ہوئی ہے اور پوسٹ ٹریننگ بھی آرام سے جاری ہے۔

گوگل

گوگل

WSJ کی اس منفرد خبر میں جیمنی 3.8 فلیش (کوڈ نام 'Skimaki') کی طاقتور پروگرامنگ صلاحیت کا بھی اہم انکشاف کیا گیا ہے۔

دعویٰ ہے کہ گوگل کے اندری کوڈنگ ٹول جیٹسکی کے مقابلے کے ٹیسٹ میں، 3.8 Flash نے Opus ماڈل کو بالکل دبانا۔

اور، یہ ماڈل کئی ماہ سے تیار کیا جا رہا تھا، گوگل کے لیڈرشپ میں بڑے زلزلے سے پہلے ہی۔

ہاسابس نے عہدہ چھوڑ دیا، چیف سائنسدان جیف ڈین کے استعفیٰ کے ساتھ، بہت سے لوگوں نے جیمنی کے مستقبل کے بارے میں فکر کی۔

گوگل

تاہم، اب تک لگتا ہے کہ سب کچھ اندر کی طرف سے اچھی طرح سے چل رہا ہے۔

اُب، گوگل Gemini 3.8 Flash کو پہلے جاری کرنے کی منصوبہ بندی کر رہا ہے، کیونکہ اس ماڈل کے پیرامیٹرز کم ہیں، کم حسابی طاقت کی ضرورت ہوتی ہے، اور اس سے زیادہ آسانی سے نتائج حاصل کیے جا سکتے ہیں۔

اندرونی ذرائع کے مطابق، اس سال کے آغاز سے گوگل نے جیمنی کی کوڈنگ کی صلاحیت کو بہتر بنانے کے لیے زیادہ انسانی وسائل اور کمپوٹیشنل طاقت لگائی ہے۔

خاصة طور پر، "ری انفورسمنٹ لرننگ" پر زیادہ سرمایہ کاری کی گئی ہے تاکہ AI لگاتار کوشش اور غلطی کے ذریعے نئے مہارتیں سیکھ سکے۔

اور گوگل ڈیپ مائنڈ اور دیگر لیبز، متعدد منصوبوں پر одно وقت میں کام کر رہے ہیں، جس سے اگر ایک کام نہیں کرتا تو دوسرا اس کی جگہ لے سکتا ہے۔

جیمنی 3.5 پرو کی توقعات پوری نہیں ہوئیں، لیکن جیمنی 4.0 ابھی "ناپکڑا" نہیں ہوا۔

اب، سلیکون ویلی کی "دو بڑی کمپنیاں" OpenAI اور Anthropic، ایڈوانسڈ ماڈلز اور پروگرامنگ ایجینٹس میں بہت طاقتور ہیں۔

معلومات کے مطابق، OpenAI کی اگلی نسل کا Astra ایک نئی "ریکرنس ڈیپتھ" استدلالی طریقہ استعمال کرتا ہے، جس سے سوچنے والے ٹوکنز کم ہوتے ہیں اور صلاحیت میں کافی اضافہ ہوتا ہے۔

یہ جیت کا کارڈ، اس ہفتے کا اعلان ہوگا۔

گوگل

اور ابھی، گوگل کو کچھ نہ کچھ پیش کرنا ہوگا۔

بالآخر، پیچھے کے چند ماہ میں، 3.7 Flash جاری کرنے کے بعد، AI کے دنیا کو خوش کرنے والا کوئی مدل نہیں جاری کیا گیا۔

شاید آج رات ہی Gemini 3.8 Flash متعارف کرایا جائے گا۔

گوگل

جیمنی پہلی بار، ویڈیوز دیکھنا سیکھ گیا

اس سے پہلے کہ یہ جاری کیا جائے، گوگل نے آج ایک پری-لانچ کیا، جس میں جیمنی کو ایک نئی صلاحیت دی گئی —

ایجینٹ ویڈیو سمجھنا

یہ فیچر بہت بڑا فائدہ ہے۔

ایک I/O کانفرنس ویڈیو اپ لوڈ کریں، ایک ہی ماڈل Gemini 3.7 Flash، ٹوکن کے استعمال میں 88% کی براہ راست کمی آئی۔

گوگل

گوگل نے اپنے باہری بلاگ میں کہا ہے کہ Gemini 3.7 Flash، 3.6 Flash، اور 3.5 Flash-Lite مدلز ایجنٹک ویڈیو سمجھ کی صلاحیت استعمال کر سکتے ہیں، جس کا ایکسیس Google AI Studio اور Gemini Enterprise Agent Platform پر دستیاب ہے۔

معیاری ویڈیو تجزیہ بینچ مارک پر اس سوئچ کو آن کریں، ٹوکن استعمال میں 88% تک کمی، تجزیہ لاگت میں 66% تک کمی، اور درستگی میں 7% تک اضافہ۔

گوگل

اور اضافی کوئی فیس نہیں لی جا رہی، اب بھی معیاری API کے ٹوکن قیمت کے مطابق ہے۔ پیسے بچانے اور درستگی میں عام طور پر تنازع ہوتا ہے۔ لیکن اس بار کوئی تنازع نہیں ہوا۔

گوگل

کیونکہ جیمنی نے "پروگریس بار کو ڈریگ کرنا" سیکھ لیا۔

پہلے کا طریقہ "سٹیٹک" پروسیسنگ کہلاتا تھا، جس میں ماڈل مخصوص فریم ریٹ کے ساتھ فکسڈ فریمز کا اسٹریم پاسیو لیتا تھا، جہاں فریم ریٹ API پیرامیٹرز سے طے ہوتی تھی اور ماڈل کو کوئی کہنے کا اختیار نہیں تھا۔

اب ماڈل خود فیصلہ کرے گا کہ کون سا حصہ دیکھنا ہے، کتنی تیزی سے دیکھنا ہے، کیا تصویر دیکھنی ہے، آواز سننی ہے یا براہ راست ٹرانسکرپٹ پڑھنا ہے۔

گوگل

یہ گوگل کی طرف سے ایسا کرنے کا پہلا مرتبہ نہیں ہے۔

پہلے ایجنٹک ویژن میں کوڈ ایکزیکیشن اور جیمنی کی اصلی تصویر سمجھنے کی صلاحیت کو جوڑا گیا تھا، جس کے تحت ماڈل ایک تصویر کے ساتھ خود کوڈ لکھ کر اسے بڑھانا، کاٹنا اور موازنہ کر سکتا تھا۔

اب ویڈیو کا دور آیا ہے، افکار وہی ہیں، صرف ٹولز کو نیچے والے ویڈیو ٹولز سے بدل دیا گیا ہے۔

چار پہلے مشکل کام

آفیشل بلاگ میں کچھ مشکل اطلاقات کی فہرست بھی درج ہے۔

سیکنڈ سے کم کے حصوں کی تلاش۔ پہلے ماڈلز ویڈیو کو "دیکھتے" تھے اور ایک سیکنڈ میں صرف ایک تصویر کاٹتے تھے۔ مسئلہ یہ ہے کہ بہت سی چیزیں ایک سیکنڈ سے کم میں گزر جاتی ہیں۔

اب ان لمحات کو ایک سیکنڈ سے کم کے اندر درست طریقے سے定位 کیا جا سکتا ہے۔

اس کا مطلب ہے کہ "آٹو کٹنگ" کا عمل پہلی بار حقیقی طور پر ممکن ہو گیا ہے: پہلے ایڈیٹرز کو خود ٹائم لائن پر جھک کر، فریم بہ فریم، یہ طے کرنا پڑتا تھا کہ کہاں کاٹنا ہے، اب وہ ماڈل کو پہلے ایک نظر انداز کرنے دے سکتے ہیں، جو امکانی کٹ پوائنٹس نشان زد کر دے، اور پھر انسان اس میں سے منتخب کرے۔

گوگل

لمبے ویڈیو میں سے سوئی تلاش کریں۔ کچھ گھنٹوں کے مواد میں ایک پیچیدہ سوال پوچھیں، ملینوں ٹوکنز کو ضائع کیے بغیر۔

غیر معمولی کاشف۔ جب ماڈل کسی خاص وقت کے ونڈو کو ہدف بناتا ہے، تو وہ اس حصے کے لیے فریم ریٹ بڑھا کر دوبارہ نمونہ لے سکتا ہے تاکہ تیز حرکت اور نرم تصویری خامیاں واضح ہو سکیں۔ پیداواری لائن کی معیار کی جانچ اور سیکورٹی نگرانی کے لیے یہ سب سے زیادہ مفید ہے، کیونکہ غیر معمولی واقعات صرف کچھ سیکنڈز میں ہوتے ہیں۔

گنتی کریں۔ ایک حرکت کتنی بار دہرائی گئی، منظر میں کتنے مختلف اشیاء ہیں، اس قسم کے سوالات کے لیے ماڈل پہلے سے ہی مستقل طور پر غلط رہے، اور وجہ بہت سادہ ہے — نمونہ میں شامل نہ ہونے والی کچھ فریمز میں بالکل چیزیں موجود تھیں۔

گوگل

ایجینٹ نے آخرکار ویڈیو دیکھ لی۔

ویڈیو، ہمیشہ تمام ماڈلز میں سب سے مہنگا رہا ہے۔

متن سستا ہے، تصاویر ٹھیک ہیں، ویڈیوز بڑی اور لمبی ہیں، ایک منٹ کا ویڈیو ایک کتاب کے ٹوکنز کو ختم کر دیتا ہے۔

اس لیے پچھلے دو سالوں میں سب لوگ ایجنٹ کے بارے میں زیادہ تر اس بات پر بات کر رہے ہیں کہ وہ پڑھ سکتا ہے، لکھ سکتا ہے، اور ٹولز استعمال کر سکتا ہے۔

مسئلہ یہ ہے کہ ایک ایسا ایجینٹ جو دنیا کو صرف متن کے ذریعے سمجھتا ہے، اصل میں صرف ایک ایسی دنیا دیکھ رہا ہے جو کسی نے «نقل» کر دی ہے۔

وہ وہ چیزیں نہیں جانतا جو کیمرے نے کیپچر کی ہیں، میٹنگز میں ریکارڈ ہوئی ہیں، یا پیداواری لائن سے گزر گئی ہیں، جن کو کوئی بھی وقت دینے کو تیار نہیں ہے کہ انہیں متن میں تبدیل کر دیا جائے۔

اب، اس لاگت کی منحنی کو کافی حد تک کاٹ دیا گیا ہے۔

اگر ایک ایجنٹ کئی گھنٹوں کی سرکلر کیمرہ فوٹیج، دہائیوں کے کورسز، اور سینکڑوں مادہ کو خود ہی ترجمہ کر سکے اور اس کا بجٹ بھی ختم نہ ہو جائے، تو اس کا دنیا سے رابطہ کا طریقہ بدل جائے گا۔

اسے اب تصویر کو الفاظ میں تبدیل کرنے کا انتظار نہیں کرنا پڑتا، اور "دیکھنے کے قابل" اور "دیکھنے کے درست" کے درمیان انتخاب بھی نہیں کرنا پڑتا۔

گوگل نے اس ٹوٹنے والے کے طور پر کام کیا۔

AI کی جنگ، اگلا راؤنڈ

ان دنوں، چاروں کی اشاعت کی رفتار تقریباً ایک ساتھ ٹکر گئی۔

کلود 5.1 ابھی آیا ہے، اوپن اے آئی اسٹرا دروازے پر پہلے ہی موجود ہے، اور گوگل نے کئی ماہ تک انتظار کیا اور آخرکار جیمنی 3.8 فلیش کے ساتھ مقابلہ کرنے کے لیے تیار ہو گیا۔

اس اپڈیٹ کے بعد، کلیدی اب دو شعبوں پر مرکوز ہے: پروگرامنگ اور سائنسی تحقیق۔

اگلی نسل کی اسٹرا ایک "مستقل ایجنٹ" بن جائے گی، جس کی کمپیوٹر استعمال کی صلاحیت انسانی سطح تک پہنچ چکی ہے، جیسا کہ اوٹومان نے کہا۔

گوگل

جیمنی 3.8 فلیش پروگرامنگ میں بھی بڑی ترقی کرے گا۔

اب، OpenAI، Anthropic، گوگل، اور SpaceXAI سب نے ایک ساتھ پوری طاقت سے کام شروع کر دیا ہے۔

گوگل

ماسک نے گروک 4.7 کو دس دن کے اندر جاری کرنے کا اعلان کیا ہے

یہ لڑائی ابھی اپنے سب سے خطرناک مرحلے میں داخل ہو رہی ہے۔

حوالہ جات:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

یہ مضمون ویچن گروپ "نیوزی ایوان" سے ہے، مصنف: ASI وحی

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔