گوگل نے 2 ستمبر کو Gemini 3.8 Flash اور ویب دفاع کے لیے 3.8 Flash Cyber جاری کیا۔ 3.7 Flash کے اطلاق کے صرف تین ہفتے بعد، یہ چھ ہفتے کے اندر تیسری Flash سیریز اپڈیٹ ہے۔ گوگل نے 3.8 کو اب تک کے سب سے طاقتور استدلال اور کوڈنگ Flash ماڈل کے طور پر پیش کیا ہے، جس کا عام ورژن Gemini API، Google AI Studio، Android Studio، Gemini Enterprise اور کچھ صارفین کے مصنوعات میں دستیاب ہے؛ جبکہ Cyber ورژن صرف نئے Fairwind پروگرام کے ذریعے قابل اعتماد حکومتی اداروں، اہم بنیادی ڈھانچے کے آپریٹرز اور سافٹ ویئر مینٹینر کے لیے پہلے ہی دستیاب ہے۔ دونوں کا بنیادی ذہنی نظام ایک جیسا ہے، لیکن ڈپلوائمنٹ کے اختیارات اور سیکورٹی تحفظات مختلف ہیں۔
عام 3.8 Flash کی متعارف کرائی گئی قیمت اب بھی ہر ملین ان پٹ ٹوکن کے لیے 0.75 امریکی ڈالر اور آؤٹ پٹ کے لیے 3.75 امریکی ڈالر ہے، جو 3.7 کے برابر ہے۔ تاہم، یہ قیمت صرف 31 دسمبر 2026 تک برقرار رہے گی؛ 1 جنوری 2027 سے، باضابطہ فہرست شدہ قیمتیں ان پٹ کے لیے 1.50 امریکی ڈالر اور آؤٹ پٹ کے لیے 7.50 امریکی ڈالر تک بڑھ جائیں گی۔ جو بات آسانی سے نظرانداز کر دی جاتی ہے، وہ یہ ہے کہ ماڈل پیچیدہ کاموں پر زیادہ استدلال کے مراحل اور بار بار ٹولز کا استعمال کرتا ہے، جس کے لیے Google نے واضح طور پر انتباہ کیا ہے کہ زیادہ محنت کے درجہ کے ساتھ زیادہ ٹوکن استعمال ہو سکتے ہیں۔ اس قیمت میں اضافہ نہ ہونا اس بات کا مطلب نہیں کہ کسی کام کا کل بل مستقل رہے گا۔
فلیش لمبے کاموں کے لیے مقابلہ شروع کر چکا ہے، صرف رفتار نہیں بلکہ مکمل کرنے کی شرح بھی اہم ہے
گوگل کی فراہم کردہ شواہد لمبے دور کے کوڈنگ، پیشہ ورانہ تجزیہ اور متعدد مراحل کے استدلال کو کور کرتے ہیں۔ 3.8 Flash، DeepSWE v1.1 لمبے دور کے سافٹ ویئر انجینئرنگ ایوان میں زیادہ سائز کے زیادہ تر عصری ماڈلز سے آگے نکل گیا؛ HLE-Verified پر 54.9% حاصل کیا۔ کمپنی نے فنانشل ایجینٹ اور لیگل ایجینٹ بینچ مارکس کا بھی حوالہ دیا، جس سے ظاہر ہوتا ہے کہ وہ Flash کو کم تاخیر والے سوال وجواب ماڈل سے آگے بڑھا کر مستقل منصوبہ بندی، ٹولز کا استعمال اور مکمل نتائج فراہم کرنے والے ماڈل میں تبدیل کرنا چاہتی ہے۔ ہارڈ ویئر ڈس ایسیبل ویژولائزیشن، ایک ہی پرامپٹ سے DOS ورژن کے مپ اور 3D گیمز بنانا جیسے ڈیمو، ماڈل کی صرف کوڈ کے ٹکڑے نہیں بلکہ لپ میں مستقل جانچ اور ترمیم کرنے کی صلاحیت پر زور دیتے ہیں۔
لیکن بنیادی اسکور کو براہ راست کاروباری پیداواریت میں تبدیل نہیں کیا جا سکتا۔ لمبے کام کی کامیابی کا شمار عام طور پر کوڈ ریپوزٹری کے سائز، منحصر ماحول، ٹیسٹ کی معیار، ٹولز تک رسائی اور دوبارہ کوشش کے بجٹ پر منحصر ہوتا ہے۔ جب 3.8 “زیادہ محنت کرنے والی” حکمت عملی کامیابی کی شرح بڑھاتی ہے، تو اس سے انجام دینے کا وقت اور ٹوکن استعمال بھی بڑھ جاتا ہے۔ ڈویلپمنٹ ٹیم کو صرف ایک ہی کال کی قیمت، ایک کام کے کل ٹوکن، ٹول کالز کی تعداد، کامیابی سے پہلے دوبارہ کوشش کی تعداد اور انسانی دوبارہ کام کا وقت ریکارڈ کرکے ہی پتہ چل سکتا ہے کہ اپگریڈ واقعی سستا ہے۔ تاخیر یا بجٹ پر زور دینے والے ورک لوڈز کے لیے، گوگل ابھی بھی محنت کے لیول کو کم کرنے یا 3.7 Flash کا استعمال جاری رکھنے کی تجویز کرتا ہے؛ پرانے ورژن کو نئے پروڈکٹس کے جاری ہونے سے فوراً سپورٹ ختم نہیں کیا گیا ہے۔
عام ورژن ڈیولپرز اور کمپنیوں کے لیے دستیاب ہو چکا ہے، اور Google AI Pro اور Ultra صارفین Gemini ایپ، سرچ AI موڈ اور Gemini in Sheets میں بھی استعمال کر سکتے ہیں۔ مختلف انٹری پوائنٹس کے فنکشنز، کوٹا اور علاقائی دستیابی مختلف ہو سکتی ہیں، اس لیے "ماڈل جاری کر دیا گیا ہے" کو تمام صارفین اور تمام پروڈکٹس کے لیے مکمل طور پر ایک جیسا فنکشنلیٹی دینے کے طور پر نہ لکھا جائے۔ خاص طور پر خود مختار ٹولز والے ورک فلو، ان کی شروعات اس بات پر منحصر ہے کہ ایپ کیا ماڈل کو متعلقہ ٹولز، اجازتیں اور قابل واپسی کا عملی ماحول فراہم کرتی ہے۔
سائبر ورژن زیادہ طاقتور اور زیادہ تنگ ہے، 47.2% آٹومیٹک ریپئر کا عہد نہیں ہے
جیمنی 3.8 فلیش سائبر کو کمزوریوں کی دریافت اور پیچھ کی تیاری پر زور دیا گیا ہے۔ گوگل کا کہنا ہے کہ اس نے 20 پروگرامنگ زبانوں پر مشتمل اپنے اندر کے کمزوری دریافت کے جائزے میں 70 فیصد سے زیادہ کامیابی حاصل کی ہے؛ باہری CWE-Bench پیچ جائزے میں، pass@1 47.2 فیصد تھا، جو کسی اہم سرحدی ماڈل کے 47.8 فیصد کے قریب تھا، لیکن اس کا اخراج کم تھا۔ Chrome سیکورٹی ٹیم کے اندر استعمال کے نتائج ظاہر کرتے ہیں کہ 3.8 فلیش سائبر نے بہترین بڑے تجارتی ماڈل کے مقابلے میں 2.6 گنا صحیح کمزوری پیچ تیار کیے۔ وِز نے بھی اپنے اندر کے پینٹرست ٹیسٹنگ بینچ مارک میں ریکال 7.5 سے 9.7 پوائنٹس بڑھنے اور لاگت میں 2.3 سے 5.2 گنا کمی کا اعلان کیا ہے۔
یہ اعداد و شمار مرجعی اور حدود والے ہیں۔ اندر کے معیار کے نمونے، حوالہ جات اور انسانی جائزہ کے طریقے اعلان میں مکمل طور پر نہیں بیان کیے گئے؛ 47.2% کا pass@1 اس بات کا بھی مطلب ہے کہ ایک بار کی تولید یقینی طور پر نصف سے زیادہ مسائل کو درست نہیں کر سکتی۔ گوگل نے "درست کرنا" کو "استعمال کرنا" سے زیادہ اہمیت دی ہے اور عام 3.8 کے لیے کیمیائی، جانوری، تابکار، اور جوہری، ساتھ ہی سائبر دھوکہ دہی کے خلاف تحفظ شامل کیا ہے۔ سائبر ورژن، ماہرین کے دفاعی ضروریات کو پورا کرنے کے لیے زیادہ آزاد سائبر سلامتی پابندیوں کا استعمال کرتا ہے، اس لیے اسے مکمل طور پر شائع نہیں کیا گیا بلکہ صرف فیر ونڈ پروگرام میں قابل اعتماد دفاعی فریق کو فراہم کیا گیا ہے۔
اس اپڈیٹ میں فلش سیریز کا اصل تبدیلی یہ ہے کہ اب یہ صرف کم قیمت اور تیز رفتاری کے ذریعے بڑے پیمانے پر درخواستوں کو کھینچنے کی بجائے، پیچیدہ کاموں کی مکملیت کو حاصل کرنے کے لیے لمبے استدلال سائکلز کا استعمال کرتا ہے۔ اگر کوئی کاروبار 3.7 کو براہ راست 3.8 سے بدل دے، تو سب سے عام غلطی صرف ملین ٹوکن کی قیمت کا موازنہ کرنا ہے۔ زیادہ محفوظ طریقہ یہ ہے کہ حقیقی کاموں کو درجہ بندی کرکے ٹیسٹ کیا جائے: آسان درخواستوں کے لیے محنت کے سطح کو محدود رکھیں، لمبے کاموں کے لیے زیادہ سائکلز کی اجازت دیں، اور محفوظ کاموں کے لیے انسانی تصدیق اور الگ ماحول برقرار رکھیں۔ 3.8 فلش اب دستیاب ہے، اور سائبر بھی محدود منصوبے میں داخل ہو چکا ہے؛ لیکن یہ کہ وہ کم تر مجموعی لاگت پر زیادہ پیداواری کاموں کو مکمل کر سکتا ہے یا نہیں، اس کا جواب ہر ٹیم کے اپنے اندرونی اور عملی ڈیٹا سے آئے گا۔
