Google ने 2 सितंबर को Gemini 3.8 Flash और नेटवर्क डिफेंस के लिए 3.8 Flash Cyber जारी किया। 3.7 Flash के लॉन्च के बाद केवल तीन सप्ताह बाद, यह छह सप्ताह में तीसरी Flash सीरीज़ अपडेट है। Google ने 3.8 को वर्तमान में सबसे शक्तिशाली रीजनिंग और कोडिंग Flash मॉडल के रूप में स्थित किया है; सामान्य संस्करण Gemini API, Google AI Studio, Android Studio, Gemini Enterprise और कुछ उपभोक्ता उत्पादों में उपलब्ध है; जबकि Cyber संस्करण केवल नए Fairwind Program के माध्यम से विश्वसनीय सरकारी संस्थानों, महत्वपूर्ण बुनियादी ढांचे के संचालकों और सॉफ़्टवेयर रखरखावकर्ताओं को प्राथमिकता देकर उपलब्ध है। दोनों का आधारभूत बुद्धि समान है, लेकिन डिप्लॉयमेंट अधिकार और सुरक्षा सुरक्षा भिन्न हैं।
सामान्य 3.8 Flash की प्रवेश मूल्य अभी भी प्रति मिलियन इनपुट टोकन 0.75 डॉलर और आउटपुट 3.75 डॉलर है, जो 3.7 के समान है। हालाँकि, यह मूल्य केवल 31 दिसंबर, 2026 तक लागू रहेगा; 1 जनवरी, 2027 से, आधिकारिक रूप से सूचीबद्ध मूल्य 1.50 डॉलर प्रति इनपुट और 7.50 डॉलर प्रति आउटपुट हो जाएंगे। जो अक्सर नजरअंदाज किया जाता है, वह है कि मॉडल जटिल कार्यों पर अधिक निष्कर्षण कदम लेता है और टूल्स को बार-बार कॉल करता है, जिसके लिए Google स्पष्ट रूप से चेतावनी देता है कि उच्च प्रयास स्तर अधिक टोकन का उपयोग कर सकता है। मूल्य में वृद्धि न होना, एक कार्य की कुल बिलिंग स्थिर रहने का आश्वासन नहीं देता।
फ्लैश लंबे कार्यों के लिए प्रतिस्पर्धा शुरू कर रहा है, जहाँ केवल गति ही नहीं, बल्कि पूर्णता की दर भी मायने रखती है
Google के द्वारा प्रस्तुत साक्ष्य लंबे समय तक के कोडिंग, पेशेवर विश्लेषण और बहु-चरणीय तर्क को कवर करते हैं। 3.8 Flash, DeepSWE v1.1 लंबे समय तक के सॉफ्टवेयर इंजीनियरिंग मूल्यांकन में अधिकांश बड़े अग्रणी मॉडल्स को पार कर गया; HLE-Verified पर 54.9% प्राप्त किया। कंपनी ने वित्तीय एजेंट और कानूनी एजेंट बेंचमार्क का भी उल्लेख किया, जिससे स्पष्ट होता है कि वह Flash को निम्न लेटेंसी वाले प्रश्न-उत्तर मॉडल से लगातार योजना बनाने, उपकरणों को कॉल करने और पूर्ण परिणाम प्रदान करने में सक्षम कार्य मॉडल में बदलने का प्रयास कर रही है। हार्डवेयर डिसेम्बल विज़ुअलाइज़ेशन, एकल प्रॉम्प्ट से DOS संस्करण के मैप और 3D गेम का निर्माण जैसे प्रदर्शन, मॉडल की केवल कोड स्निपेट्स ही नहीं, बल्कि चक्र में निरंतर जांच और उत्पाद में संशोधन करने की क्षमता पर जोर देते हैं।
लेकिन बेंचमार्क स्कोर को सीधे कंपनी की उत्पादकता में बदला नहीं जा सकता। लंबे कार्य सफलता आमतौर पर कोड रिपॉजिटरी के आकार, निर्भरता वातावरण, परीक्षण गुणवत्ता, उपकरणों के अधिकार और पुनः प्रयास बजट पर निर्भर करती है। 3.8 “अधिक मेहनती” रणनीति के साथ पूर्णता दर में वृद्धि होने पर, निष्पादन समय और टोकन उपयोग भी बढ़ जाते हैं। विकास टीम को प्रत्येक कॉल की कीमत, एक कार्य के कुल टोकन, उपकरण कॉल की संख्या, सफलता से पहले पुनः प्रयासों की संख्या और मानव-द्वारा पुनः कार्य का समय दर्ज करना होगा, ताकि पता चल सके कि अपग्रेड वास्तव में सस्ता है या नहीं। देरी या बजट प्राथमिकता वाले लोड के लिए, Google अभी भी प्रयास स्तर कम करने या 3.7 Flash का उपयोग जारी रखने की सिफारिश करता है; पुराने संस्करण को नए उत्पाद के प्रकाशन के साथ तुरंत समर्थन समाप्त नहीं किया गया है।
सामान्य संस्करण विकासकों और उद्यमों के लिए उपलब्ध है, और Google AI Pro और Ultra उपयोगकर्ता Gemini ऐप, सर्च AI मोड और Gemini in Sheets में इसका उपयोग कर सकते हैं। विभिन्न प्रवेश बिंदुओं पर सुविधाएँ, कोटा और क्षेत्रीय उपलब्धता अलग-अलग हो सकती हैं, इसलिए "मॉडल लॉन्च हो गया है" को सभी उपयोगकर्ताओं और सभी उत्पादों के लिए समान क्षमताओं के साथ नहीं लिखा जाना चाहिए। विशेष रूप से स्वायत्त उपकरणों वाले प्रवाहों के लिए, लॉन्च की तारीख इस बात पर निर्भर करती है कि ऐप क्या उपकरण, अधिकार और पुनर्प्राप्त करने योग्य कार्यात्मक परिवेश मॉडल को प्रदान करता है।
Cyber संस्करण अधिक शक्तिशाली और संकीर्ण है, 47.2% स्वचालित रूप से ठीक करने का वादा नहीं है
Gemini 3.8 Flash Cyber को विभेदन और पैच उत्पन्न पर ध्यान केंद्रित किया गया है। Google के अनुसार, इसने 20 प्रोग्रामिंग भाषाओं के अंतर्गत आंतरिक दोष खोज परीक्षण में 70% से अधिक सफलता प्राप्त की; बाहरी CWE-Bench पैच परीक्षण में, pass@1 47.2% था, जो किसी अग्रणी अग्रणी मॉडल के 47.8% के करीब है, लेकिन लागत कम है। Chrome सुरक्षा टीम के आंतरिक उपयोग परिणामों से पता चलता है कि 3.8 Flash Cyber द्वारा उत्पन्न सही दोष पैचों की संख्या सर्वश्रेष्ठ बड़े व्यावसायिक मॉडल की तुलना में 2.6 गुना है। Wiz ने भी अपने आंतरिक पेनेट्रेशन टेस्टिंग बेंचमार्क में 7.5 से 9.7 प्रतिशत बढ़ोतरी और 2.3 से 5.2 गुना कम लागत की रिपोर्ट की है।
ये आंकड़े संदर्भ के लिए उपयोगी हैं, लेकिन सीमाओं के साथ हैं। आंतरिक आधार के नमूने, सुझाव और मानव निर्णय विधियाँ घोषणा में पूरी तरह से विस्तार से नहीं दी गई हैं; 47.2% का pass@1 का अर्थ है कि एक बार की उत्पादन से यह नहीं निश्चित होता कि आधे से अधिक प्रश्नों को सही ढंग से ठीक किया जाएगा। Google "उपयोग" के बजाय "ठीक करना" को प्राथमिकता देता है और सामान्य 3.8 के लिए रसायन, जीवविज्ञान, विकिरण, परमाणु और साइबर दुरुपयोग सुरक्षा शामिल करता है। Cyber संस्करण पेशेवर सुरक्षा की आवश्यकताओं को पूरा करने के लिए अधिक ढीले साइबर सुरक्षा प्रतिबंधों का उपयोग करता है, इसलिए इसे पूरी तरह से सार्वजनिक नहीं किया गया है, बल्कि केवल Fairwind योजना में विश्वसनीय सुरक्षा विशेषज्ञों को प्रदान किया गया है।
इस रिलीज़ में वास्तविक बदलाव Flash श्रृंखला के ट्रेडऑफ़ में है: यह अब केवल कम कीमत और गति के साथ बैच अनुरोधों को आकर्षित नहीं करता, बल्कि जटिल कार्य पूर्णता के लिए लंबे निष्पादन चक्र का उपयोग करता है। यदि कोई उद्यम 3.7 को सीधे 3.8 से बदल देता है, तो सबसे सामान्य गलती केवल मिलियन टोकन मूल्य की तुलना करना है। अधिक सुरक्षित दृष्टिकोण है कि वास्तविक कार्यों को स्तरबद्ध परीक्षण किया जाए: सरल अनुरोधों के लिए प्रयास स्तर सीमित रखें, लंबे कार्यों के लिए अधिक चक्र स्वीकार करें, और सुरक्षित कार्यों के लिए मानवीय स्वीकृति और अलग पर्यावरण बनाए रखें। 3.8 Flash अब उपलब्ध है, Cyber भी सीमित योजना में प्रवेश कर चुका है; लेकिन यह कि क्या यह कम कुल लागत पर अधिक उत्पादन कार्य पूरा कर सकता है, इसका उत्तर प्रत्येक टीम के स्वयं के एंड-टू-एंड डेटा द्वारा ही दिया जाएगा।
