गूगल ने 2 दिसंबर, 2026 को Gemini 3.8 Flash और विश्वसनीय नेटवर्क डिफेंस संगठनों के लिए Gemini 3.8 Flash Cyber जारी किया। सामान्य संस्करण में 100 लाख टोकन का संदर्भ है, जो प्रोग्रामिंग, एजेंट और विशेषज्ञता कार्यों पर केंद्रित है; गूगल द्वारा प्रकाशित परीक्षणों में, इसकी लंबी अवधि के सॉफ्टवेयर इंजीनियरिंग में 73.7% का प्रदर्शन हुआ, जो Claude Opus 5 के 74.0% के करीब है, जबकि वित्तीय एजेंट, कानूनी एजेंट और कुछ समग्र तर्क परीक्षणों में यह मॉडल अन्य परीक्षण किए गए मॉडल्स से आगे है। Cyber संस्करण स्वयं दोषों की खोज कर सकता है और पैच बना सकता है: गूगल के आंतरिक परीक्षण में 20 विभिन्न प्रोग्रामिंग भाषाओं में सफलता दर 70% से अधिक रही, और Chrome टीम को प्राप्त सही पैचों की संख्या बड़े व्यावसायिक मॉडल्स की तुलना में 2.6 गुना थी। वर्तमान API छूट की कीमत 100 लाख इनपुट टोकन के लिए 0.75 डॉलर और 100 लाख आउटपुट टोकन के लिए 3.75 डॉलर है, लेकिन मॉडल प्रदर्शन के लिए अधिक तर्क कदमों और टूल कॉल का उपयोग करता है, स्वतंत्र मूल्यांकनों से पता चलता है कि इसकी एकल कार्य लागत 3.7 Flash से लगभग 40% अधिक है। इस प्रकाशन का मुख्य संकेत है कि पिछले समय में महंगे फ्लैगशिप मॉडल्स के सीमित क्षेत्र में होने वाली एजेंट क्षमताएँ, अब सस्ती, स्केलेबल "कार्य मॉडल" में प्रवेश कर रही हैं, हालाँकि क्षमता के आँकड़े अभी भी मुख्यतः गूगल और सहयोगी परीक्षणों पर ही केंद्रित हैं, और Cyber संस्करण सामान्य उपयोगकर्ताओं के लिए उपलब्ध नहीं है।लेखक, स्रोत: DeepMind
छह हफ्तों में तीन बार अपडेट, Google ने Flash को मुख्य मॉडल बना दिया
Gemini 3.8 Flash, जो 3.7 Flash के लॉन्च के बाद केवल तीन सप्ताह बाद आया है, Google द्वारा छह सप्ताह के भीतर लॉन्च किया गया तीसरा Flash संस्करण है।
पिछले समय, "Flash" का अर्थ आमतौर पर तेज़ गति और कम लागत के साथ-साथ फ्लैगशिप मॉडल की तुलना में स्पष्ट रूप से कम क्षमता होता था। Gemini 3.8 की स्थिति बदल रही है: Google अभी भी इसे बड़े पैमाने पर डिप्लॉय के लिए एक "कार्य मॉडल" के रूप में संदर्भित करता है, लेकिन अब इसकी मुख्य क्षमताएँ लंबे समय तक की प्रोग्रामिंग, लगातार टूल कॉल और पेशेवर विश्लेषण हैं, और यह केवल चैट, सारांश जैसे हल्के कार्यों के लिए सीमित नहीं है।
नया मॉडल टेक्स्ट, इमेज, ऑडियो, वीडियो और PDF इनपुट का समर्थन करता है, जिसमें 100 लाख टोकन का कॉन्टेक्स्ट और 64,000 टोकन की अधिकतम आउटपुट क्षमता है, और यह सर्च, फंक्शन और कंप्यूटर ऑपरेशन टूल्स को कॉल कर सकता है। यह अब परीक्षण या प्रीव्यू के बजाय सार्वजनिक रूप से उपलब्ध है, और इसे Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, Gemini ऐप, सर्च AI मोड और Google Sheets के माध्यम से उपयोग किया जा सकता है।
Google का होस्टेड एजेंट Antigravity भी अब डिफ़ॉल्ट रूप से 3.8 Flash का उपयोग करता है। इससे स्पष्ट होता है कि यह मॉडल वास्तव में बार-बार योजना बनाने, टूल्स को कॉल करने, परिणामों की जांच करने और लगातार सुधार करने वाले एजेंट के लिए डिज़ाइन किया गया है, न कि केवल एकल प्रश्न-उत्तर के लिए।
Programming performance is nearing that of expensive flagship models.
Google द्वारा जारी DeepSWE v1.1 लंबे समय तक के सॉफ्टवेयर इंजीनियरिंग परीक्षण में, Gemini 3.8 Flash ने 73.7% का स्कोर प्राप्त किया, जो 3.7 Flash के 65.3% और GPT-5.6 Sol के 72.7% से अधिक है, और Claude Opus 5 के 74.0% से 0.3 प्रतिशत अंक कम है।
इस प्रकार के परीक्षण में मॉडल को वास्तविक कोड बेस में प्रवेश करना, कई फ़ाइलों के बीच संबंधों को समझना, समस्याओं का पता लगाना और परीक्षण से गुजरने वाले संशोधन पूरा करना आवश्यक होता है। यह एक अलग फ़ंक्शन को जनरेट करने की तुलना में वास्तविक प्रोग्रामिंग एजेंट के कार्य के अधिक समीप है।
Vals Finance Agent v2 में, 3.8 Flash ने 61.4% प्राप्त किया, जबकि परीक्षण किए गए 3.7 Flash, Claude Opus 5 और GPT‑5.6 Sol क्रमशः 59.0%, 58.6% और 53.8% प्राप्त कर रहे हैं।
Harvey विधि Agent परीक्षण में, 3.8 Flash का स्कोर 10.0% है, जो 3.7 Flash के 8.8%, Claude Opus 5 के 6.7% और GPT‑5.6 Sol के 2.5% से अधिक है। हालाँकि, इस परीक्षण में सभी मॉडल्स के निरपेक्ष स्कोर बहुत कम हैं, "पहले स्थान पर" का होना इस बात का संकेत नहीं है कि वे जटिल कानूनी कार्यों को विश्वसनीय ढंग से संभालने में सक्षम हैं।
HLE-Verified बहु-विषय तर्क परीक्षा में, 3.8 Flash ने 54.9% प्राप्त किया, GPT-5.6 Sol और Claude Opus 5 क्रमशः 54.5% और 54.4% प्राप्त किए, और इन तीनों के बीच अंतर इतना कम है कि इससे किसी एक मॉडल के स्थिर व्यापक लाभ का प्रमाण नहीं दिया जा सकता।
ये परिणाम मुख्य रूप से Google द्वारा अपनी व्यवस्था के अनुसार प्रकाशित किए गए हैं। मॉडल, एजेंट फ्रेमवर्क, निष्कर्षण शक्ति, उपकरणों के अधिकार और परीक्षण बजट सभी अंतिम परिणामों को प्रभावित करते हैं, इसलिए अधिक तर्कसंगत निष्कर्ष यह है: Flash स्तर के मॉडल अब कुछ महंगे फ्लैगशिप मॉडल के करीब पहुंच गए हैं, न कि Gemini पहले से ही सभी कार्यों में समग्र रूप से अग्रणी है।
"अधिक मेहनत करना" का अर्थ है अधिक बुद्धिमानी से काम करना, और संभवतः अधिक महंगा होना
Google ने 3.8 Flash क्षमता में सुधार को एक सीधा डिज़ाइन चयन के रूप में बताया है: मॉडल को "अधिक मेहनत करने" के लिए।
जटिल कार्यों के सामने, यह अधिक मध्यवर्ती तर्क कदमों का उपयोग करता है, उपकरणों को बार-बार बुलाता है, और पहले पूरा किए गए कार्य की सक्रिय रूप से जांच करता है। डेवलपर्स निम्न, मध्यम और उच्च तीन विचार स्तरों में से चयन कर सकते हैं, जिसमें मध्यम स्तर डिफ़ॉल्ट सेटिंग है; उच्च स्तर कठिन प्रोग्रामिंग और बहु-चरणीय तर्क के लिए उपयुक्त है, जबकि निम्न स्तर रीयल-टाइम चैट, ड्राफ्ट जनरेशन और लेटेंसी-संवेदनशील कार्यों के लिए उपयुक्त है।
यह एजेंट के जल्दी रुकने, चरणों को छोड़ देने या एक टूल कॉल विफल होने के बाद लक्ष्य से पूरी तरह भटक जाने की संभावना को कम करता है, लेकिन इससे अधिक टोकन का उपयोग होता है।
Artificial Analysis के स्वतंत्र परीक्षण में, 3.8 Flash ने उच्च विचार स्तर पर 59 अंक का बुद्धिमत्ता सूचकांक प्राप्त किया, जो 3.7 Flash से 3 अंक अधिक है और GPT-5.6 Sol के अधिकतम निष्कर्षण कॉन्फ़िगरेशन के समान स्तर पर है। इसकी औसत आउटपुट गति लगभग 300 टोकन प्रति सेकंड है, और प्रत्येक परीक्षण पूरा करने में औसतन 2.5 मिनट लगते हैं।
लेकिन 3.8 Flash का औसत आउटपुट टोकन लगभग 30% बढ़ गया है, और एजेंट मूल्यांकन में निष्पादन चक्र भी अधिक हैं। हालाँकि प्रति टोकन की कीमत में वृद्धि नहीं हुई है, इसकी औसत प्रति कार्य लागत लगभग 0.58 डॉलर है, जो 3.7 Flash की 0.40 डॉलर की तुलना में लगभग 40% अधिक है।
इसलिए, "कम कीमत" का अर्थ "प्रत्येक कार्य निश्चित रूप से सस्ता होगा" नहीं है। यदि कार्य स्वयं जटिल तर्क की आवश्यकता नहीं करता, तो 3.8 Flash को उच्च तीव्रता पर चलाने से केवल समय और लागत बढ़ सकती है। Google भी कुशलता पर ध्यान केंद्रित करने वाले प्रवाह की सिफारिश करता है, जो विचार स्तर को कम करता है, या समर्थित 3.7 Flash का उपयोग जारी रखता है।
वर्तमान निम्न कीमत केवल सीमित समय के लिए ऑफर है
As of December 31, 2026, the promotional price for Gemini 3.8 Flash is $0.75 per million input tokens and $3.75 per million output tokens, same as the current price of 3.7 Flash.
1 जनवरी, 2027 से, मानक मूल्य प्रति मिलियन इनपुट टोकन 1.50 डॉलर और आउटपुट टोकन 7.50 डॉलर हो जाएगा, जो ठीक दोगुना है। विकासक लंबे समय की लागत का आकलन करते समय प्रकाशन अवधि के मूल्य को स्थायी मूल्य नहीं मान सकते।
भविष्य के मानक मूल्य के अनुसार भी, यह कुछ फ्लैगशिप मॉडल से कम है; लेकिन लाखों टोकन उत्पन्न करने और दर्जनों टूल कॉल चलाने के लिए एजेंट के लिए, केवल प्रति मिलियन टोकन संख्या की तुलना नहीं, बल्कि पूर्ण कार्य लागत की तुलना करनी चाहिए।
साइबर संस्करण का लक्ष्य दुर्बलता की व्याख्या नहीं, बल्कि सीधे पैच प्रदान करना है।
Google ने Gemini 3.8 Flash Cyber भी लॉन्च किया है। यह सामान्य संस्करण के साथ बुनियादी क्षमताएँ साझा करता है, लेकिन इसे अधिक केंद्रित साइबर सुरक्षा प्रशिक्षण प्राप्त हुआ है और इसमें साइबर सुरक्षा सीमाएँ ढीली हैं, जिससे यह सामान्य मॉडल द्वारा अस्वीकार किए जाने वाले दुर्बलता विश्लेषण कार्यों को पूरा कर सकता है।
CyberGym वल्नरेबिलिटी डिस्कवरी बेंचमार्क में, Google ने अपने आपको अग्रणी स्तर पर पहुंचा लिया है। चूंकि CyberGym मुख्य रूप से C और C++ प्रोजेक्ट्स पर केंद्रित है, इसलिए कंपनी ने 20 प्रोग्रामिंग भाषाओं को कवर करने वाला और जटिल वास्तविक कोडबेस शामिल करने वाला एक आंतरिक परीक्षण डिज़ाइन किया, जिसमें 3.8 Flash Cyber की वल्नरेबिलिटी डिस्कवरी सफलता दर 70% से अधिक है।
दरार की खोज केवल पहला कदम है। Google ने विशेष रूप से जोर दिया कि साइबर संस्करण की प्रशिक्षण बाध्यता समस्याओं को ठीक करना है, न कि हमलों के लिए उपयोग किए जाने वाले प्रोग्राम बनाना।
Collinear द्वारा संचालित CWE-Bench पैच परीक्षण में, 3.8 Flash Cyber की पहली सबमिशन सफलता दर 47.2% थी, जबकि तुलना के लिए अग्रणी फ्लैगशिप मॉडल की सफलता दर 47.8% थी। दोनों परिणाम निकट हैं, लेकिन Google का कहना है कि Flash Cyber की चलाने की लागत कम है।
इसका अर्थ है कि साइबर सुरक्षा एजेंट का लक्ष्य “इंजीनियर्स को बताना” कि यहाँ संभावित समस्या है, से बदलकर दुर्बलता को समझना, पैच लिखना, परीक्षण चलाना और संशोधन की पुष्टि करना हो गया है। यदि परिणाम पर्याप्त विश्वसनीय हैं, तो यह सुरक्षा टीम के लिए दुर्बलता की खोज से ठीक करने के लिए लागू करने तक के समय को कम कर सकता है।
Chrome gets 2.6x correct patch, but still under testing by vendor and partners
Google ने अपने आंतरिक कोड सुरक्षा कार्यों के लिए Flash Cyber का उपयोग किया है।
क्रोम सुरक्षा टीम के अनुसार, इसके द्वारा उत्पन्न सही दुर्बलता पैच की संख्या तुलनात्मक रूप से बड़े व्यावसायिक मॉडल की तुलना में 2.6 गुना है। साइबर सुरक्षा कंपनी Wiz ने कहा कि अपने पेनेट्रेशन टेस्टिंग बेंचमार्क में, Flash Cyber की दुर्बलता रिकॉल दर अन्य अग्रणी मॉडलों की तुलना में 7.5 से 9.7 प्रतिशत अधिक है, और लागत 2.3 से 5.2 गुना कम है।
Google Cloud के वल्नरेबिलिटी रिसर्च टीम ने भी कहा कि इस मॉडल ने केवल दो घंटे से कम समय में एक महत्वपूर्ण बेसिक वल्नरेबिलिटी का पता लगा लिया, जबकि इस तरह की शोध प्रक्रियाएं सामान्यतः कई महीनों तक चल सकती हैं।
ये परिणाम वास्तविक संदर्भ के लिए प्रासंगिक हैं, लेकिन इन्हें स्वतंत्र, पुनर्लब्ध करने योग्य सार्वजनिक मूल्यांकन के रूप में नहीं लिया जा सकता। Google ने उस महत्वपूर्ण दुर्बलता की विस्तृत जानकारी, तुलनात्मक मॉडल की सूची और पूर्ण निष्पादन ट्रेस को प्रकाशित नहीं किया है; Chrome का डेटा Google के आंतरिक स्रोत से आया है और Wiz भी Fairwind का साझेदार है। इसलिए, ये साबित करते हैं कि मॉडल वास्तविक सुरक्षा कार्यों में भाग ले सकता है, लेकिन यह साबित नहीं करते कि यह सभी कोडबेस और दुर्बलता प्रकारों पर समान प्रभावशीलता के साथ स्थिर रूप से कार्य करता है।
सबसे शक्तिशाली साइबर सुरक्षा क्षमता केवल विश्वसनीय संस्थानों के लिए उपलब्ध है
Flash Cyber, Google के नवगठित Fairwind प्रोग्राम के माध्यम से प्रदान किया जाता है, जिसमें वर्तमान में 650 से अधिक प्रतिभागी हैं, जिनमें मुख्य रूप से सरकारी साइबर सुरक्षा एजेंसियाँ, महत्वपूर्ण बुनियादी ढांचा संचालक, सॉफ्टवेयर रखरखावकर्ता और बड़ी सुरक्षा कंपनियाँ शामिल हैं।
भागीदार संगठनों को आंतरिक एक्सेस करने वाले व्यक्तियों की सीमा निर्धारित करनी चाहिए और बहु-कारक प्रमाणीकरण जैसे सुरक्षा उपायों का उपयोग करना चाहिए। मॉडल को CodeMender Agent के साथ एकीकृत करने के बाद, संगठन अपने स्वयं के क्लाउड वातावरण में दुर्बलताओं को खोज सकते हैं, सत्यापित कर सकते हैं और उन्हें ठीक कर सकते हैं।
सामान्य Google Cloud ग्राहक अभी भी पब्लिक वर्जन के Gemini मॉडल के साथ CodeMender का उपयोग कर सकते हैं, लेकिन Flash Cyber की पूर्ण क्षमता तक सीधे पहुँच नहीं पा सकते।
इस "एक बेस मॉडल, दो अधिकार स्तर" के प्रकाशन दृष्टिकोण का Anthropic द्वारा Claude को Fable और Mythos में विभाजित करने के पहले के दृष्टिकोण के साथ बहुत अधिक समानता है: सामान्य प्रोग्रामिंग और विश्लेषण क्षमताओं को बाजार के लिए खोला जाता है, जबकि साइबर सुरक्षा कार्यों, जो आसानी से हमले की क्षमता में परिवर्तित हो सकते हैं, को पहचान सत्यापन, एक्सेस नियंत्रण और निरंतर निगरानी के माध्यम से प्रदान किया जाता है।
सुरक्षा में कोई स्पष्ट अपग्रेड नहीं हुआ है, लेकिन कुछ अंग्रेजी के अलावा की भाषाओं का प्रदर्शन कमजोर हो गया है
सामान्य संस्करण 3.8 Flash में रसायन, जीवविज्ञान, रेडियोधर्मी, परमाणु संबंधी विषयों और साइबर हमलों के लिए सुरक्षा प्रतिबंध शामिल हैं; साइबर संस्करण को पेशेवर रक्षा कार्यों को पूरा करने की आवश्यकता होती है, इसलिए इसके साइबर सुरक्षा प्रतिबंध कम कठोर हैं और केवल सत्यापित संगठनों के लिए उपलब्ध हैं।
Google मॉडल कार्ड के अनुसार, 3.7 Flash की तुलना में, 3.8 Flash कंपनी के अग्रणी सुरक्षा ढांचे के उच्च जोखिम वाले क्षेत्रों में कोई महत्वपूर्ण नई क्षमता नहीं दिखाता, इसलिए इसने उच्चतर जोखिम स्तर को ट्रिगर नहीं किया। इसकी Gray Swan अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन परीक्षण में सुरक्षा में सुधार भी हुआ है।
हालाँकि, मॉडल कार्ड में यह भी उल्लेख किया गया है कि 3.8 Flash, स्वचालित बहुभाषी सुरक्षा परीक्षण में 3.7 Flash की तुलना में 5.4 प्रतिशत अंक पीछे रह गया। Google के मानवीय जांच के अनुसार, अधिकांश अंतर गलत सकारात्मक या गैर-गंभीर सामग्री हैं, लेकिन पूर्ण नमूना और प्रति भाषा डेटा प्रकाशित नहीं किया गया है।
मॉडल में बड़े भाषा मॉडल की सामान्य समस्याएं भी शामिल हैं, जिनमें भ्रांतियाँ, कभी-कभी धीमी प्रतिक्रिया या समय समाप्ति, और प्रदर्शन में सुधार के लिए अत्यधिक टोकन का उपयोग शामिल है। ज्ञान की सीमा 2026 मार्च के रूप में चिह्नित है, लेकिन Google के अनुसार, कुछ क्षेत्रों में विश्वसनीय ज्ञान अभी भी लगभग 2025 जनवरी तक ही अपडेट हो सकता है; नवीनतम जानकारी के संदर्भ में अभी भी ऑनलाइन सत्यापन की आवश्यकता होती है।
असली प्रतिस्पर्धा “जो सबसे अधिक बुद्धिमान है” से “जिसे बड़े पैमाने पर उपयोग किया जा सकता है” की ओर बदल रही है
Gemini 3.8 Flash का सबसे महत्वपूर्ण पहलू यह नहीं है कि कोई एक बेंचमार्क 0.几分 में अग्रणी है, बल्कि यह है कि Google लंबे समय तक के प्रोग्रामिंग, पेशेवर विश्लेषण और स्वायत्त उपकरणों के उपयोग की क्षमताओं को Flash की कीमत श्रेणी में दबा रहा है।
फ्लैगशिप मॉडल उच्च मूल्यवान, कम आवृत्ति वाले कठिन कार्यों के लिए उपयुक्त हैं; वास्तविक रूप से उद्यम सेवा ग्राहक समर्थन, प्रोग्रामिंग पाइपलाइन, वित्तीय विश्लेषण और सुरक्षा स्कैन में चलने वाले एजेंट, दिनभर में लाखों बार कॉल कर सकते हैं। इन परिदृश्यों में, गति, प्रति इकाई लागत और प्रति कार्य सफलता अक्सर रैंकिंग में पहले स्थान से अधिक महत्वपूर्ण होती हैं।
3.8 फ्लैश इस रास्ते के विरोधाभास को भी दर्शाता है: जितना मॉडल बार-बार जांचने और लगातार काम करने में सक्षम होगा, उतना ही अधिक टोकन उत्पन्न करने की संभावना होगी, जिससे "सस्ते मॉडल" की एकल कार्य लागत बढ़ जाएगी। इसलिए भविष्य में एजेंट प्रतिस्पर्धा का केंद्र न केवल यह होगा कि कौन सबसे अच्छा उत्तर देता है, बल्कि यह भी होगा कि कौन यह निर्णय ले सकता है कि कब विचार जारी रखना है, कब उपकरणों का उपयोग करना है, और कब रुकना है।
