Google का Gemini 3.8 Flash कम लागत और उच्च प्रदर्शन के साथ शीर्ष AI मॉडल्स को चुनौती देता है

icon MarsBit
साझा करें
AI summary iconसारांश
टॉप अल्टकॉइन समाचार तब सामने आया जब गूगल ने Gemini 3.8 Flash और इसका साइबर सुरक्षा संस्करण, Gemini 3.8 Flash Cyber लॉन्च किया। यह मॉडल एकल कार्यों के लिए प्रति मिलियन टोकन $0.58 और इनपुट के लिए $0.75 पर पहुँचता है, जो GPT-5.6 Sol और Grok 4.6 को पार कर जाता है या उनके बराबर होता है। Gemini 3.8 Flash Cyber CyberGym परीक्षणों में 86.2% स्कोर करता है और दो घंटे में महत्वपूर्ण दोषों को पहचानता है। गूगल का गति, कम लागत और क्रमिक तर्क पर ध्यान केंद्रित करना AI + क्रिप्टो समाचार के मैदान में हलचल मचा रहा है, जो 'बड़ा ही बेहतर' मॉडल को चुनौती दे रहा है।

बिल्कुल अभी, गूगल वापस आ गया!

आज रात, गूगल ने Gemini 3.8 Flash और साइबर सुरक्षा पर ध्यान केंद्रित करने वाले Gemini 3.8 Flash Cyber को आधिकारिक रूप से लॉन्च किया।

यह गूगल द्वारा केवल छह सप्ताह में जारी किया गया तीसरा Flash संस्करण है।

पिछले दो अपडेट्स केवल गर्मी के लिए लगते थे, क्योंकि इस बार, गूगल सीधे अनुपातिक मूल्य को सबसे आगे ले आया है—

एकल कार्य लागत 0.58 डॉलर! केवल 0.75 डॉलर/मिलियन टोकन!

यह एक ऐसा छोटा मॉडल है जिसकी कीमत बहुत कम है, लेकिन यह कई मुख्य बेंचमार्क परीक्षणों में वैश्विक सर्वश्रेष्ठ फ्लैगशिप Opus 5, GPT-5.6 Sol और Grok 4.6 तक पहुँच गया है।

गूगल डीपमाइंड के विशेषज्ञ याओ शुनयू ने कहा: मॉडल के लिए, यह केवल एक छोटा कदम है; लेकिन RSI के लिए, यह एक विशाल कूद है।

Google

X पर, डेवलपर्स बहुत उत्तेजित हैं।

किसी ने वास्तविक परीक्षण के बाद आत्मा को सवाल पूछा: "अरे भगवान, क्या गूगल ने गलत सामान भेज दिया? क्या यह वही Gemini 3.5 Pro नहीं है जिसे अब तक जारी नहीं किया गया था? Flash की कीमत पर, Pro का काम कर रहा है!"

Google

Google

डीपमाइंड टीम में, शायद किसी ने जुलाई से एक भी आँख नहीं बंद की है।

जब सभी लोग Fable 5.1 को समझने की कोशिश कर रहे होते हैं, तो गूगल ने फिर से टेबल उलट दिया।

गूगल का "सबसे अधिक प्रतिस्पर्धी" वापस आ गया है: बेहतरीन मूल्य

लंबे समय तक चुप रहने के बाद, गूगल ने अत्यधिक प्रतिस्पर्धी तरीके से दुनिया को घोषित किया: महादुष्ट वापस आ गया है।

Google

जेमिनी 3.8 फ्लैश के प्रभाव को समझने के लिए, हमें आज के एआई बाजार के परिदृश्य को देखना होगा।

मूल रूप से, Artificial Analysis परीक्षण में अत्यंत कठोर बाधाएँ बन चुकी थीं। आपको शीर्ष स्तर की बुद्धिमत्ता (Intelligence Index लगभग 60 अंक) प्राप्त करने के लिए उच्च Token लागत का भुगतान करना होगा।

परिणामस्वरूप, Gemini 3.8 Flash एक असासी की तरह है, बिल्कुल नियमों का उल्लंघन करता है।

Artificial Analysis के हाई रीजनिंग मोड में, Gemini 3.8 Flash का IQ 59 तक पहुँच गया!

Google

यह क्या अवधारणा है? यह GPT-5.6 Sol और Grok 4.6 तक पहुँचने का केवल एक कदम है, और कुछ पहलुओं में Claude Opus 5 को पार कर गया है!

और इस सब को करने की कीमत क्या है? इसकी एकल कार्य लागत केवल 0.58 डॉलर है।

विशेष रूप से, इनपुट लागत 0.75 डॉलर/मिलियन टोकन्स और आउटपुट 3.75 डॉलर/मिलियन टोकन्स पर स्थिर है।

गूगल ने एक चित्र बनाया: बुद्धिमत्ता और लागत के पैरेटो अग्ररेखा पर, जेमिनी 3.8 फ्लैश का निरूपण करने वाला नीला बिंदु सॉफ्टवेयर इंजीनियरिंग बेंचमार्क DeepSWE के दाएँ ऊपरी कोने में स्थित है, जो दूसरे स्थान पर रहने वाले को एक गली से पीछे छोड़ देता है।

Google

Gemini 3.8 Flash न केवल बुद्धिमान है, बल्कि अविश्वसनीय रूप से तेज़ है। इसकी उत्पादन गति 305 टोकन/सेकंड तक पहुँच गई है, जबकि अगले स्तर का मॉडल केवल 154 टोकन/सेकंड तक ही पहुँच पाया है।

यह मॉडल तेज़ है, बुद्धिमान है, और इतना सस्ता है जैसे यह मुफ्त हो। यही वास्तविक रूप से मनुष्य द्वारा रोज़ाना उपयोग किया जा सकने वाला मॉडल है।

Google

विशेष रूप से लंबे अवधि के सॉफ्टवेयर इंजीनियरिंग बेंचमार्क (DeepSWE v1.1) पर, 3.8 Flash ने 73.7% का अद्भुत प्रदर्शन किया।

इस परीक्षण में, जहाँ AI को जटिल इंजीनियरिंग समस्याओं को स्वतंत्र रूप से हल करना और एंड-टू-एंड कोड लिखना है, यह अधिकांश महंगे अग्रणी बड़े मॉडल्स को पार कर गया है और लागत केवल उनका एक छोटा सा हिस्सा है।

जान लें, यह केवल «Flash» संस्करण है, «Pro» नहीं, और न ही «Ultra»।

इस बार, गूगल ने फिर से छोटे मॉडल को फ्लैगशिप मॉडल का काम छीन लिया।

किसी ने Gemini 3.8 Flash और Opus 5 को एक ही कार्य के लिए आजमाया है।

Google

इस प्रोग्रामिंग क्षमता में भारी छलांग यादृच्छिक नहीं है।

Google

इस प्रोग्रामिंग क्षमता में भारी छलांग यादृच्छिक नहीं है।

रिपोर्ट के अनुसार, गूगल के आंतरिक कोड टूल Jetski के परीक्षण में, गूगल इंजीनियर्स ने Anthropic के Opus मॉडल के बजाय 3.8 Flash का उपयोग करने को प्राथमिकता दी है।

Google

इसके पीछे गूगल ने इस साल की शुरुआत से ही रिइनफोर्समेंट लर्निंग पर भारी संसाधन लगाए हैं—यानी मॉडल ट्रेनिंग का «अंतिम बारीकियाँ» चरण, जिसमें मॉडल गलतियों के माध्यम से वास्तव में काम सीखता है।

Google DeepMind ने एक कोड टास्क फोर्स बनाया है, जो प्रोग्रामिंग मॉडल क्षमताओं को बेहतर बनाने पर केंद्रित है; इस टीम का नेतृत्व DeepMind के CTO द्वारा किया जा रहा है और सह-संस्थापक सर्गेई ब्रिन द्वारा सीधे निरीक्षण किया जा रहा है।

उनका लक्ष्य आत्म-पुनरावृत्ति विकास को जन्म देना है, जिससे प्रोग्रामिंग मॉडल को स्वचालित AI शोधकर्ता में बदल दिया जाए और पूरा अनुसंधान चक्र पूरी तरह से जुड़ जाए।

Google

आंतरिक स्मारिका में, गूगल ने सीधे कहा:

अंतिम स्प्रिंट जीतने के लिए, हमें एजेंट निष्पादन के अंतर को तुरंत भरना होगा और हमारे मॉडल को प्रमुख डेवलपर बनाना होगा।

Google

इसके अलावा, गूगल ने बैरेट जोफ को भी आकर्षित किया है—थिंकिंग मशीन्स लैब के सह-संस्थापक, जो पहले OpenAI में पोस्ट-ट्रेनिंग के प्रमुख थे, और अब वे अनुसंधान उपाध्यक्ष के रूप में प्रबलन अधिगम और पोस्ट-ट्रेनिंग के क्षेत्र की निगरानी कर रहे हैं। यह चाल स्पष्ट रूप से पूरी तरह से लड़ने का इरादा दर्शाती है।

पिछले महीने, सह-स्थापक और नोबेल पुरस्कार विजेता डेमिस हसाबिस ने सीईओ का पद छोड़ दिया, और उनके उत्तराधिकारी कोराय कावुकचुओग्लू ने तुरंत कहा: तेज़ी, तेज़ी, और फिर भी तेज़ी।

बेंचमार्क "पानी भरना", या वास्तविक क्षमता?

हालांकि, प्रशंसा के बीच, गूगल को अक्सर जल्दबाजी में शैम्पेन खोलने और बहुत जल्दी खुश होने का आरोप लगाया जाता है।

Google

सबसे अधिक नाराज़ है मेटा—

Meta के Muse Spark 1.3 और Gemini 3.8 Flash का सामना हुआ, जिसमें पहले को Artificial Analysis के स्मार्ट इंडेक्स पर 62 अंक मिले, जो Claude Fable 5 के बराबर है और शीर्ष स्थान पर पहुँच गया है।

और Muse की इनपुट लागत Fable 5 से 8 गुना कम है और आउटपुट लागत लगभग 12 गुना कम है, जिससे बेहतरीन मूल्य प्राप्त होता है।

मेटा के मुख्य एआई अधिकारी अलेक्सांड्र वांग ने सीधे टिप्पणी की: आर्टिफिशियल एनालिसिस स्मार्ट इंडेक्स पर, जेमिनी कुछ भी नहीं है, और दूसरे मॉडल की कार के धुएं को ही खा रहा है।

Google

Google

Muse Spark 1.3 का स्कोर GPT-5.6 Sol, Grok 4.6 और Gemini 3.8 Flash से अधिक है, लेकिन वर्तमान में यह सीमित प्रीव्यू है।

कुछ लोगों ने बताया कि हालांकि 3.8 Flash का बेंचमार्क ग्राफ़ अच्छा दिखता है, लेकिन वास्तविक उपयोग में यह जरूरी नहीं है।

वास्तव में, Gemini 3.8 Flash ने Terminal-Bench 2.1, HLE आदि परीक्षणों में GPT-5.6 Sol और Opus 5 को पार कर लिया, लेकिन TBench 2.1 और TBench 4 के बीच विशाल स्कोर अंतर इस बात को उजागर करता है कि इसमें कुछ 「स्कोर फ्रॉड」 का तत्व हो सकता है।

इसका मतलब है कि जब अज्ञात, ट्रेनिंग सेट में शामिल नहीं किए गए वास्तविक दुनिया के Zero-shot चुनौतियों का सामना करना पड़ता है, तो 3.8 Flash अधिकांशतः Opus 5 जैसे पैरामीटर विशालकाय के मुकाबले कम प्रभावी होगा।

लेकिन गूगल का समाधान अत्यंत चतुर है—परिश्रम से अज्ञानता को दूर किया जा सकता है।

जैसा कि गूगल ने अपने आधिकारिक ब्लॉग में कहा है: "इन प्रदर्शन में सुधार का कारण मूल डिजाइन विकल्प हैं: 3.8 Flash अधिक कठिनाई से काम करता है।"

जटिल कार्यों के सामने, 3.8 Flash को अतिरिक्त तर्क कदमों को निष्पादित करने और उपकरणों को बार-बार कॉल करने के लिए डिज़ाइन किया गया है। जब यह एक अज्ञात प्रश्न से भेंट होता है, तो यह सीधे तौर पर हार नहीं मानता, बल्कि अधिक टोकन का उपयोग करके आंतरिक रूप से तेज़ी से स्व-सत्यापन और प्रतिबिंब करता है।

हालांकि इसमें कई चक्रों के विचार से अधिक टोकन खर्च होते हैं, लेकिन चूंकि इसकी मूल कीमत बहुत कम है (0.75 डॉलर/मिलियन टोकन), कुल मिलाकर यह आपके द्वारा सीधे GPT-5.6 को कॉल करने से कहीं अधिक सस्ता है!

यह रणनीति पिछले "बड़े पैरामीटर = अधिक क्षमता" के एकल आयामी प्रतिस्पर्धा को सीधे तौर पर तोड़ देती है।

यह साबित करता है: एक आदर्श एजेंट चक्र में, गति और अत्यंत कम निष्कर्षण लागत, स्वयं एक शक्तिशाली बुद्धिमत्ता है।

फ्लैश क्यों भेजा गया? 'बंद कर दिया गया' Pro संस्करण

Did Google actually send the right product this time?

Gemini 3.5 Pro अभी तक किसी भी छाया के बिना है। अगली पीढ़ी का बेस्ट प्लेयर Gemini 4 का प्री-ट्रेनिंग डेटा काफी अच्छा है, लेकिन पोस्ट-ट्रेनिंग चरण अभी पूरा नहीं हुआ है।

Google

वास्तव में, गूगल द्वारा प्रो संस्करण जारी करने में देरी के पीछे एक दुखद इतिहास है।

Pai Chai ने इस साल मई में दावा किया था कि "अगले महीने" वह अधिक शक्तिशाली Pro सीरीज लॉन्च करेगा, लेकिन अब तक देरी कर रहा है।

वास्तव में, गूगल के आंतरिक रूप से कई 3.5 Pro उम्मीदवार मॉडल थे, लेकिन अंततः उन सभी को निर्दयता से रद्द कर दिया गया—क्योंकि उन्होंने वर्तमान Flash सीरीज़ की तुलना में पर्याप्त रूप से अधिक बेहतरी नहीं दिखाई!

इसी समय, अपेक्षित अगली पीढ़ी के फ्लैगशिप Gemini 4 का प्री-ट्रेनिंग मूल्यांकन अच्छा रहा है, लेकिन वर्तमान में यह सबसे महत्वपूर्ण पोस्ट-ट्रेनिंग चरण में अटका हुआ है।

इसलिए, सभी अनियमितताओं ने मिलकर Flash श्रृंखला के पागलपन भरे अपडेट को जन्म दिया।

2 घंटे में ऐसा वल्नरेबिलिटी खोज लिया गया जिसे महीनों तक नहीं पाया जा सका: साइबर सुरक्षा में टॉप पर पहुंच गया

क्या गूगल ने इस बार केवल 3.8 Flash को सामान्य कार्यों पर कीमतों पर दबाव डालने के लिए छोड़ दिया है?

Much more than that.

इस लॉन्च का वास्तविक हथियार, इसका डुप्लिकेट भाई—जेमिनी 3.8 फ्लैश साइबर है।

डेवलपर्स भी हैरान हैं: "किस तरह की सुरक्षा टास्क के लिए गूगल ने Flash के लिए एक विशेष Cyber वेरिएंट बनाया?"

गूगल का उत्तर है: भविष्य के AI हैकर्स के खिलाफ लड़ने के लिए।

CyberGym पर वल्नरेबिलिटी की जांच करते समय, 3.8 Flash Cyber ने 86.2% स्कोर प्राप्त किया और पिछले मॉडल्स को दूर छोड़कर शीर्ष स्थान प्राप्त किया।

इसके अलावा, वास्तविक दुनिया का कोड केवल C/C++ ही नहीं है।

एक जटिल कोडबेस के भीतर, जिसमें गूगल में 20 से अधिक प्रोग्रामिंग भाषाएँ शामिल थीं, इस मॉडल ने व्यापक दुर्बलताओं की पहचान करने में 70% से अधिक सफलता प्राप्त की।

और यह भी आश्चर्यजनक है कि यह वास्तविक दुनिया के व्यावहारिक परिणामों में कैसे प्रदर्शन करता है।

Chrome सुरक्षा टीम ने इसका परीक्षण किया और पाया कि यह पहले के सबसे अच्छे और काफी बड़े व्यावसायिक मॉडल की तुलना में 2.6 गुना अधिक सही ठीक करने वाले पैच उत्पन्न करता है।

Wiz सुरक्षा कंपनी के परीक्षण में पाया गया कि इसने पेनिट्रेशन टेस्टिंग में रिकॉल दर में 7.5-9.7% की वृद्धि की है, जबकि लागत 2.3 से 5.2 गुना कम हो गई है।

सबसे आश्चर्यजनक बात यह है कि गूगल क्लाउड वल्नरेबिलिटी रिसर्च टीम ने इसका उपयोग करके केवल 2 घंटे में एक महत्वपूर्ण बुनियादी वल्नरेबिलिटी का पता लगा लिया—जबकि पहले, मानव शीर्ष विशेषज्ञों को ऐसी वल्नरेबिलिटी को खोजने में आमतौर पर कई महीने लग जाते थे!

CWE-Bench (पैचिंग क्षमता परीक्षण) में, 3.8 Flash Cyber की पहली बार सफलता दर 47.2% रही, जो सबसे अग्रणी अग्रणी बड़े मॉडल (47.8%) के साथ लगभग बराबर है, लेकिन कीमत में इसका अंतर नगण्य है।

Google

क्योंकि 3.8 Flash Cyber की नेटवर्क हमला और रक्षा क्षमता अत्यधिक आश्चर्यजनक है, गूगल ने इसे पूरी तरह से ओपन सोर्स नहीं किया, बल्कि एक नए Fairwind योजना के माध्यम से केवल विश्वसनीय संस्थानों के लिए इसे उपलब्ध कराया।

OpenAI, Anthropic और Google: बड़े मॉडल्स का त्रिपक्षीय संघर्ष एक मोड़ पर है

Gemini 3.8 Flash के लॉन्च से स्पष्ट होता है कि आज के तीन प्रमुख AI दिग्गज अलग-अलग विकास राहों पर चल पड़े हैं।

Anthropic (Claude सीरीज), ज्ञान की विश्वसनीयता और स्थिरता पर फोकस करता है।

ज्ञान कवरेज और तथ्यात्मक शुद्धता पर आधारित परीक्षणों (जैसे AA-Omniscience) में, क्लॉड अभी भी एक निचले स्तर का प्रहार है।

पहले सात स्थानों पर सभी Claude परिवार के हैं, वे अब स्पष्ट रूप से उद्यम स्तर के कार्यों में गलतियों को नहीं करने की क्षमता को मजबूत कर रहे हैं और स्थिर आउटपुट की कोशिश कर रहे हैं।

OpenAI (GPT सीरीज), "गहन तर्क और अचानक बुद्धि" पर निवेश कर रहा है।

भौतिक और गणितीय निगमन पर आधारित CritPt परीक्षण में GPT-5.6 Sol ने भारी अंतर से अग्रणी स्थिति प्राप्त की।

OpenAI एक शुद्ध बुद्धिमत्ता के उदय की ओर बढ़ रहा है, जिसमें मॉडल को बिना किसी के बताए जवाब देने के लिए, स्वयं वैज्ञानिक की तरह "सोचना" होता है।

Google (Gemini सीरीज), जो "अनंत चक्र का अत्यधिक तेज़ कार्यकर्ता" बनाता है।

गूगल ने इस बार तीसरा उत्तर दिया: शायद मैं एक बार में सबसे कठिन भौतिकी के प्रश्न को नहीं सोच सकता, लेकिन मेरी प्रतिक्रिया अत्यंत तेज है और लागत अत्यंत कम है।

एजेंट के युग में, मैं एक सेकंड में 100 बार सोच सकता हूँ, कोड लिख सकता हूँ, चला सकता हूँ, त्रुटि प्राप्त कर सकता हूँ, संशोधित कर सकता हूँ, अत्यंत कम लागत पर बलपूर्वक दोहराकर सही परिणाम प्राप्त कर सकता हूँ।

Agen को वास्तविक दुनिया में समस्याओं का सामना करना पड़ता है, जिसमें बार-बार प्रयास और त्रुटि, उपकरणों का उपयोग और गतिशील समायोजन की आवश्यकता होती है।

और Gemini 3.8 Flash, जो बिल्कुल इस「लंबे कार्य प्रवाह」के लिए डिज़ाइन किया गया है।

आप Google Antigravity में केवल एक प्रॉम्प्ट शब्द और एक लूप निर्देश के साथ 3.8 Flash को एक पहेली, वातावरण टेक्सचर और 3D लेवल सहित एक पूर्ण गेम उत्पन्न करने के लिए प्रेरित कर सकते हैं।

आप इसका उपयोग करके स्ट्रीट व्यू और नेविगेशन के साथ DOS संस्करण का गूगल मैप एक क्लिक में जनरेट कर सकते हैं।

स्पष्ट रूप से, Gemini 3.8 Flash की सरलता और लागत ने किसी विशेष बिंदु को पार कर लिया है।

गेमिनी 3.8 फ्लैश के आगमन से, गूगल पूरे उद्योग को घोषणा कर रहा है: बड़े मॉडल अब 'केवल विशालकाय ही उपयोग कर सकते हैं' के बंधन से मुक्त हो रहे हैं और कैलकुलेशन सुविधा के सार्वभौमिकीकरण की ओर तेजी से बढ़ रहे हैं।

जो कार्य पहले कई लाख डॉलर की लागत और कई दिनों का समय लेते थे, अब केवल कुछ कॉफी की कीमत और कुछ मिनटों में पूरे हो जाते हैं।

सामान्य लोगों के लिए सुपर इंडिविडुअल युग असल में आ गया है।

यह छोटे मॉडल के जागरण का क्षण है।

संदर्भ:

https://x.com/alexandr_wang/status/2095266112212754659?s=20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

संपादित: एनियस डेविड

यह लेख वेचेन ग्रुप "न्यूज़िज़ियुआन" से आया है, लेखक: ASI उपदेश

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।