Claude 5.1 ने हाल ही में शुरू किया, जबकि OpenAI Astra तुरंत आ गया।
अब गूगल भी नए कदम उठा रहा है। नवीनतम अफवाहों के अनुसार, Gemini 3.8 Flash कल लॉन्च होगा।


ऐसा लगता है कि AI दुनिया में फिर से 「वर्षावधि」 आ रही है।
Gemini 3.5 Pro को रद्द कर दिया गया है, अगला बड़ा संस्करण 4.0 है
जेमिनी 3.8 फ्लैश के लॉन्च की तुलना में, अधिकांश लोग यह जानने के लिए उत्सुक हैं: जेमिनी 3.5 प्रो अंततः कब आएगा?!
माफ़ कीजिए, इंतज़ार मत करें, गूगल ने छोड़ दिया है......

I/O कॉन्फ्रेंस के घोषणा से अब तक लगभग 4 महीने बीत चुके हैं, और Gemini 3.5 Pro का विकास Flash से भी कम है।
गूगल को भी अपना बलिदान देना पड़ा।
खुशी की बात है कि Gemini 4.0 का प्री-ट्रेनिंग में उत्कृष्ट मूल्यांकन हुआ है, और पोस्ट-ट्रेनिंग भी आगे बढ़ रही है।


WSJ की इस एक्सक्लूसिव रिपोर्ट में गेमिनी 3.8 फ्लैश (कोडनेम 'Skimaki') की शक्तिशाली प्रोग्रामिंग क्षमता की भी घोषणा की गई है।
दावा है कि गूगल के आंतरिक कोडिंग टूल Jetski के तुलनात्मक परीक्षण में, 3.8 Flash ने Opus मॉडल को पूरी तरह से हरा दिया।
और, यह मॉडल कई महीनों से विकसित किया जा रहा है, गूगल के नेतृत्व में 'भूकंप' से पहले ही।
हस्साबिस ने पद छोड़ दिया, मुख्य वैज्ञानिक जेफ डीन ने छोड़ दिया, जिससे कई लोगों को जेमिनी के भविष्य के बारे में चिंता हो रही है।

हालांकि, वर्तमान में लगता है कि सब कुछ आंतरिक रूप से व्यवस्थित ढंग से चल रहा है।
वर्तमान में, गूगल Gemini 3.8 Flash को पहले लॉन्च करने की योजना बना रहा है, क्योंकि इस मॉडल के पैरामीटर कम हैं, कम परिकलन की आवश्यकता होती है, और इससे आसानी से परिणाम प्राप्त किए जा सकते हैं।
अंदरूनी सूत्रों के मुताबिक, इस साल की शुरुआत से गूगल ने जेमिनी की कोडिंग क्षमता में सुधार के लिए अधिक मानव संसाधन और कंप्यूटिंग पावर लगाई है।
विशेष रूप से, "रिइनफोर्समेंट लर्निंग" पर निवेश बढ़ाया गया है, ताकि AI लगातार प्रयास और त्रुटि के माध्यम से नए कौशल सीख सके।
और गूगल डीपमाइंड और अन्य प्रयोगशालाएँ एक साथ कई प्रोजेक्ट्स को आगे बढ़ा रही हैं, इसलिए अगर यह एक काम नहीं करता है, तो दूसरा उसकी जगह ले सकता है।
Gemini 3.5 Pro अपेक्षाओं से कम रहा, लेकिन Gemini 4.0 अभी तक जारी नहीं हुआ है।
अब, सिलिकॉन वैली के 'दो महान' OpenAI और Anthropic, अग्रणी मॉडल और प्रोग्रामिंग एजेंट में बहुत मजबूत हैं।
Information के अनुसार, OpenAI की अगली पीढ़ी के Astra में एक नया «रिकरेंट डेप्थ» (recurrent depth) निष्कर्षण तरीका शामिल है, जिससे सोचने वाले टोकन कम होते हैं और साथ ही प्रदर्शन में भारी वृद्धि होती है।
यह वाइल्ड कार्ड, इस हफ्ते खुलेगा।

और इसी समय, गूगल को कुछ न कुछ पेश करना ही पड़ेगा।
बिल्कुल, पिरची ने अपनी प्रतिज्ञा के कुछ महीनों बाद, 3.7 Flash लॉन्च करने के अलावा, AI समुदाय को उत्साहित करने वाला कोई मॉडल नहीं जारी किया।
शायद आज रात ही, Gemini 3.8 Flash लॉन्च होगा।

जेमिनी पहली बार, वीडियो देखना सीख गया
इससे पहले कि इसे पोस्ट किया जाए, आज गूगल ने जेमिनी में एक नई क्षमता जोड़ने के लिए प्रचार शुरू किया—
एजेंट वीडियो समझ
यह सुविधा बहुत बड़ा फायदा देती है।
I/O कॉन्फ्रेंस का एक वीडियो अपलोड किया गया, जिसमें एक ही मॉडल Gemini 3.7 Flash के लिए टोकन खपत में सीधे 88% की कमी आई।

गूगल ने अपने ब्लॉग में कहा कि Gemini 3.7 Flash, 3.6 Flash और 3.5 Flash-Lite तीनों मॉडल एजेंटिक वीडियो समझ क्षमता का उपयोग कर सकते हैं, जिसका प्रवेश द्वार Google AI Studio और Gemini Enterprise Agent Platform पर उपलब्ध है।
स्टैंडर्ड वीडियो विश्लेषण बेंचमार्क पर इस स्विच को ऑन करें, टोकन उपयोग में अधिकतम 88% की कमी, विश्लेषण लागत में अधिकतम 66% की कमी, और सटीकता में अधिकतम 7% की वृद्धि।

और कोई अतिरिक्त शुल्क नहीं, मानक API टोकन मूल्यांकन का ही पालन किया जा रहा है। बचत और सटीकता आमतौर पर आमने-सामने होती हैं। इस बार नहीं हुआ।

क्योंकि Gemini ने "प्रगति बार खींचना" सीख लिया है।
पिछली प्रक्रिया को "स्थिर" प्रक्रिया कहा जाता था, जिसमें मॉडल निश्चित फ्रेम रेट के साथ चित्र प्रवाह को निष्क्रिय रूप से स्वीकार करता है, जहाँ फ्रेम रेट API पैरामीटर द्वारा स्थिर होती है, और मॉडल के पास कोई बातचीत का अधिकार नहीं होता।
अब मॉडल खुद फैसला करता है कि कौन सा अनुच्छेद देखना है, किस गति से देखना है, क्या दृश्य देखना है, ऑडियो सुनना है या सीधे ट्रांसक्रिप्ट पढ़ना है।

यह पहली बार नहीं है जब गूगल ऐसा कर रहा है।
पिछले एजेंटिक विजन ने कोड निष्पादन और जेमिनी की मूल छवि समझ को जोड़ा, जिससे मॉडल एक छवि के साथ खुद कोड लिखकर उसे बढ़ा सकता है, काट सकता है और तुलना कर सकता है।
अब वीडियो की बारी है, वही दृष्टिकोण, केवल उपकरण को मूल वीडियो उपकरणों से बदल दिया गया है।
चार काम जो पहले करना मुश्किल थे
ऑफिशियल ब्लॉग में कुछ कठिन अनुप्रयोग परिदृश्यों की सूची भी दी गई है।
अल्प सेकंड के खंडों की खोज। पिछले मॉडल वीडियो को "देखते" थे, एक सेकंड में केवल एक छवि काटते थे। समस्या यह है कि कई चीजें एक सेकंड से कम में ही गुजर जाती हैं।
अब इन क्षणों को एक सेकंड से कम के लिए सटीकता से लोकेट किया जा सकता है।
इसका मतलब है कि "ऑटो कटिंग" की बात पहली बार वास्तविक रूप से संभव हो गई है: पहले एडिटर को समय रेखा पर अपना सिर झुकाकर, एक-एक करके फ्रेम देखकर यह तय करना पड़ता था कि कहाँ काटना है, अब वे पहले मॉडल को स्कैन करने दे सकते हैं, जो उम्मीदवार कट पॉइंट्स को मार्क कर देगा, और फिर इंसान चुन सकता है।

लंबे वीडियो में सुई ढूंढना। कई घंटों के सामग्री में एक जटिल प्रश्न पूछें, बिना कई मिलियन टोकन खर्च किए।
असामान्यता का पता लगाना। मॉडल किसी समय अवधि पर ध्यान केंद्रित करने के बाद, इस अवधि के लिए फ्रेम रेट बढ़ाकर पुनः नमूना लिया जा सकता है, ताकि तेज़ गति और सूक्ष्म चित्र दोष स्पष्ट रूप से देखे जा सकें। उत्पादन लाइन की गुणवत्ता जांच और सुरक्षा निगरानी के लिए यह सबसे उपयुक्त है, क्योंकि असामान्यताएं आमतौर पर केवल कुछ सेकंड में ही होती हैं।
गिनें। एक क्रिया कितनी बार दोहराई गई, दृश्य में कितने अलग-अलग वस्तुएँ हैं, इस तरह के प्रश्नों के लिए मॉडल पिछले समय में स्थिर रूप से गलत रहे, कारण बहुत सरल है—अनदेखी की गई कुछ फ्रेम्स में ठीक वस्तुएँ थीं।

एजेंट अंततः वीडियो देखने लगा
वीडियो, हमेशा सभी मोड्स में सबसे महंगा रहा है।
टेक्स्ट सस्ता है, इमेजेस ठीक हैं, वीडियो बड़े और लंबे हैं, एक मिनट का वीडियो एक किताब के टोकन को खत्म कर देता है।
इसलिए पिछले दो वर्षों में सभी एजेंट के बारे में बात कर रहे हैं, अधिकतर यहीं तक कि यह पढ़ सकता है, लिख सकता है, और उपकरणों का उपयोग कर सकता है।
समस्या यह है कि एक ऐसा एजेंट, जो दुनिया को समझने के लिए मुख्य रूप से पाठ पर निर्भर करता है, वास्तव में केवल एक ऐसी दुनिया देखता है जिसे किसी ने 「अनुवादित」 कर दिया है।
कैमरे द्वारा लिया गया, मीटिंग में रिकॉर्ड किया गया, उत्पादन लाइन से गुजरने वाला, जो कोई भी टाइम नहीं देना चाहता कि उसे टेक्स्ट में बदल दिया जाए, इसे कुछ पता नहीं।
अब, इस लागत वक्र को बहुत ज्यादा काट दिया गया है।
एक एजेंट अगर कुछ घंटों की निगरानी, कई दर्जन घंटों के कोर्स और सैकड़ों मीडिया फाइल्स को खुद से पूरा कर सकता है और बजट भी खत्म नहीं होता, तो उसका दुनिया से संपर्क करने का तरीका बदल जाता है।
इसे अब चित्र को शब्दों में बदलकर खुद को देने के लिए इंतजार करने की जरूरत नहीं है, और न ही इसे "देखने योग्य" और "देखने में सटीक" के बीच चुनाव करना पड़ता है।
गूगल ने इस ब्रेकथ्रू को पहले किया।
AI की लड़ाई, अगला राउंड
इन दिनों, चारों का प्रकाशन अनुसूची लगभग एक साथ टकरा गई।
Claude 5.1 अभी आया है, OpenAI Astra पहले से ही दरवाजे पर है, और Google ने कई महीनों की प्रतीक्षा के बाद अंततः Gemini 3.8 Flash के साथ प्रतिक्रिया दी है।
इस अपडेट के बाद, क्लॉड अब दो प्रमुख क्षेत्रों पर केंद्रित है: प्रोग्रामिंग और अनुसंधान।
अगली पीढ़ी का एस्ट्रा एक 「निरंतर एजेंट」 बन जाएगा, ओटमान के शब्दों में, इसकी कंप्यूटर उपयोग क्षमता मानव स्तर तक पहुँच गई है।

Gemini 3.8 Flash कोडिंग में भी बड़ी छलांग लगाएगा।
अब, OpenAI, Anthropic, Google और SpaceXAI एक साथ पूरी ताकत से काम कर रहे हैं।

मस्क ने ग्रोक 4.7 के दस दिन बाद लॉन्च के बारे में पूर्वाभिलाष व्यक्त किया
यह लड़ाई अभी केवल सबसे खतरनाक चरण में प्रवेश कर रही है।
संदर्भ:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
यह लेख वेचेन ग्रुप "न्यूज़िज़यन" से आया है, लेखक: ASI अपोकैलिप्स
