गूगल कल जेमिनी 3.8 फ्लैश लॉन्च करेगा, जिसका ध्यान कोडिंग और वीडियो समझ पर केंद्रित होगा

icon MarsBit
साझा करें
AI summary iconसारांश
गूगल कल जेमिनी 3.8 फ्लैश लॉन्च करने जा रहा है, जो AI क्षेत्र में एक प्रमुख टोकन लॉन्च की समाचार घटना है। 'स्किमाकी' नामक इस मॉडल में कोडिंग और वीडियो समझ में सुधार हुआ है और टोकन उपयोग में अधिकतम 88% तक की कमी हुई है। जेमिनी 3.5 प्रो को रद्द कर दिया गया है, और विकास जेमिनी 4.0 पर स्थानांतरित कर दिया गया है। ऑन-चेन समाचारों से पता चलता है कि गूगल डायनामिक कंटेंट विश्लेषण के लिए एजेंटिक वीडियो समझ भी पेश कर रहा है।

Claude 5.1 ने हाल ही में शुरू किया, जबकि OpenAI Astra तुरंत आ गया।

अब गूगल भी नए कदम उठा रहा है। नवीनतम अफवाहों के अनुसार, Gemini 3.8 Flash कल लॉन्च होगा।

Google

Google

ऐसा लगता है कि AI दुनिया में फिर से 「वर्षावधि」 आ रही है।

Gemini 3.5 Pro को रद्द कर दिया गया है, अगला बड़ा संस्करण 4.0 है

जेमिनी 3.8 फ्लैश के लॉन्च की तुलना में, अधिकांश लोग यह जानने के लिए उत्सुक हैं: जेमिनी 3.5 प्रो अंततः कब आएगा?!

माफ़ कीजिए, इंतज़ार मत करें, गूगल ने छोड़ दिया है......

Google

I/O कॉन्फ्रेंस के घोषणा से अब तक लगभग 4 महीने बीत चुके हैं, और Gemini 3.5 Pro का विकास Flash से भी कम है।

गूगल को भी अपना बलिदान देना पड़ा।

खुशी की बात है कि Gemini 4.0 का प्री-ट्रेनिंग में उत्कृष्ट मूल्यांकन हुआ है, और पोस्ट-ट्रेनिंग भी आगे बढ़ रही है।

Google

Google

WSJ की इस एक्सक्लूसिव रिपोर्ट में गेमिनी 3.8 फ्लैश (कोडनेम 'Skimaki') की शक्तिशाली प्रोग्रामिंग क्षमता की भी घोषणा की गई है।

दावा है कि गूगल के आंतरिक कोडिंग टूल Jetski के तुलनात्मक परीक्षण में, 3.8 Flash ने Opus मॉडल को पूरी तरह से हरा दिया।

और, यह मॉडल कई महीनों से विकसित किया जा रहा है, गूगल के नेतृत्व में 'भूकंप' से पहले ही।

हस्साबिस ने पद छोड़ दिया, मुख्य वैज्ञानिक जेफ डीन ने छोड़ दिया, जिससे कई लोगों को जेमिनी के भविष्य के बारे में चिंता हो रही है।

Google

हालांकि, वर्तमान में लगता है कि सब कुछ आंतरिक रूप से व्यवस्थित ढंग से चल रहा है।

वर्तमान में, गूगल Gemini 3.8 Flash को पहले लॉन्च करने की योजना बना रहा है, क्योंकि इस मॉडल के पैरामीटर कम हैं, कम परिकलन की आवश्यकता होती है, और इससे आसानी से परिणाम प्राप्त किए जा सकते हैं।

अंदरूनी सूत्रों के मुताबिक, इस साल की शुरुआत से गूगल ने जेमिनी की कोडिंग क्षमता में सुधार के लिए अधिक मानव संसाधन और कंप्यूटिंग पावर लगाई है।

विशेष रूप से, "रिइनफोर्समेंट लर्निंग" पर निवेश बढ़ाया गया है, ताकि AI लगातार प्रयास और त्रुटि के माध्यम से नए कौशल सीख सके।

और गूगल डीपमाइंड और अन्य प्रयोगशालाएँ एक साथ कई प्रोजेक्ट्स को आगे बढ़ा रही हैं, इसलिए अगर यह एक काम नहीं करता है, तो दूसरा उसकी जगह ले सकता है।

Gemini 3.5 Pro अपेक्षाओं से कम रहा, लेकिन Gemini 4.0 अभी तक जारी नहीं हुआ है।

अब, सिलिकॉन वैली के 'दो महान' OpenAI और Anthropic, अग्रणी मॉडल और प्रोग्रामिंग एजेंट में बहुत मजबूत हैं।

Information के अनुसार, OpenAI की अगली पीढ़ी के Astra में एक नया «रिकरेंट डेप्थ» (recurrent depth) निष्कर्षण तरीका शामिल है, जिससे सोचने वाले टोकन कम होते हैं और साथ ही प्रदर्शन में भारी वृद्धि होती है।

यह वाइल्ड कार्ड, इस हफ्ते खुलेगा।

Google

और इसी समय, गूगल को कुछ न कुछ पेश करना ही पड़ेगा।

बिल्कुल, पिरची ने अपनी प्रतिज्ञा के कुछ महीनों बाद, 3.7 Flash लॉन्च करने के अलावा, AI समुदाय को उत्साहित करने वाला कोई मॉडल नहीं जारी किया।

शायद आज रात ही, Gemini 3.8 Flash लॉन्च होगा।

Google

जेमिनी पहली बार, वीडियो देखना सीख गया

इससे पहले कि इसे पोस्ट किया जाए, आज गूगल ने जेमिनी में एक नई क्षमता जोड़ने के लिए प्रचार शुरू किया—

एजेंट वीडियो समझ

यह सुविधा बहुत बड़ा फायदा देती है।

I/O कॉन्फ्रेंस का एक वीडियो अपलोड किया गया, जिसमें एक ही मॉडल Gemini 3.7 Flash के लिए टोकन खपत में सीधे 88% की कमी आई।

Google

गूगल ने अपने ब्लॉग में कहा कि Gemini 3.7 Flash, 3.6 Flash और 3.5 Flash-Lite तीनों मॉडल एजेंटिक वीडियो समझ क्षमता का उपयोग कर सकते हैं, जिसका प्रवेश द्वार Google AI Studio और Gemini Enterprise Agent Platform पर उपलब्ध है।

स्टैंडर्ड वीडियो विश्लेषण बेंचमार्क पर इस स्विच को ऑन करें, टोकन उपयोग में अधिकतम 88% की कमी, विश्लेषण लागत में अधिकतम 66% की कमी, और सटीकता में अधिकतम 7% की वृद्धि।

Google

और कोई अतिरिक्त शुल्क नहीं, मानक API टोकन मूल्यांकन का ही पालन किया जा रहा है। बचत और सटीकता आमतौर पर आमने-सामने होती हैं। इस बार नहीं हुआ।

Google

क्योंकि Gemini ने "प्रगति बार खींचना" सीख लिया है।

पिछली प्रक्रिया को "स्थिर" प्रक्रिया कहा जाता था, जिसमें मॉडल निश्चित फ्रेम रेट के साथ चित्र प्रवाह को निष्क्रिय रूप से स्वीकार करता है, जहाँ फ्रेम रेट API पैरामीटर द्वारा स्थिर होती है, और मॉडल के पास कोई बातचीत का अधिकार नहीं होता।

अब मॉडल खुद फैसला करता है कि कौन सा अनुच्छेद देखना है, किस गति से देखना है, क्या दृश्य देखना है, ऑडियो सुनना है या सीधे ट्रांसक्रिप्ट पढ़ना है।

Google

यह पहली बार नहीं है जब गूगल ऐसा कर रहा है।

पिछले एजेंटिक विजन ने कोड निष्पादन और जेमिनी की मूल छवि समझ को जोड़ा, जिससे मॉडल एक छवि के साथ खुद कोड लिखकर उसे बढ़ा सकता है, काट सकता है और तुलना कर सकता है।

अब वीडियो की बारी है, वही दृष्टिकोण, केवल उपकरण को मूल वीडियो उपकरणों से बदल दिया गया है।

चार काम जो पहले करना मुश्किल थे

ऑफिशियल ब्लॉग में कुछ कठिन अनुप्रयोग परिदृश्यों की सूची भी दी गई है।

अल्प सेकंड के खंडों की खोज। पिछले मॉडल वीडियो को "देखते" थे, एक सेकंड में केवल एक छवि काटते थे। समस्या यह है कि कई चीजें एक सेकंड से कम में ही गुजर जाती हैं।

अब इन क्षणों को एक सेकंड से कम के लिए सटीकता से लोकेट किया जा सकता है।

इसका मतलब है कि "ऑटो कटिंग" की बात पहली बार वास्तविक रूप से संभव हो गई है: पहले एडिटर को समय रेखा पर अपना सिर झुकाकर, एक-एक करके फ्रेम देखकर यह तय करना पड़ता था कि कहाँ काटना है, अब वे पहले मॉडल को स्कैन करने दे सकते हैं, जो उम्मीदवार कट पॉइंट्स को मार्क कर देगा, और फिर इंसान चुन सकता है।

Google

लंबे वीडियो में सुई ढूंढना। कई घंटों के सामग्री में एक जटिल प्रश्न पूछें, बिना कई मिलियन टोकन खर्च किए।

असामान्यता का पता लगाना। मॉडल किसी समय अवधि पर ध्यान केंद्रित करने के बाद, इस अवधि के लिए फ्रेम रेट बढ़ाकर पुनः नमूना लिया जा सकता है, ताकि तेज़ गति और सूक्ष्म चित्र दोष स्पष्ट रूप से देखे जा सकें। उत्पादन लाइन की गुणवत्ता जांच और सुरक्षा निगरानी के लिए यह सबसे उपयुक्त है, क्योंकि असामान्यताएं आमतौर पर केवल कुछ सेकंड में ही होती हैं।

गिनें। एक क्रिया कितनी बार दोहराई गई, दृश्य में कितने अलग-अलग वस्तुएँ हैं, इस तरह के प्रश्नों के लिए मॉडल पिछले समय में स्थिर रूप से गलत रहे, कारण बहुत सरल है—अनदेखी की गई कुछ फ्रेम्स में ठीक वस्तुएँ थीं।

Google

एजेंट अंततः वीडियो देखने लगा

वीडियो, हमेशा सभी मोड्स में सबसे महंगा रहा है।

टेक्स्ट सस्ता है, इमेजेस ठीक हैं, वीडियो बड़े और लंबे हैं, एक मिनट का वीडियो एक किताब के टोकन को खत्म कर देता है।

इसलिए पिछले दो वर्षों में सभी एजेंट के बारे में बात कर रहे हैं, अधिकतर यहीं तक कि यह पढ़ सकता है, लिख सकता है, और उपकरणों का उपयोग कर सकता है।

समस्या यह है कि एक ऐसा एजेंट, जो दुनिया को समझने के लिए मुख्य रूप से पाठ पर निर्भर करता है, वास्तव में केवल एक ऐसी दुनिया देखता है जिसे किसी ने 「अनुवादित」 कर दिया है।

कैमरे द्वारा लिया गया, मीटिंग में रिकॉर्ड किया गया, उत्पादन लाइन से गुजरने वाला, जो कोई भी टाइम नहीं देना चाहता कि उसे टेक्स्ट में बदल दिया जाए, इसे कुछ पता नहीं।

अब, इस लागत वक्र को बहुत ज्यादा काट दिया गया है।

एक एजेंट अगर कुछ घंटों की निगरानी, कई दर्जन घंटों के कोर्स और सैकड़ों मीडिया फाइल्स को खुद से पूरा कर सकता है और बजट भी खत्म नहीं होता, तो उसका दुनिया से संपर्क करने का तरीका बदल जाता है।

इसे अब चित्र को शब्दों में बदलकर खुद को देने के लिए इंतजार करने की जरूरत नहीं है, और न ही इसे "देखने योग्य" और "देखने में सटीक" के बीच चुनाव करना पड़ता है।

गूगल ने इस ब्रेकथ्रू को पहले किया।

AI की लड़ाई, अगला राउंड

इन दिनों, चारों का प्रकाशन अनुसूची लगभग एक साथ टकरा गई।

Claude 5.1 अभी आया है, OpenAI Astra पहले से ही दरवाजे पर है, और Google ने कई महीनों की प्रतीक्षा के बाद अंततः Gemini 3.8 Flash के साथ प्रतिक्रिया दी है।

इस अपडेट के बाद, क्लॉड अब दो प्रमुख क्षेत्रों पर केंद्रित है: प्रोग्रामिंग और अनुसंधान।

अगली पीढ़ी का एस्ट्रा एक 「निरंतर एजेंट」 बन जाएगा, ओटमान के शब्दों में, इसकी कंप्यूटर उपयोग क्षमता मानव स्तर तक पहुँच गई है।

Google

Gemini 3.8 Flash कोडिंग में भी बड़ी छलांग लगाएगा।

अब, OpenAI, Anthropic, Google और SpaceXAI एक साथ पूरी ताकत से काम कर रहे हैं।

Google

मस्क ने ग्रोक 4.7 के दस दिन बाद लॉन्च के बारे में पूर्वाभिलाष व्यक्त किया

यह लड़ाई अभी केवल सबसे खतरनाक चरण में प्रवेश कर रही है।

संदर्भ:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

यह लेख वेचेन ग्रुप "न्यूज़िज़यन" से आया है, लेखक: ASI अपोकैलिप्स

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।