GPT-5.6-Sol, साइबर सुरक्षा क्षमताओं में Mythos को पीछे छोड़ता है, ओपन-सोर्स मॉडल्स अंतर को कम कर रहे हैं

icon MarsBit
साझा करें
AI summary iconसारांश
AI और क्रिप्टो समाचार तब ब्रेक हुआ जब यूके AI सुरक्षा संस्थान (AISI) ने 17 जुलाई, 2026 को एक रिपोर्ट जारी की, जिसमें GPT-5.6-Sol ने साइबर सुरक्षा में Claude Mythos 5 को पीछे छोड़ दिया। क्षमता का अंतर अब 4 से 7 महीने है, जो 2025 में 6 से 10 महीने से कम हो गया है। GLM-5.2 और DeepSeek V4-Pro जैसे ओपन-सोर्स मॉडल इस अंतर को तेजी से कम कर रहे हैं। मूल्यांकन में साइबर रेंज सिमुलेशन और 70 कार्यों का उपयोग किया गया। ओपन-सोर्स मॉडल इन समान कार्यों के लिए कम लागत प्रदान करते हैं। नेटवर्क अपग्रेड का प्रवृत्ति स्पष्ट है।

GPT-5.6-Sol की आक्रमण और रक्षा क्षमता Claude Mythos 5 से अधिक है!

ब्रिटिश एआई सुरक्षा संस्थान (AISI) ने 17 जुलाई को एक मूल्यांकन रिपोर्ट जारी की, जिसमें पहली बार खुले स्रोत एआई मॉडल और बंद स्रोत अग्रणी मॉडल के बीच साइबर हमलों की क्षमता में 4 से 7 महीने का अंतर मापा गया।

Open-source model

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

पिछले वर्ष के समान आंतरिक परीक्षण में, यह अंतर 6 से 10 महीने था।

Defensive window is contracting, while the offensive front is accelerating.

इस साल अप्रैल में, Mythos Preview और GPT-5.5 ने AISI के मूल्यांकन में 2023 से शुरू हुए परीक्षणों के दौरान सबसे बड़ी नेटवर्क हमला क्षमता में वृद्धि की, जिसके बाद कई देशों की सरकारों ने चेतावनी जारी की।

Open-source models have not yet replicated this jump, but their pace of catching up is faster than last year.

4 से 7 महीने: कैसे मापा गया, क्या अंतर है

AISI नेटवर्क आक्रमण क्षमता का मूल्यांकन दो प्रणालियों का उपयोग करके किया जाता है।

पहला सेट 70 छोटे कार्यों का है, जो दुर्बलता अनुसंधान, रिवर्स इंजीनियरिंग, वेब पेनेट्रेशन और क्रिप्टोग्राफी चार क्षेत्रों को कवर करता है, जिन्हें कठिनाई के आधार पर चार स्तरों में विभाजित किया गया है, जो 'तकनीकी पृष्ठभूमि वाले गैर-विशेषज्ञ' से लेकर 'दस साल से अधिक अनुभव वाले विशेषज्ञ' तक हैं।

Open-source model

दूसरा सेट साइबर रेंज है, जो मॉडल की सिमुलेटेड एंटरप्राइज नेटवर्क में बहु-चरणीय हमला श्रृंखला को स्वतंत्र रूप से निष्पादित करने की क्षमता का परीक्षण करता है। 'द लास्ट ओन्स' नामक एक परीक्षण स्थिति में 32 हमले के चरण, 4 सबनेट और लगभग 20 होस्ट शामिल हैं, और AISI का अनुमान है कि मानव विशेषज्ञ को सभी चरणों को पूरा करने में लगभग 20 घंटे लगेंगे।

Open-source model

दो प्रणालियों ने एक समान निष्कर्ष दिया:

GLM-5.2 (जून 2026 में लॉन्च) ने संकीर्ण कार्यों पर Opus 4.6 (फरवरी 2026 में लॉन्च) के समान प्रदर्शन किया, जिसमें 4 महीने का अंतर है;

साइबर रेंज पर ऑपस 4.5 (पिछले नवंबर में लॉन्च किया गया) के साथ 7 महीने का अंतर भर दिया गया।

DeepSeek V4-Pro निचले कार्यों पर Opus 4.5 के बराबर है, जिससे 5 महीने का अंतर है।

दोनों अंतर 2025 के आंतरिक मूल्यांकन में पाए गए 6 से 10 महीनों से कम हैं।

The cost gap is larger than the capability gap.

एक ही साइबर रेंज परीक्षण (1 करोड़ टोकन की सीमा), Opus 4.5 या 4.6 का उपयोग करके एक बार चलाने में लगभग 85 डॉलर लगते हैं, GLM-5.2 का उपयोग करके लगभग 46 डॉलर, और DeepSeek V4-Pro का उपयोग करके केवल 1.19 डॉलर।

दोनों मॉडल द्वारा 100% पूरा किए जा सकने वाले संकीर्ण कार्यों पर, Opus 4.6 प्रति कार्य 15.17 डॉलर खर्च करता है, GLM-5.2 6.12 डॉलर खर्च करता है;

Opus 4.5 12.50 डॉलर में, DeepSeek V4-Pro की कीमत 0.28 डॉलर है।

Same attack capability, open source and one to two orders of magnitude cheaper.

Even the security safeguards of closed-source models haven't created a gap.

AISI परीक्षण में, DeepSeek V4-Pro कभी-कभी रिवर्स इंजीनियरिंग कार्यों को अस्वीकार कर देता है, लेकिन कुछ पुनः प्रयासों से इसे आसानी से ओवरराइड किया जा सकता है।

एंथ्रोपिक का फेबल 5 एक और अधिक चरम मामला है: 9 जून को लॉन्च किया गया, और तीन दिन बाद सुरक्षा शोधकर्ता प्लिनी द लिबरेटर ने बहु-चरणीय जेलब्रेक रणनीति के साथ सुरक्षा वर्गीकरणकर्ता को पार कर लिया, जिसमें स्क्रीनशॉट्स दिखाते हैं कि मॉडल ने ऐसे दुरुपयोग कोड का उत्पादन किया जिसे रोका जाना चाहिए था।

अमेज़न शोधकर्ताओं ने बाद में एक अन्य बायपास विधि की रिपोर्ट की।

यह अमेरिकी वाणिज्य विभाग द्वारा AI मॉडल के लिए पहला निर्यात नियंत्रण आदेश था, जिससे Fable 5 19 दिनों के लिए वैश्विक स्तर पर बंद हो गया, जब तक कि Anthropic ने एक नया वर्गीकरण उपकरण स्थापित नहीं कर दिया।

Closed source does not automatically equal security.

डिफेंस विंडो संकुचित हो रहा है, डिफेंस टूल्स भी तेज हो रहे हैं

AISI ने रिपोर्ट में नीति संकेत स्पष्ट किए: प्रतिरक्षा के लिए तैयारी का समय पिछले वर्ष की तुलना में कम है।

The UK's National Cyber Security Centre has urged organizations to strengthen their cybersecurity baseline and leverage AI to enhance defenses.

The same generation of AI tools is also accelerating work on the defense side.

ग्लेन फिडलर, गेम नेटवर्क प्रोग्रामिंग के क्षेत्र में एक अनुभवी डेवलपर, जिन्होंने बीस वर्षों तक शिक्षात्मक लेख लिखे हैं, ने हाल ही में अपने चार ओपन सोर्स नेटवर्क लाइब्रेरीज़ (yojimbo, netcode, reliable, serialize — जिनके कुल 6000 GitHub स्टार हैं और जो गेमिंग क्षेत्र में काफी प्रभावशाली पुराने ओपन सोर्स लाइब्रेरीज़ हैं) के लिए एक व्यवस्थित सुरक्षा ऑडिट किया: libFuzzer टारगेट डिप्लॉय किए, AddressSanitizer और MemorySanitizer CI को लाइव किया, कई मिलियन इटरेशन की स्ट्रेस टेस्टिंग की, और प्रत्येक पंक्ति कोड की समीक्षा की।

Open-source model

ग्लेन फिडलर

दो सप्ताह में 43 सुरक्षा विफलताओं को ठीक कर दिया गया, जिनमें से 27 नेटवर्क के माध्यम से दूरस्थ रूप से पहुँचने योग्य हैं।

Open-source model

सबसे गंभीर बात यह है कि yojimbo में 2019 से एक रिमोट हीप ओवरफ्लो मौजूद है—दुर्भावनापूर्ण क्लाइंट इसे विशिष्ट पैकेट बनाकर ट्रिगर कर सकते हैं।

Open-source model

पूरे ऑडिट की टोकन लागत लगभग 2500 डॉलर है।

Open-source model

आक्रमण और रक्षा दोनों ओर AI द्वारा तेजी से विकसित हो रहे हैं, लेकिन तेजी का तरीका असममित है।

अतिक्रमण क्षमता का प्रसार अपरिवर्तनीय है: ओपन सोर्स मॉडल वेट्स को जैसे ही जारी किया जाता है, उसे वापस नहीं लिया जा सकता, सुरक्षा बाधाएँ हटाई जा सकती हैं, और प्रतियाँ निजी सर्वरों पर बिना किसी निगरानी के चलाई जा सकती हैं।

लेकिन रक्षात्मक उपकरणों के लगाव के लिए प्रत्येक टीम को सक्रिय रूप से समय और लागत लगानी होगी।

AISI रिपोर्ट में एक वाक्य इस संरचना को दर्शाता है: "जैसे ही ओपन सोर्स जारी किया जाएगा, ये विकल्प स्थायी रूप से खो जाएंगे।"

इस डेटा सेट का एजीआई लैंडस्केप पर अंकों से अधिक गहरा प्रभाव पड़ेगा।

ओपन सोर्स और प्रोप्राइटरी के बीच क्षमता का अंतर छह महीने से कम हो गया है, और "प्रोप्राइटरी एक्सक्लूसिविटी अवधि को सुरक्षा बफर के रूप में उपयोग करना" की डिफ़ॉल्ट रणनीति लगभग अक्षम हो रही है।

Fable 5 घटना में बंद स्रोत मॉडल के गार्डरेल समान रूप से कमजोर साबित हुए।

अगले चरण में, वैश्विक नीति निर्माताओं के लिए, नीति खेल की केंद्रीय समस्या अधिक तीव्र हो गई है: किस क्षमता स्तर से ऊपर के मॉडल के वजन खुले नहीं होने चाहिए।

AISI ने घोषणा की है कि वह मूल्यांकन जारी रखेगा Kimi K3 अगले ओपन सोर्स मॉडल का इंतजार कर रहा है—इस लाइन को कहाँ खींचा जाएगा, वह अगले कुछ महीनों के परीक्षण पर निर्भर करेगा।

संदर्भ:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

यह लेख वेचेन ग्रुप "न्यूज़िज़यून" से है, लेखक: ASI अपोकैलिप्स; संपादक: माको

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।