Anthropic Fable 5.1 API अपडेट मॉडल डिस्टिलेशन को ब्लॉक करता है

icon MarsBit
साझा करें
AI summary iconसारांश
Anthropic ने Fable 5.1 जारी किया, जो मॉडल डिस्टिलेशन को रोकने वाला एक प्रमुख API अपडेट है। यह अपडेट Claude के तर्क के अनधिकृत निकाले जाने को रोकने के लिए संदर्भ जांच जोड़ता है। परिवर्तित प्रॉम्प्ट्स का उपयोग करने वाले डेवलपर्स को त्रुटियाँ या हटाए गए ब्लॉक्स का सामना करना पड़ सकता है। नियम 31 अगस्त, 2026 के बाद के नए खातों पर लागू होंगे। संगत उपयोगकर्ताओं के लिए प्रदर्शन में सुधार हुआ है। यह BTC अपडेट और ETH अपडेट मॉडल सुरक्षा की कठोर प्रवृत्तियों के साथ समान हैं।

बड़े डिस्टिलेशन युग का अंत होने वाला है!

9 अगस्त को, Anthropic ने एक भारी प्रहार किया, जिससे API नियमों में बदलाव किया गया और बॉक्सिंग और डिस्टिलेशन करने वालों के लिए पूरी तरह से रास्ता बंद कर दिया गया।

Claude

पहले, कई कंपनियाँ विशाल कंप्यूटेशनल लागत और लंबे प्रशिक्षण समय को बचाने के लिए API के माध्यम से शीर्ष शीर्ष मॉडल की निष्कर्षण प्रक्रिया का उपयोग करती थीं और इन डेटा का उपयोग अपने 'छोटे मॉडल' को प्रशिक्षित करने के लिए करती थीं।

लेकिन आज के बाद, यह संभावना खत्म हो गई है।

Claude Fable 5.1 ने "थिंकिंग ब्लॉक" टैम्परिंग पर प्रतिबंध लगा दिया

Anthropic ने इस बार Fable 5.1 जारी किया है, जिसमें सबसे कठोरतम डिस्टिलेशन रोकथाम मैकेनिज्म शामिल है।

मुख्य कार्य, यह है कि "सोच ब्लॉक" को कसकर बंद कर दें।

What is a "Thinking Block"?

बस यह है कि AI आपको अंतिम उत्तर देने से पहले अपने मन में CoT प्रक्रिया करता है।

Claude

क्लॉड द्वारा मानसिक गणना के दौरान जटिल, समानांतर पथ

API कॉल में, Claude इन तर्क कदमों को «सोच ब्लॉक» के रूप में उपयोगकर्ता को वापस करेगा।

सामान्य बहु-चरण वार्तालाप में, डेवलपर इन विचार ब्लॉक्स को सिस्टम प्रॉम्प्ट, टूल और इतिहास संदेशों के साथ फिर से क्लॉड को भेजते हैं, ताकि मॉडल संदर्भ को याद रख सके और वार्तालाप की संगति बनाए रख सके।

लेकिन यही तंत्र वाष्पीकरणकर्ताओं के लिए अवसर बन गया।

उन्होंने एक विशाल दरार पाई: बस कई बार की बातचीत में, सोच ब्लॉक के पहले और बाद के संदर्भ को छिपाकर बदलकर (जैसे प्रारंभिक सिस्टम प्रॉम्प्ट या इतिहास के संदेशों को बदलकर), वे Claude के सुरक्षा तंत्र को तोड़ सकते हैं, और यहां तक कि Claude को उसकी मूल रूप से छिपाई गई नीचली स्तर की तर्क प्रक्रिया निकालने के लिए प्रेरित कर सकते हैं!

Claude

Claude

इस अव्यवस्था के खिलाफ, Anthropic ने Fable 5.1 में "संदर्भ संगतता सत्यापन" का नया नियम लागू किया है।

1. मूल रास्ते से वापसी, एक शब्द भी नहीं बदलें: API अब क्लाइंट द्वारा वापस भेजे गए 'थिंकिंग ब्लॉक' की पुष्टि करेगा कि क्या यह मूल रूप से उत्पन्न हुआ सिस्टम प्रॉम्प्ट, टूल और इतिहास संदेशों के साथ पूरी तरह से मेल खाता है।

2. हेरफेर किया गया? तुरंत त्रुटि! जब भी सिस्टम पाता है कि संदर्भ को संशोधित किया गया है, भले ही एक डॉट डॉट सभी मैच विफल हो जाएंगे, API तुरंत त्रुटि संदेश लौटाएगा और सेवा अस्वीकार कर देगा।

और, वैध डेवलपर्स के लिए जिन्हें वास्तव में संदर्भ को संशोधित करने की आवश्यकता है (जैसे कि लागत बचाने के लिए संदर्भ की लंबाई को संपीड़ित करना), Anthropic एक "अनिवार्य नहीं मोड" प्रदान करता है।

इस मोड में, आपका अनुरोध स्वीकार किया जाएगा, लेकिन सिस्टम «विचार ब्लॉक» को पूरी तरह से हटा देगा! मॉडल पिछली तर्क प्रक्रिया को बिल्कुल नहीं देखे, बल्कि जबरन उत्तर देगा।

यह एक वास्तविक जड़ से उखाड़ फेंकने का तरीका है।

Claude

जब क्लॉड को एक सरल और एक कठिन प्रश्न पूछा जाता है, तो विश्वसनीय तर्क और गैर-विश्वसनीय (उद्देश्यपूर्ण) तर्क के उदाहरण

Industrial-grade distillation, how crazy is it really?

Anthropic को इतना गुस्सा क्यों आया, इतनी सख्त सीमाएँ क्यों लगाईं?

उत्तर है: और अत्यंत आवश्यक।

क्योंकि वर्तमान अवैध आसवन ने औद्योगिक स्तर को प्राप्त कर लिया है।

पिछले वर्ष में, Anthropic की सुरक्षा टीम ने भयानक दुरुपयोग का अवलोकन किया।

ये पेशेवर "डिस्टिल हैकर्स" एक खाते से दिन में कुछ प्रश्न पूछने के बजाय, हजारों झूठे खातों का उपयोग करते हैं और स्वचालित स्क्रिप्ट्स के माध्यम से API एंडपॉइंट पर दिन-रात अनियंत्रित रूप से "फ्रीबी" निकालते हैं।

Claude

उनकी ऑपरेशन तकनीक अत्यधिक गुप्त और आक्रामक है।

जैसा कि पहले बताया गया, हालांकि Anthropic ने पहले ही Claude के कोर थिंकिंग ब्लॉक्स को एन्क्रिप्ट कर दिया था, लेकिन हैकर्स ने "कॉन्टेक्स्ट इंजेक्शन" और "डायलॉग रीव्राइटिंग" तकनीकों का उपयोग किया।

यह व्यवहार Claude को "धुंधला" करने जैसा है, जिससे वह तार्किक असंगति में अपनी एन्क्रिप्टेड तर्क प्रक्रिया को स्वयं डिक्रिप्ट करके प्रिंट कर दे।

इसलिए, कई छोटे पैरामीटर मॉडल ने शून्य से शुरू करके कंप्यूटेशनल पावर और एल्गोरिदम नवीनता का अनुभव नहीं किया, बल्कि केवल शीर्ष AI के उत्तर देने के तरीके को याद करके इस स्तर की प्रदर्शन क्षमता प्राप्त की।

अधिक डरावनी बात यह है कि यह अभ्यास सीधे लाल रेखा को छूता है और सुरक्षा सुनिश्चिती के पतन का कारण बनता है।

AI के नियंत्रण से बाहर होने का सबसे बड़ा खतरा

अगर व्यावसायिक हितों की हानि केवल Anthropic को "दर्द" पहुंचा रही है, तो "क्षमता और सुरक्षा का अलगाव" पूरे AI सुरक्षा समुदाय को डरा रहा है।

यही Anthropic द्वारा कड़ी कार्रवाई करने की मुख्य प्रेरणा है।

ज्ञात है कि क्लॉड, GPT-4 जैसे बड़े मॉडल, अत्यधिक बुद्धिमत्ता के साथ-साथ अत्यंत कठोर 'मूल्यवान संरेखण' और सुरक्षा प्रशिक्षण भी प्राप्त करते हैं। वे जानते हैं कि वे लोगों को बम बनाना नहीं सिखा सकते, क्षतिकारक लॉकर सॉफ्टवेयर नहीं लिख सकते, और घृणा से भरे बयान नहीं दे सकते।

इस «क्षमता + सुरक्षा बाध्यता» द्विगुण बंधन को बड़ी AI कंपनियों ने RLHF और लाल-नीले संघर्ष पर करोड़ों डॉलर खर्च करके बनाया है।

Claude

लेकिन, डिस्टिलेशन मॉडल ने इस सुरक्षा नेट को बिल्कुल बच लिया!

जब डिस्टिलेटर्स संदर्भ को बदलकर क्लॉड के 「थिंकिंग ब्लॉक्स」 को जबरदस्ती निकालते हैं, तो वे केवल उस उच्च बुद्धिमानी के 「तर्क क्षमता」 को ही निकालते हैं, लेकिन नींव की सुरक्षा को विरासत में नहीं ले पाते।

एक बुरी संगठन की तरह, जिसने आइंस्टीन की बुद्धिमत्ता को क्लोन किया है, लेकिन आइंस्टीन की नैतिकता और सहानुभूति को नहीं।

इस अवैध डिस्टिलेशन तकनीक से ट्रेन किए गए सिस्टम अचानक उनके पास होने चाहिए ऐसी उन्नत तर्क और कोडिंग क्षमताओं को विरासत में पा लेते हैं।

लेकिन चूंकि वे स्वयं एक «कम सुरक्षित, कम सुरक्षा वाला» निचले स्तर का मॉडल हैं, वे हैकर्स के अनुरोधों का बिना किसी हिचकिचाहट के जवाब देंगे, जैसे नेटवर्क हमलों के स्क्रिप्ट बनाना या जैविक हथियारों के विकास में सहायता करना।

क्षमता और सुरक्षा का अलगाव, आज के AI का सबसे बड़ा जोखिम है।

नए नियम लागू: कौन प्रभावित होता है?

इस कार्रवाई से वास्तविक डेवलपर्स प्रभावित होंगे?

डरें नहीं, एंथ्रोपिक ने न्यूनतम नुकसान के लिए सटीक "चरणबद्ध कार्वाई" रणनीति अपनाई है।

सबसे पहले, 「नया खाता」।

आधिकारिक दस्तावेज के अनुसार, इस सीमा को सबसे अधिक दुरुपयोग करने वाले नए खातों से शुरू किया जाएगा। Fable 5.1 मॉडल के लिए, यह अपडेट केवल 31 अगस्त 2026, 12:00:00 AM UTC के बाद बनाए गए नए API खातों पर लागू होगा।

निम्नलिखित लोग, आप पूरी तरह से आराम से रह सकते हैं, आप पूरी तरह प्रभावित नहीं हो रहे हैं।

1. मौजूदा API खाता: मौजूदा पुराने खाते Fable 5.1 पर अभी प्रभावित नहीं होंगे। इससे कानूनी डेवलपर्स को समायोजित करने के लिए पर्याप्त समय मिलता है।

2. उपभोक्ता उपयोगकर्ता: यदि आप केवल वेब संस्करण का उपयोग कर रहे हैं, Claude.ai, या Claude Code, Claude Cowork आदि आधिकारिक उत्पादों के C-उपभोक्ता उपयोगकर्ता हैं, या तीसरे पक्ष के ओवरले उत्पादों के माध्यम से सामान्य चैट कर रहे हैं, तो आपको कोई अवरोध नहीं होगा।

Claude

प्रभावित API डेवलपर्स के लिए आपको क्या ध्यान रखना चाहिए?

यदि आपके पिछले एप्लिकेशन एकीकरण में, आपने "संवाद के मध्य में पिछले चरणों को पुनः लिखने" की तकनीक का उपयोग किया है (जैसे कि लागत बचाने के लिए संदर्भ संपीड़न, या संवाद के मध्य में नए सिस्टम सूचनाओं को जबरन डालना), तो आपको तुरंत अपने कोड लॉजिक को समायोजित करना शुरू कर देना चाहिए।

Claude

इस परिवर्तन के लिए, Anthropic एक व्यापक स्थानांतरण मार्गदर्शिका प्रदान करता है। डेवलपर्स के पास दो विकल्प हैं।

चुनाव 1: संदर्भ की पूर्ण संगति बनाए रखें। मूल विचार ब्लॉक, सिस्टम सुझाव और उपकरणों को शब्दशः पुनः भेजें।

विकल्प 2: API अनुरोध में "अनिवार्य नहीं मोड" का चयन करें। इस मोड में, भले ही आप प्रसंग को बदल दें, API त्रुटि के साथ रुकेगा नहीं, बल्कि अनुरोध में प्रभावित विचार ब्लॉक को स्वचालित और शांति से हटा देगा।

हालांकि इससे मॉडल अगली बातचीत में पिछली विस्तृत तर्क प्रक्रिया को 'भूल जाएगा', लेकिन कम से कम आपकी बातचीत या कार्य बंद नहीं होगा।

ध्यान दें: हालाँकि वर्तमान में इस नियम के लिए छूट की अवधि है, लेकिन Anthropic ने स्पष्ट रूप से घोषणा की है कि 'रिमेम्बर द थिंकिंग' मैकेनिज्म भविष्य के मॉडल संस्करणों में सभी खातों पर लागू होगा!

The existing buffer window is also limited.

अप्रत्याशित खुशखबरी: ईमानदार लोगों के लिए फायदा

और, इस नए नियम के बाद, कानूनी डेवलपर्स के लिए एक छिपा हुआ फायदा भी है—लागत में भारी कमी और प्रतिक्रिया गति में उछाल।

यह कैसे किया गया?

The core lies in "contextual consistency".

पिछले समय में, डेवलपर्स द्वारा संदर्भ को आज़ादी से बदले जाने के कारण, मॉडल को हर बार एक 'नया' अनुरोध मिलता था। इससे न केवल कंप्यूटिंग पावर बर्बाद होती थी, बल्कि गति भी बहुत धीमी हो जाती थी।

अब, नए नियम सभी को 「सोच ब्लॉक」 और इसके आसपास के सिस्टम सुझाव, इतिहास संदेशों को पूरी तरह से अपरिवर्तित रखने के लिए अनिवार्य करते हैं।

यह तकनीकी रूप से एक आदर्श परिस्थिति बनाता है: प्रॉम्प्ट कैश को अत्यधिक आवृत्ति से हिट किया जा सकता है!

अब, API सर्वर पिछले संवाद के संदर्भ को आसानी से कैश कर सकता है। जब अगला संवाद अनुरोध आता है, तो सिस्टम कैश से डेटा को सीधे प्राप्त करता है और तुरंत मिलान पूरा करता है।

परिणामस्वरूप: API प्रतिक्रिया समय में भारी कमी, देरी सीधे गिरती है, और डेवलपर्स की API कॉल लागत में भी महत्वपूर्ण कमी होगी!

यह "बिना इच्छा के एक पेड़ लगाने" की रणनीति, सच्चे और ईमानदार डेवलपर्स को सीधे धन के रूप में सब्सिडी प्रदान करती है।

In summary, this new regulation is undoubtedly a watershed moment for the entire AI industry.

छोटे पैरामीटर वाले हथौड़े से बड़े मॉडल को तोड़ने की कहानियाँ शायद कम हो जाएँगी।

टाइड जाने के बाद, कौन नंगा तैर रहा है?

संदर्भ:

https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F

संपादित: Aeneas

यह लेख वेचेन ग्रुप "नए बुद्धि" (ID: AI_era) से आया है, लेखक: ASI उपदेश

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।