एंथ्रोपिक ने 40% लागत कमी और लंबे कार्यों की विश्वसनीयता पर ध्यान केंद्रित करते हुए क्लॉड ओपस 5.5 लॉन्च किया

icon币界网
साझा करें
AI summary iconसारांश
एंथ्रोपिक ने 22 सितंबर, 2026 को क्लॉड ओपस 5.5 लॉन्च किया, जिसमें पिछले संस्करण की तुलना में 40% लागत कम हुई है। यह मॉडल लंबी अवधि के निवेश को सुधारकर विस्तारित कार्यों के लिए विश्वसनीयता बढ़ाता है। यह जटिल कोडिंग और शोध को संभालता है, जिसमें एक दिन से कम समय में 680,000 पंक्तियों का कोड स्थानांतरण शामिल है। इस अपडेट में प्रॉम्प्ट इंजेक्शन के खिलाफ सुरक्षा जोड़ी गई है और वास्तविक दुनिया की सुरक्षा परीक्षण पर ध्यान केंद्रित किया गया है। लागत बचत कार्य की जटिलता और उपकरणों के उपयोग पर निर्भर करती है।
CoinDesk द्वारा रिपोर्ट:

Anthropic ने 22 सितंबर को Claude Opus 5.5 जारी किया, जो Claude 5.5 श्रृंखला का पहला मॉडल है। कंपनी द्वारा दिए गए मुख्य बिंदु सीधे हैं: अधिकांश कार्यों में Claude Fable 5.1 के स्तर तक पहुँचना, और पिछली पीढ़ी Opus 5 की तुलना में 40% कम चलाने की लागत। लेकिन इस जारीकरण का वास्तविक ध्यान देने योग्य पहलू केवल कीमत और सूचीयाँ नहीं हैं, बल्कि Anthropic द्वारा परीक्षण केंद्र को लंबे समय तक के कार्यों, अपरिवर्तनीय क्रियाओं और प्रॉम्प्ट इंजेक्शन सुरक्षा की ओर आगे बढ़ाया गया है।

ऑफिशियल के अनुसार, Opus 5.5 जटिल कोडिंग, अनुसंधान और विशेषज्ञता वाले कार्यों में स्पष्ट सुधार लाता है। प्रारंभिक परीक्षणकर्ताओं में, कुछ टीमों ने इसका उपयोग करके लगभग 6.8 लाख पंक्तियों के कोड को एक दिन से कम समय में स्थानांतरित कर दिया; Anthropic ने भी बताया कि मॉडल लंबे संदर्भ और योजना की निरंतरता को बनाए रख सकता है। मामले क्षमता की सीमा को दर्शाते हैं, लेकिन सभी प्रोजेक्ट्स के औसत डिलीवरी समय के रूप में नहीं माने जा सकते। कोडबेस संरचना, परीक्षण कवरेज और मानवीय समीक्षा परिणामों को प्रभावित करते हैं।

लागत कम करना “सस्ता वर्जन फ्लैगशिप” के बराबर नहीं है, बल्कि मॉडल उपयोग की सीमाओं को पुनः परिभाषित करना है

पिछले समय, ऑपस को आमतौर पर सबसे जटिल और सबसे महंगे कार्यों के लिए छोड़ दिया जाता था, जबकि दैनिक कार्यों के लिए अधिक तेज़ मॉडल का उपयोग किया जाता था। यदि Opus 5.5 सचमुच कम लागत पर Fable 5.1 के स्तर तक पहुँचने में सक्षम है, तो व्यवसाय अपने फ्लैगशिप मॉडल का उपयोग केवल कुछ उच्च मूल्यवान अनुरोधों पर ही नहीं, बल्कि बड़ी मात्रा में कोड समीक्षा, दस्तावेज़ विश्लेषण और अनुसंधान प्रक्रियाओं के लिए कर सकते हैं।

एंथ्रोपिक का औपचारिक दावा है कि लागत 40% कम हो गई है, लेकिन यह इस बात का अनुमान नहीं लगाता कि प्रत्येक व्यवसाय का बिल भी 40% कम होगा। वास्तविक लागत इनपुट और आउटपुट की लंबाई, कैशिंग, टूल कॉल की संख्या और क्या कार्य को पुनः प्रयास करने की आवश्यकता है, इन पर निर्भर करती है। अधिक शक्तिशाली मॉडल अक्सर लंबे कार्यों के कारण अधिक कुल टोकन खपत कर सकते हैं। खरीददारों को इकाई मूल्य की तुलना करने के बजाय, अपने कार्यभार के साथ “एक कार्य पूरा करने की कुल लागत” का परीक्षण करना चाहिए।

लंबे कार्य क्षमता को भी पूरा करने की गुणवत्ता से मापा जाना चाहिए। एक बड़ी कोड स्थानांतरण से कई ऐसे प्रतीत होने वाले परिवर्तन उत्पन्न हो सकते हैं, लेकिन वास्तविक लागत में रिग्रेशन परीक्षण, निर्भरता संघर्ष, डिप्लॉयमेंट और रोलबैक शामिल हैं। यदि मॉडल को इंजीनियर्स को कुछ दिनों तक किनारे की समस्याओं को ठीक करने के लिए समय देना पड़ता है, तो गति का लाभ कम हो जाएगा। सबसे मूल्यवान मूल्यांकन में केवल कितना कोड उत्पन्न हुआ, इसके बजाय सफलता की दर, मानव हस्तक्षेप की संख्या और अपरिवर्तनीय त्रुटियों को एक साथ दर्ज किया जाना चाहिए।

Anthropic का कहना है कि Opus 5.5 को Frontier Design, METR आदि बाहरी मूल्यांकनकर्ताओं द्वारा प्रकाशन से पहले परीक्षण किया गया था। बाहरी सहभागिता विश्वसनीयता बढ़ाती है, लेकिन इसका अर्थ यह नहीं है कि सभी रिपोर्ट, मूल डेटा और परीक्षण परिवेश पूरी तरह से सार्वजनिक हो गए हैं। उपयोगकर्ताओं को अभी भी कंपनी द्वारा दिए गए परिणाम, स्वतंत्र मूल्यांकन परिणाम और अपने परिवेश में पुनरुत्पादित परिणामों में अंतर करना चाहिए।

सुरक्षा परीक्षण अब केवल छोटे प्रश्नों के अस्वीकरण दर पर नहीं, बल्कि वास्तविक दुर्घटना के रूपों पर ध्यान केंद्रित कर रहा है।

Anthropic ने बताया कि Opus 5.5 ने अपने स्वचालित व्यवहार ऑडिट में कंपनी का अब तक का सर्वश्रेष्ठ परिणाम प्राप्त किया है। परीक्षण में हजारों प्रतिकृति परिदृश्यों को शामिल किया गया है, जिसमें मुख्य रूप से यह देखा गया कि मॉडल क्या कठिनाई से वापस लिए जा सकने वाले कार्य करता है, क्या यह उपयोगकर्ता द्वारा निर्धारित सीमाओं को पार करता है, और प्रॉम्प्ट इंजेक्शन के सामने कैसे प्रतिक्रिया देता है। कंपनी ने असंभव कार्यों, अधिक लंबे समय तक चलने वाले कार्यों और वास्तविक दुर्घटनाओं पर आधारित परिदृश्यों को मूल्यांकन में शामिल किया है।

यह एजेंट-आधारित AI को उत्पादन वातावरण में लाने के बाद अनिवार्य रूप से सीखना चाहिए। पारंपरिक सुरक्षा परीक्षण अक्सर पूछते हैं कि मॉडल किसी संवेदनशील प्रश्न का उत्तर देगा या नहीं, लेकिन वेबसाइट ब्राउज़ करने, टर्मिनल को कॉल करने और फाइलों को संशोधित करने में सक्षम एजेंट के लिए जोखिम अधिकांशतः कार्रवाई श्रृंखला से आते हैं: यह गलत पूर्वधारणा पर जारी रह सकता है, या वेबपेज में मौजूद दुष्ट पाठ को आदेश के रूप में मान सकता है। एक गलत क्लिक या अधिकारों में वृद्धि, एक अनुचित उत्तर की तुलना में अधिक कठिनाई से वापस नहीं लाई जा सकती।

"कम ओवरलैप" का मतलब अभी भी "ओवरलैप नहीं होगा" नहीं है। Anthropic ने स्पष्ट रूप से मॉडल की सीमाओं को मान्यता दी है। उद्यमों को अभी भी न्यूनतम अधिकार, क्रिया पुष्टि, ट्रेसेबल लॉग, सैंडबॉक्स और रोलबैक मैकेनिज्म का उपयोग करना चाहिए। विशेष रूप से, उत्पादन डेटाबेस, भुगतान और बुनियादी ढांचे में परिवर्तन, मॉडल के सुरक्षा स्कोर में सुधार के कारण मानवीय अनुमोदन को हटाया नहीं जाना चाहिए।

यह Anthropic द्वारा "अग्रणी गति को धीमा करने" के बाद पहला मॉडल जारी करना है। कंपनी का उद्देश्य यह संकेत देना है कि क्षमताओं को बढ़ाते रहें, जबकि बाहरी मूल्यांकन और वास्तविक दुर्घटनाओं के अधिक समान सुरक्षा परीक्षणों को प्रकाशन प्रक्रिया में शामिल करें। हालाँकि, इस प्रतिबद्धता की पुष्टि केवल एक प्रकाशन में सर्वोच्च अंक के बजाय, भविष्य में विफलता के मामलों, परीक्षण विधियों और उनके निवारण प्रभावों के निरंतर प्रकाशन पर निर्भर करेगी।

उपयोगकर्ताओं के लिए, Opus 5.5 का सबसे महत्वपूर्ण परीक्षण यह नहीं है कि इसके चैट उत्तर अधिक सुंदर हैं या नहीं, बल्कि यह है कि क्या यह कई घंटों, कई उपकरणों और कई चरणों वाले कार्यों में सीमाओं को बनाए रख सकता है और जब जानकारी अपर्याप्त हो तो रुक सकता है। मॉडल बाजार की प्रतिस्पर्धा “जो अधिक बुद्धिमानी से जवाब देता है” से “जो नियंत्रित लागत पर जटिल कार्य पूरा कर सकता है” की ओर बदल रही है। कीमतों में कमी से अधिक लोगों को परीक्षण करने का मौका मिल रहा है, और सुरक्षा तथा इंजीनियरिंग अनुशासन ही यह तय करते हैं कि ये परीक्षण वास्तविक उत्पादन में प्रवेश कर पाएंगे या नहीं।

परीक्षण के दौरान, उद्यम एक सरल लेकिन कठोर तुलना सेट बना सकते हैं: एक ही सेट के वास्तविक कार्यों का उपयोग करके Opus 5, Opus 5.5 और कम लागत वाले मॉडल की तुलना करें, पूरा होने का समय, कुल लागत, परीक्षण उत्तीर्ण दर, मानव द्वारा संशोधन की मात्रा और उच्च जोखिम वाली क्रियाओं की संख्या को रिकॉर्ड करें। केवल तभी अपग्रेड का व्यावसायिक अर्थ होता है जब ये सभी सूचकांक एक साथ सुधरें। प्रकाशन दिन का प्रदर्शन संभावनाओं की खोज के लिए उपयुक्त है, लेकिन अधिकारों और बजट के निर्णय के लिए सप्ताहों तक चलने वाली आंतरिक मूल्यांकन ही उपयुक्त है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।