Anthropic ने 22 सितंबर को Claude Opus 5.5 जारी किया, जो Claude 5.5 श्रृंखला का पहला मॉडल है। कंपनी द्वारा दिए गए मुख्य बिंदु सीधे हैं: अधिकांश कार्यों में Claude Fable 5.1 के स्तर तक पहुँचना, और पिछली पीढ़ी Opus 5 की तुलना में 40% कम चलाने की लागत। लेकिन इस जारीकरण का वास्तविक ध्यान देने योग्य पहलू केवल कीमत और सूचीयाँ नहीं हैं, बल्कि Anthropic द्वारा परीक्षण केंद्र को लंबे समय तक के कार्यों, अपरिवर्तनीय क्रियाओं और प्रॉम्प्ट इंजेक्शन सुरक्षा की ओर आगे बढ़ाया गया है।
ऑफिशियल के अनुसार, Opus 5.5 जटिल कोडिंग, अनुसंधान और विशेषज्ञता वाले कार्यों में स्पष्ट सुधार लाता है। प्रारंभिक परीक्षणकर्ताओं में, कुछ टीमों ने इसका उपयोग करके लगभग 6.8 लाख पंक्तियों के कोड को एक दिन से कम समय में स्थानांतरित कर दिया; Anthropic ने भी बताया कि मॉडल लंबे संदर्भ और योजना की निरंतरता को बनाए रख सकता है। मामले क्षमता की सीमा को दर्शाते हैं, लेकिन सभी प्रोजेक्ट्स के औसत डिलीवरी समय के रूप में नहीं माने जा सकते। कोडबेस संरचना, परीक्षण कवरेज और मानवीय समीक्षा परिणामों को प्रभावित करते हैं।
लागत कम करना “सस्ता वर्जन फ्लैगशिप” के बराबर नहीं है, बल्कि मॉडल उपयोग की सीमाओं को पुनः परिभाषित करना है
पिछले समय, ऑपस को आमतौर पर सबसे जटिल और सबसे महंगे कार्यों के लिए छोड़ दिया जाता था, जबकि दैनिक कार्यों के लिए अधिक तेज़ मॉडल का उपयोग किया जाता था। यदि Opus 5.5 सचमुच कम लागत पर Fable 5.1 के स्तर तक पहुँचने में सक्षम है, तो व्यवसाय अपने फ्लैगशिप मॉडल का उपयोग केवल कुछ उच्च मूल्यवान अनुरोधों पर ही नहीं, बल्कि बड़ी मात्रा में कोड समीक्षा, दस्तावेज़ विश्लेषण और अनुसंधान प्रक्रियाओं के लिए कर सकते हैं।
एंथ्रोपिक का औपचारिक दावा है कि लागत 40% कम हो गई है, लेकिन यह इस बात का अनुमान नहीं लगाता कि प्रत्येक व्यवसाय का बिल भी 40% कम होगा। वास्तविक लागत इनपुट और आउटपुट की लंबाई, कैशिंग, टूल कॉल की संख्या और क्या कार्य को पुनः प्रयास करने की आवश्यकता है, इन पर निर्भर करती है। अधिक शक्तिशाली मॉडल अक्सर लंबे कार्यों के कारण अधिक कुल टोकन खपत कर सकते हैं। खरीददारों को इकाई मूल्य की तुलना करने के बजाय, अपने कार्यभार के साथ “एक कार्य पूरा करने की कुल लागत” का परीक्षण करना चाहिए।
लंबे कार्य क्षमता को भी पूरा करने की गुणवत्ता से मापा जाना चाहिए। एक बड़ी कोड स्थानांतरण से कई ऐसे प्रतीत होने वाले परिवर्तन उत्पन्न हो सकते हैं, लेकिन वास्तविक लागत में रिग्रेशन परीक्षण, निर्भरता संघर्ष, डिप्लॉयमेंट और रोलबैक शामिल हैं। यदि मॉडल को इंजीनियर्स को कुछ दिनों तक किनारे की समस्याओं को ठीक करने के लिए समय देना पड़ता है, तो गति का लाभ कम हो जाएगा। सबसे मूल्यवान मूल्यांकन में केवल कितना कोड उत्पन्न हुआ, इसके बजाय सफलता की दर, मानव हस्तक्षेप की संख्या और अपरिवर्तनीय त्रुटियों को एक साथ दर्ज किया जाना चाहिए।
Anthropic का कहना है कि Opus 5.5 को Frontier Design, METR आदि बाहरी मूल्यांकनकर्ताओं द्वारा प्रकाशन से पहले परीक्षण किया गया था। बाहरी सहभागिता विश्वसनीयता बढ़ाती है, लेकिन इसका अर्थ यह नहीं है कि सभी रिपोर्ट, मूल डेटा और परीक्षण परिवेश पूरी तरह से सार्वजनिक हो गए हैं। उपयोगकर्ताओं को अभी भी कंपनी द्वारा दिए गए परिणाम, स्वतंत्र मूल्यांकन परिणाम और अपने परिवेश में पुनरुत्पादित परिणामों में अंतर करना चाहिए।
सुरक्षा परीक्षण अब केवल छोटे प्रश्नों के अस्वीकरण दर पर नहीं, बल्कि वास्तविक दुर्घटना के रूपों पर ध्यान केंद्रित कर रहा है।
Anthropic ने बताया कि Opus 5.5 ने अपने स्वचालित व्यवहार ऑडिट में कंपनी का अब तक का सर्वश्रेष्ठ परिणाम प्राप्त किया है। परीक्षण में हजारों प्रतिकृति परिदृश्यों को शामिल किया गया है, जिसमें मुख्य रूप से यह देखा गया कि मॉडल क्या कठिनाई से वापस लिए जा सकने वाले कार्य करता है, क्या यह उपयोगकर्ता द्वारा निर्धारित सीमाओं को पार करता है, और प्रॉम्प्ट इंजेक्शन के सामने कैसे प्रतिक्रिया देता है। कंपनी ने असंभव कार्यों, अधिक लंबे समय तक चलने वाले कार्यों और वास्तविक दुर्घटनाओं पर आधारित परिदृश्यों को मूल्यांकन में शामिल किया है।
यह एजेंट-आधारित AI को उत्पादन वातावरण में लाने के बाद अनिवार्य रूप से सीखना चाहिए। पारंपरिक सुरक्षा परीक्षण अक्सर पूछते हैं कि मॉडल किसी संवेदनशील प्रश्न का उत्तर देगा या नहीं, लेकिन वेबसाइट ब्राउज़ करने, टर्मिनल को कॉल करने और फाइलों को संशोधित करने में सक्षम एजेंट के लिए जोखिम अधिकांशतः कार्रवाई श्रृंखला से आते हैं: यह गलत पूर्वधारणा पर जारी रह सकता है, या वेबपेज में मौजूद दुष्ट पाठ को आदेश के रूप में मान सकता है। एक गलत क्लिक या अधिकारों में वृद्धि, एक अनुचित उत्तर की तुलना में अधिक कठिनाई से वापस नहीं लाई जा सकती।
"कम ओवरलैप" का मतलब अभी भी "ओवरलैप नहीं होगा" नहीं है। Anthropic ने स्पष्ट रूप से मॉडल की सीमाओं को मान्यता दी है। उद्यमों को अभी भी न्यूनतम अधिकार, क्रिया पुष्टि, ट्रेसेबल लॉग, सैंडबॉक्स और रोलबैक मैकेनिज्म का उपयोग करना चाहिए। विशेष रूप से, उत्पादन डेटाबेस, भुगतान और बुनियादी ढांचे में परिवर्तन, मॉडल के सुरक्षा स्कोर में सुधार के कारण मानवीय अनुमोदन को हटाया नहीं जाना चाहिए।
यह Anthropic द्वारा "अग्रणी गति को धीमा करने" के बाद पहला मॉडल जारी करना है। कंपनी का उद्देश्य यह संकेत देना है कि क्षमताओं को बढ़ाते रहें, जबकि बाहरी मूल्यांकन और वास्तविक दुर्घटनाओं के अधिक समान सुरक्षा परीक्षणों को प्रकाशन प्रक्रिया में शामिल करें। हालाँकि, इस प्रतिबद्धता की पुष्टि केवल एक प्रकाशन में सर्वोच्च अंक के बजाय, भविष्य में विफलता के मामलों, परीक्षण विधियों और उनके निवारण प्रभावों के निरंतर प्रकाशन पर निर्भर करेगी।
उपयोगकर्ताओं के लिए, Opus 5.5 का सबसे महत्वपूर्ण परीक्षण यह नहीं है कि इसके चैट उत्तर अधिक सुंदर हैं या नहीं, बल्कि यह है कि क्या यह कई घंटों, कई उपकरणों और कई चरणों वाले कार्यों में सीमाओं को बनाए रख सकता है और जब जानकारी अपर्याप्त हो तो रुक सकता है। मॉडल बाजार की प्रतिस्पर्धा “जो अधिक बुद्धिमानी से जवाब देता है” से “जो नियंत्रित लागत पर जटिल कार्य पूरा कर सकता है” की ओर बदल रही है। कीमतों में कमी से अधिक लोगों को परीक्षण करने का मौका मिल रहा है, और सुरक्षा तथा इंजीनियरिंग अनुशासन ही यह तय करते हैं कि ये परीक्षण वास्तविक उत्पादन में प्रवेश कर पाएंगे या नहीं।
परीक्षण के दौरान, उद्यम एक सरल लेकिन कठोर तुलना सेट बना सकते हैं: एक ही सेट के वास्तविक कार्यों का उपयोग करके Opus 5, Opus 5.5 और कम लागत वाले मॉडल की तुलना करें, पूरा होने का समय, कुल लागत, परीक्षण उत्तीर्ण दर, मानव द्वारा संशोधन की मात्रा और उच्च जोखिम वाली क्रियाओं की संख्या को रिकॉर्ड करें। केवल तभी अपग्रेड का व्यावसायिक अर्थ होता है जब ये सभी सूचकांक एक साथ सुधरें। प्रकाशन दिन का प्रदर्शन संभावनाओं की खोज के लिए उपयुक्त है, लेकिन अधिकारों और बजट के निर्णय के लिए सप्ताहों तक चलने वाली आंतरिक मूल्यांकन ही उपयुक्त है।
