Anthropic ने Claude Sonnet 5.5 जारी किया है, जो उच्चतम स्तर के Opus 5.5 की क्षमताओं को कम कीमत वाले और अधिक बार उपयोग के लिए उपयुक्त दैनिक Agent मॉडल में समायोजित करने का प्रयास करता है। इसकी API मूल्य अभी भी प्रति मिलियन इनपुट/आउटपुट Token के लिए 2 डॉलर और 10 डॉलर है, लेकिन कंपनी का दावा है कि आउटपुट गति 30% से अधिक बढ़ गई है, और विशिष्ट कार्य पूरा करने के लिए आवश्यक Token कम हुए हैं, जिससे प्रति कार्य लागत में अधिकतम 30% तक की कमी हुई है। आधिकारिक परीक्षणों में, इसने Terminal‑Bench 4.0 में 70.6% का स्कोर प्राप्त किया, जो Sonnet 5 के 10.3% और Opus 5.5 के 66.4% से अधिक है; पेशेवर कार्य GDPval‑AA में भी इसने 1844 Elo प्राप्त किए, जो Opus के 1846 के करीब है। हालाँकि, "आधी कीमत वाला Opus" पूर्ण निष्कर्ष नहीं है: Artificial Analysis ने पाया कि Sonnet 5.5 सबसे उच्च निष्कर्षण तीव्रता पर प्रति प्रश्न लगभग 193,000 आउटपुट Token उत्पन्न करता है, जो इसके द्वारा परखे गए सबसे Token-भारी कॉन्फ़िगरेशन है, और प्रति प्रश्न लागत Sonnet 5 से लगभग 50% अधिक है; CodeRabbit के वास्तविक कोड समीक्षा परीक्षणों में भी देखा गया कि Sonnet 5.5 हालाँकि पिछली पीढ़ी से लगभग दोगुना तेज़ है, लेकिन Opus द्वारा पहचाने जाने वाले कठिन समस्याओं को अभी भी छोड़ देता है। इसलिए, यह Opus का समग्र प्रतिस्थापन नहीं, बल्कि स्पष्ट, पुनरावृत्ति योग्य कार्यों के लिए एक नया प्रमुख मॉडल है।लेखक, स्रोत: Anthropic
Anthropic ने Sonnet को दैनिक Agent के लिए मुख्य बना दिया है
Sonnet 5.5 是 Claude 5.5 系列的第二款模型。与一周前发布的面向复杂开放式任务的 Opus 5.5 不同,Anthropic 将其定位为处理边界清晰、需要大量重复运行的日常任务:修复程序错误、审查代码、调查资料,以及生成文档、演示文稿和电子表格。
मॉडल टेक्स्ट और इमेज इनपुट का समर्थन करता है, 100 लाख टोकन कंटेक्स्ट प्रदान करता है, और Claude वेब और मोबाइल ऐप, Anthropic API, AWS, Google Cloud और Microsoft Azure में उपलब्ध है। API का नाम हैclaude-sonnet-5-5। Anthropic ने पैरामीटर की संख्या, मॉडल आर्किटेक्चर, ट्रेनिंग डेटा और ट्रेनिंग कैलकुलेशन का खुलासा नहीं किया है, इसलिए यह निर्धारित करना असंभव है कि सुधार मूल ट्रेनिंग, पोस्ट-ट्रेनिंग, इन्फरेंस स्ट्रैटेजी या Agent टूलचेन ऑप्टिमाइजेशन में से कहाँ से आया है।
इसका Opus से अंतर केवल “कम क्षमता और सस्ती कीमत” नहीं है। Anthropic नए मॉडल विभाजन को बनाना चाहता है: Opus अपूर्ण परिभाषा वाले, लगातार निर्णय लेने की आवश्यकता वाले जटिल कार्यों के लिए है; Sonnet तो पहले से स्पष्ट कार्यों को तेजी से निष्पादित करता है और कम लागत पर कॉल की संख्या बढ़ाता है।
70.6% बनाम 10.3%, सबसे ध्यान आकर्षित करने वाला और सावधानी से समझने योग्य डेटा है
Sonnet 5.5 ने Anthropic द्वारा जारी Terminal‑Bench 4.0 परीक्षण में 70.6% प्राप्त किया, जबकि Sonnet 5 केवल 10.3% प्राप्त किया, जो Opus 5.5 के 66.4% से भी अधिक है। यह बेंचमार्क Agent को कमांड लाइन वातावरण में बहु-चरणीय पेशेवर कार्य पूरा करने की आवश्यकता है, जो कोड लिखने, टर्मिनल ऑपरेशन और उपकरणों के उपयोग के बीच समन्वय को दर्शाता है।
अन्य प्रोजेक्ट्स के सुधार इतने अत्यधिक नहीं हैं, लेकिन फिर भी स्पष्ट हैं। CursorBench 4.0 में Sonnet 5 के 34.1% से बढ़कर 55.5% हो गया, जो Opus 5.5 के 57.8% से लगभग दो प्रतिशत अंक दूर है; टूल्स के साथ Humanity’s Last Exam 54.9% से बढ़कर 64.5% हो गया; OSWorld 2.1 कंप्यूटर ऑपरेशन 57.0% से बढ़कर 80.1% हो गया, जो Opus के 81.8% के करीब है।
व्यावसायिक ज्ञान कार्य GDPval-AA में, Sonnet 5.5 को 1844 Elo मिला, जबकि Opus 5.5 को 1846 मिला; लंबे समय तक ज्ञान कार्य मूल्यांकन AA-Briefcase में, ये क्रमशः 1811 और 1822 हैं। Anthropic इस निष्कर्ष पर पहुंची है कि कुछ स्पष्ट सीमाओं वाले व्यावसायिक कार्यों के लिए अब फ्लैगशिप मॉडल को डिफ़ॉल्ट रूप से कॉल करने की आवश्यकता नहीं है।
हालाँकि, इन आंकड़ों को सरलता से "Sonnet, Opus से अधिक है" के रूप में नहीं जोड़ा जा सकता। विभिन्न प्रोजेक्ट्स द्वारा उपयोग की जाने वाली निष्कर्ष शक्ति पूरी तरह से समान नहीं है, और Anthropic ने स्पष्ट रूप से कहा है कि लंबे समय तक निर्णय बनाए रखने और खुले लक्ष्यों को संभालने वाले कार्यों में, Opus अभी भी स्पष्ट रूप से अधिक मजबूत है।
एक दिलचस्प विपरीत उदाहरण FrontierCode से आता है। Sonnet 5.5 Xhigh रीजनिंग स्ट्रेंथ पर 52.1% प्राप्त करता है, लेकिन Max पर बढ़ाने पर यह घटकर 46.2% हो जाता है। Anthropic ने समझाया कि Max मोड में मॉडल अधिक बार कोड रिव्यू सब-एजेंट्स को शुरू करता है, जिसके कारण दो बार इसका समय सीमा पार हो गई या कार्य के दायरे से बाहर का कोड बदल दिया गया, जिसके परिणामस्वरूप इसे मूल्यांकन में असफल घोषित कर दिया गया।
यह परिणाम दर्शाता है कि अधिक तर्क और अधिक एजेंट आवश्यक रूप से बेहतर उत्तर की ओर नहीं ले जाते। मॉडल अतिरिक्त जांच, कार्य के दायरे में वृद्धि, या समय बजट के थक जाने के कारण अंक खो सकता है।
प्रत्येक टोकन की कीमत में कमी नहीं हुई है, फिर भी आधिकारिक तौर पर कार्य की लागत 30% कम बताई जा रही है?
Sonnet 5.5 का खुला मूल्य Sonnet 5 के समान है: प्रति मिलियन इनपुट टोकन 2 डॉलर, आउटपुट टोकन 10 डॉलर, कैश लिखना 2.5 डॉलर, कैश पढ़ना 0.2 डॉलर, जो Opus 5.5 के संबंधित मूल्यों का आधा है।
एंथ्रोपिक का दावा है कि "एकल कार्य की लागत में अधिकतम 30% की बचत" API मूल्य सूची में कमी नहीं है, बल्कि मॉडल एक ही कार्य को पूरा करने के लिए कम चरणों और टोकन की आवश्यकता होती है। आधिकारिक रूप से इसकी उत्पादन गति 30% से अधिक बढ़ गई है; स्लैक ने आंतरिक परीक्षण में आउटपुट टोकन में लगभग 14% की कमी देखी, एटलासियन ने एजेंट की गति में अधिकतम 30% की वृद्धि की रिपोर्ट की, और लवेबल ने टूल कॉल में लगभग एक-तिहाई और शेल चलाने की संख्या में लगभग आधी कमी की रिपोर्ट की।
जब एक असेट मैनेजमेंट कंपनी ने 2,441 फाइनेंशियल क्वेश्चन-एंसवर, एक्सट्रैक्शन, एनालिसिस और प्रेडिक्शन टास्क पर टेस्ट किया, तो Sonnet 5.5 ने प्रति टास्क औसतन लगभग 121,000 टोकन का उपयोग किया, जबकि Sonnet 5 ने 497,000 का उपयोग किया। चूंकि ये सभी पार्टनर के निजी टेस्ट हैं, इसलिए बाहरी लोगों के पास टास्क की कठिनाई, प्रॉम्प्ट्स और पूर्ण आउटपुट की जांच करने का कोई तरीका नहीं है, लेकिन परिणाम मिलकर एक परिवर्तन की ओर संकेत करते हैं: नया मॉडल कम से कम बार-बार सर्च करता है, सामग्री को दोहराकर पढ़ता है या लंबे आंतरिक तर्क का संचालन नहीं करता है।
यह एजेंट के लिए विशेष रूप से महत्वपूर्ण है। पारंपरिक चैट में, एक बार में कई सौ टोकन आउटपुट का प्रभाव सीमित होता है; लेकिन लंबे समय तक चलने वाले एजेंट बार-बार संदर्भ पढ़ते हैं, टूल्स का उपयोग करते हैं और परिणाम सुधारते हैं, जिससे एक कदम की अतिरिक्तता कई चक्रों के बाद समय और लागत में महत्वपूर्ण अंतर बन सकती है।
अधिकतम निष्कर्षण तीव्रता एक अन्य लागत सत्य को उजागर करती है
Artificial Analysis के स्वतंत्र परीक्षण ने Sonnet 5.5 के उच्चतम निष्कर्ष विन्यास को 56 अंक दिए, जो इसके समग्र बुद्धिमत्ता सूचकांक में Opus 5.5 के 58 अंकों से केवल पीछे है।
लेकिन इस उपलब्धि की कीमत बहुत अधिक है: Sonnet 5.5 प्रति परीक्षण औसतन लगभग 193,000 आउटपुट टोकन उत्पन्न करता है, जो इस संस्थान द्वारा मापे गए सबसे उच्च स्तर है, जो Opus 5.5 Max और Sonnet 5 Max से लगभग 60% अधिक है और GPT‑6 Astra Max का लगभग सात गुना है। इसकी अनुमानित प्रति प्रश्न लागत 7.60 डॉलर है, जो Sonnet 5 से लगभग 50% अधिक है।
यह Anthropic के “कार्य लागत में अधिकतम 30% तक कमी” के साथ सीधे विरोधाभासी नहीं है। आधिकारिक निष्कर्ष मुख्य रूप से औसत वर्कलोड और कम निष्कर्षण तीव्रता का वर्णन करते हैं; Artificial Analysis उस स्थिति को मापता है जहां क्षमता की सीमा को प्राप्त करने के लिए Max सक्रिय किया जाता है।
दोनों परिणाम मिलकर यह दर्शाते हैं कि निष्कर्षण तीव्रता अब मॉडल उत्पाद का एक हिस्सा बन चुकी है। सोनेट 5.5 लो या मीडियम मोड में अत्यधिक लागत-कुशलता प्रदान कर सकता है; यदि ओपस के साथ प्रतिस्पर्धा के लिए निष्कर्षण तीव्रता को मैक्स पर बढ़ा दिया जाए, तो हालाँकि यह प्रति टोकन सस्ता है, लेकिन इसके द्वारा उत्पादित मात्रा अधिक होने के कारण लागत का लाभ खो सकता है।
Artificial Analysis ने यह भी पाया कि Sonnet 5.5 की तथ्यात्मक ज्ञान की सटीकता लगभग 54% है, जो Opus की 66% से कम है; विज्ञान संबंधी तर्क परियोजनाएँ भी लगभग छह प्रतिशत पीछे हैं। "Opus के करीब" का दावा मुख्य रूप से एजेंट टर्मिनल ऑपरेशन और कुछ ज्ञान-आधारित कार्यों पर आधारित है, जिसे सभी क्षमताओं पर लागू नहीं किया जा सकता।
सच्ची कोड समीक्षा में, गति का लाभ मान्य है, और फ्लैगशिप अंतर अभी भी मौजूद है
CodeRabbit ने वास्तविक ओपन सोर्स प्रोजेक्ट्स में ज्ञात त्रुटियों का उपयोग करके एक सेट ऑफ रिलीज डे टेस्ट किए।
13 कठिन कोड रिव्यू मामलों में, रीजनिंग के साथ Sonnet 5.5 ने 6 समस्याएँ ढूंढीं, जबकि Sonnet 5 ने केवल 4 ढूंढीं; दोनों की प्रभावी टिप्पणी सटीकता क्रमशः 41.2% और 40.0% है। हालाँकि, Opus 5.5 के स्टैंडर्ड मोड ने 8 और मैक्स मोड ने 10 समस्याएँ ढूंढीं, जिससे जटिल रिव्यू कार्यों में अंतर अभी भी स्पष्ट है।
44 वास्तविक Pull Request के एक अन्य सेट में, Sonnet 5.5 औसतन प्रति समीक्षा 6 मिनट 33 सेकंड लेता है, जबकि Sonnet 5 13 मिनट 31 सेकंड लेता है। पहले की तुलना में उत्पन्न टिप्पणियाँ 24% कम हैं, और निरर्थक टिप्पणियाँ केवल पिछली पीढ़ी की लगभग एक तिहाई हैं; प्रकाशित मूल्य के अनुसार, कोर मॉडल कॉल की औसत लागत लगभग 0.46 डॉलर है, जबकि Sonnet 5 के लिए यह 1.16 डॉलर है।
हालाँकि, 44 PRs का पूर्ण त्रुटि कवरेज स्कोर लेख प्रकाशित होने तक पूरा नहीं हुआ था, इसलिए वर्तमान में केवल यह पुष्टि की जा सकती है कि यह तेज़ है और कम आउटपुट देता है, लेकिन यह नहीं पुष्टि की जा सकती कि कम लिखे गए टिप्पणियों में अधिक वास्तविक समस्याएँ छूट गईं। 13 उच्च-कठिन मामलों का नमूना भी छोटा है, और CodeRabbit खुद चेतावनी देता है कि यह दिशा देखने के लिए पर्याप्त है, लेकिन सामान्य रैंकिंग निर्धारित करने के लिए पर्याप्त नहीं है।
अधिक तर्कसंगत मॉडल विभाजन है: Sonnet 5.5 प्रत्येक PR की त्वरित सामान्य समीक्षा करता है; सुरक्षा, मुख्य आर्किटेक्चर या गलतियों के लिए उच्च लागत वाले परिवर्तनों को Opus या मानव विशेषज्ञों को बढ़ाया जाता है।
विज़ुअल डिज़ाइन अब सामान्य कार्य मॉडल का बिक्री बिंदु बन रहा है
Anthropic ने Sonnet 5.5 की विजुअल डिज़ाइन क्षमता पर विशेष रूप से जोर दिया है। आधिकारिक प्रदर्शन में Sonnet 5 और 5.5 को एकल HTML फ़ाइल में 400 स्टर्लिंग्स के समूह, हवा द्वारा निर्मित बालू के ड्यून और 24 छोटे घंटियों से बने एक बड़े घंटे को बनाने के लिए दिया गया। नया मॉडल तेज़ी से एनिमेशन, परतों और इंटरफ़ेस का उत्पादन करता है।
यह टेम्पलेट के आधार पर प्रस्तुति भी उत्पन्न कर सकता है। एंथ्रोपिक ने एक आंतरिक परीक्षण में किसी सूचीबद्ध कंपनी की तिमाही प्रदर्शन सामग्री, फोन कॉल ट्रांसक्रिप्ट और दस स्लाइड टेम्पलेट प्रदान किए, जिस पर दो विशेषज्ञों ने माना कि Sonnet 5.5 का पहला संस्करण सीधे भेजा जा सकता है।
ये सभी अभी भी निर्माता द्वारा चुने गए प्रदर्शन उदाहरण हैं, और यह नहीं दर्शाता कि मॉडल प्रत्येक उद्योग टेम्पलेट को स्थिरता से समझ सकता है। जटिल ग्राफ़िक्स की डेटा सटीकता, ब्रांड नियमों और संदर्भ स्रोतों की जांच अभी भी मानव द्वारा की जानी चाहिए, लेकिन यह मॉडल की प्रतिस्पर्धा की एक नई दिशा को दर्शाता है: केवल सही सामग्री उत्पन्न करने के बजाय, यह लगभग तैयार इंटरफ़ेस और दस्तावेज़ प्रदान करने का प्रयास करता है।
सुरक्षा क्षमता में वृद्धि का अर्थ है कि कुछ अनुरोध पुराने मॉडल द्वारा संभाले जाएंगे
Sonnet 5.5 वह पहला Sonnet मॉडल है जिसे लॉन्च के समय फ्लैगशिप साइबर सुरक्षा सुरक्षा के साथ डिज़ाइन किया गया था। Anthropic के अनुसार, इसकी साइबर सुरक्षा क्षमता Opus 5 के करीब पहुँच गई है, इसलिए सामान्य वल्नरेबिलिटी फिक्स अभी भी सामान्य रूप से जारी रहेंगे, लेकिन उच्च जोखिम वाले साइबर सुरक्षा अनुरोधों को Sonnet 5 को पारदर्शी रूप से हस्तांतरित कर दिया जाएगा।
कंपनी ने लगभग 1850 परिदृश्यों में उपयोगकर्ता को भ्रमित करने, उपयोगकर्ता के हितों के विरुद्ध कार्य करने, उच्च जोखिम वाले दुरुपयोग में सहायता करने और पर्यावरणीय सीमाओं को पार करने जैसे व्यवहारों की जांच की है। आधिकारिक तौर पर कहा गया है कि नया मॉडल अधिकांश सूचकों पर Sonnet 5 के बराबर या उससे बेहतर है और सभी Claude मॉडल्स में सबसे कम सक्रिय रूप से कंटेनर की सीमाओं की परीक्षा करने वाला है।
हालांकि, ये मुख्य रूप से Anthropic के आंतरिक स्वचालित मूल्यांकन हैं, और इन्हें वास्तविक परिवेश के जोखिमों के लिए पूर्ण साबिती के रूप में नहीं माना जा सकता। कंपनी खुद मानती है कि कोई भी परीक्षण सेट सभी विफलता मॉड्स को नहीं ढूंढ सकता।
Sonnet 5.5 अभी तक का पहला Sonnet है जिसमें एंटी-डिल्यूशन क्लासिफायर शामिल किया गया है, और "विचारों को बनाए रखने" के तंत्र को विस्तारित किया गया है, ताकि अलग-अलग खातों के बीच निष्कर्षण संदर्भ स्थानांतरित न हो। सामान्य डेवलपर्स पर इसका सीमित प्रभाव है, लेकिन कुछ क्रॉस-अकाउंट Claude Code चैट वर्कफ्लो को समायोजित करने की आवश्यकता होगी।
असली बदलाव टॉप रैंकिंग नहीं है, बल्कि "पर्याप्त शक्तिशाली मॉडल" शुरू हो रहा है डिफ़ॉल्ट विकल्प के रूप में
Sonnet 5.5 ने कोई नया मॉडल आर्किटेक्चर नहीं जारी किया है, और न ही इसने Opus को समग्र रूप से पार किया है। इसका अधिक महत्व यह है कि इसने पिछले समय में फ्लैगशिप मॉडल द्वारा संभाले जाने वाले बड़े पैमाने के कार्यों को, तेज़ और प्रति Token लागत आधी वाले मध्यम स्तर के मॉडल पर स्थानांतरित कर दिया है।
जिन सिस्टम्स में रोजाना हजारों बार कस्टमर सपोर्ट, कोड रिव्यू, डेटा इन्वेस्टिगेशन और डॉक्यूमेंटेशन जेनरेशन चलते हैं, उनके लिए डिप्लॉय करने का फैसला अक्सर सिर्फ सबसे अच्छा स्कोर नहीं, बल्कि प्रत्येक टास्क के लिए कितने स्टेप्स, कितने टोकन, कितना वेटिंग टाइम और क्या एरर्स को अपग्रेड किया जा सकता है, इन बातों पर निर्भर करता है। Sonnet 5.5 का मूल्य ठीक इन मीट्रिक्स पर केंद्रित है।
