Anthropic ক্লাউড সনেট 5.5 প্রকাশ করেছে, যা ফ্ল্যাগশিপ ওপাস 5.5-এর কাছাকাছি ক্ষমতা কম দামের এবং হাই-ফ্রিকোয়েন্সি কলের জন্য উপযুক্ত দৈনন্দিন এজেন্ট মডেলে সংকুচিত করার চেষ্টা করছে। এর API একক মূল্য এখনও প্রতি মিলিয়ন ইনপুট/আউটপুট টোকেনের জন্য 2 ডলার এবং 10 ডলার, তবে অফিসিয়ালি দাবি করা হয়েছে যে আউটপুট গতি 30% এরও বেশি বৃদ্ধি পেয়েছে, এবং টোকেনের পরিমাণ কমেছে, যার ফলে প্রতিটি টাস্কের খরচ সর্বোচ্চ 30% পর্যন্ত কমেছে। অফিসিয়াল টেস্টে, এটি Terminal‑Bench 4.0-এ 70.6% স্কোর অর্জন করেছে, যা Sonnet 5-এর 10.3% এবং Opus 5.5-এর 66.4% -এর চেয়ে বেশি; পেশাদার টাস্ক GDPval‑AA-এও 1844 Elo-এর সাথে Opus-এর 1846-এর কাছাকাছি। তবে, “অর্ধ-মূল্যের Opus” সম্পূর্ণ উত্তর নয়: Artificial Analysis-এর মতে, Sonnet 5.5-এর সর্বোচ্চ রিজনিং ইনটেনসিটির অধীনে, 평균প্রতি প্রশ্নে 193,000টি আউটপুট টোকেন উৎপাদন করা হয়, যা তাদের পরীক্ষা করা সবচেয়ে বেশি টোকেন-খরচকারী কনফিগারেশন, এবং প্রতি প্রশ্নের খরচ Sonnet 5-এর চেয়ে 50% বেশি; CodeRabbit-এর реальный code review test-এও, Sonnet 5.5-এর speed-up Opus-এর compare-এ 100% higher, but still miss high-difficulty issues that Opus can catch. Therefore, it is more like a new flagship model suited for clear, repetitive tasks rather than a comprehensive replacement for Opus.লেখক, উৎস: Anthropic
Anthropic সনেটকে দৈনিক এজেন্টের মূল বিকল্প হিসাবে পুনরায় স্থান দিয়েছে
Sonnet 5.5 হল Claude 5.5 সিরিজের দ্বিতীয় মডেল। এক সপ্তাহ আগে প্রকাশিত এবং জটিল খোলা কাজের জন্য উপযোগী Opus 5.5-এর বিপরীতে, Anthropic এটিকে সীমাবদ্ধ, পুনরাবৃত্তি প্রয়োজনীয় দৈনন্দিন কাজগুলি পরিচালনার জন্য স্থাপন করেছে: প্রোগ্রাম ত্রুটি ঠিক করা, কোড পর্যালোচনা, গবেষণা করা, এবং ডকুমেন্টেশন, প্রেজেন্টেশন এবং স্প্রেডশিট তৈরি করা।
মডেলটি টেক্সট এবং ইমেজ ইনপুটকে সমর্থন করে, 100 লক্ষ টোকেনের কনটেক্সট প্রদান করে এবং Claude ওয়েবসাইট এবং মোবাইল অ্যাপ, Anthropic API, AWS, Google Cloud এবং Microsoft Azure-এ ব্যবহার করা যায়। API-এর নাম হলclaude-sonnet-5-5। Anthropic প্যারামিটার সংখ্যা, মডেল আর্কিটেকচার, ট্রেনিং ডেটা এবং ট্রেনিং কম্পিউটিং পাওয়ার প্রকাশ করেনি, তাই উন্নতির কারণটি মূল ট্রেনিং, পোস্ট-ট্রেনিং, ইনফারেন্স স্ট্র্যাটেজি নাকি Agent টুলচেইন অপ্টিমাইজেশনের মধ্যে কোথায় তা বিচার করা সম্ভব হয়নি।
এটি শুধুমাত্র "ক্ষমতা কম এবং দাম কম" এর পার্থক্য নয়। Anthropic একটি নতুন মডেল বিভাজন তৈরি করতে চায়: Opus অসম্পূর্ণ সংজ্ঞায়িত, নিয়মিত বিচারের প্রয়োজন হওয়া জটিল কাজগুলির জন্য দায়ী; Sonnet তখনই দ্রুত কাজ করে যখন কাজটি পরিষ্কারভাবে সংজ্ঞায়িত হয়, এবং কম খরচে কলের সংখ্যা বাড়ায়।
70.6% এবং 10.3% হল সবচেয়ে উল্লেখযোগ্য এবং সাবধানে বুঝতে হবে এমন ডেটা।
Sonnet 5.5 এ Anthropic দ্বারা প্রকাশিত Terminal‑Bench 4.0 টেস্টে 70.6% স্কোর পেয়েছে, যেখানে Sonnet 5 শুধুমাত্র 10.3% পেয়েছে, এটি Opus 5.5 এর 66.4% এর চেয়েও বেশি। এই বেঞ্চমার্কটি Agent কে কমান্ড লাইন পরিবেশে একাধিক ধাপবিশিষ্ট পেশাদার কাজ সম্পন্ন করতে বাধ্য করে, যা কোডিং, টার্মিনাল অপারেশন এবং টুল ব্যবহারের মধ্যে সমন্বয়কে প্রতিফলিত করে।
অন্যান্য প্রকল্পের উন্নতি এতটাই চমকপ্রদ নয়, তবে এখনও স্পষ্ট। CursorBench 4.0 এ Sonnet 5 এর 34.1% থেকে বেড়ে 55.5% হয়েছে, যা Opus 5.5 এর 57.8% থেকে প্রায় দুই শতাংশ দূরে; টুলসসহ Humanity’s Last Exam 54.9% থেকে বেড়ে 64.5% হয়েছে; OSWorld 2.1 কম্পিউটার অপারেশন 57.0% থেকে বেড়ে 80.1% হয়েছে, যা Opus এর 81.8% এর কাছাকাছি।
পেশাদার জ্ঞান কাজ GDPval-AA-এ, Sonnet 5.5 পেয়েছে 1844 Elo, Opus 5.5 পেয়েছে 1846; দীর্ঘসময়ের জ্ঞান কাজ মূল্যায়ন AA-Briefcase-এ, যথাক্রমে 1811 এবং 1822। এর ভিত্তিতে Anthropic মনে করে যে, কিছু সীমাবদ্ধ পেশাদার কাজের জন্য ডিফল্টভাবে ফ্ল্যাগশিপ মডেল কল করার দরকার নেই।
তবে, এই সংখ্যাগুলিকে সহজেই “Sonnet, Opus-এর চেয়ে বেশি অতিক্রম করেছে” হিসাবে একত্রিত করা যায় না। বিভিন্ন প্রকল্পগুলি বিভিন্ন মাত্রার যুক্তি ব্যবহার করে, এবং Anthropic স্পষ্টভাবে বলেছে যে দীর্ঘস্থায়ী বিচার প্রয়োজনীয় এবং খোলা লক্ষ্যগুলি পরিচালনা করার ক্ষেত্রে Opus এখনও স্পষ্টভাবে বেশি শক্তিশালী।
ফ্রন্টিয়ারকোড থেকে একটি আকর্ষণীয় বিপরীত উদাহরণ পাওয়া যায়। Xhigh রিজনিং ইন্টেনসিটির অধীনে Sonnet 5.5 52.1% পায়, কিন্তু Max-এ বাড়ানোর পর এটি 46.2% এ নেমে যায়। Anthropic ব্যাখ্যা করে যে, Max মোডে মডেলটি প্রায়শই একাধিক কোড রিভিউ সাব-এজেন্ট শুরু করে, যার ফলে দুইবার টাইমআউট হয়েছে বা কাজের পরিসরের বাইরের কোড পরিবর্তন করেছে, যার ফলে এটি মূল্যায়নে ব্যর্থ হয়েছে।
এই ফলাফলটি বোঝায় যে, বেশি যুক্তিসঙ্গত চিন্তা এবং বেশি এজেন্ট অবশ্যই ভালো উত্তর নিয়ে আসবে না। মডেলটি অতিরিক্ত পরীক্ষা, কাজের পরিসর বাড়ানো বা সময়ের বাজেট শেষ হয়ে যাওয়ার কারণে পয়েন্ট হারাতে পারে।
প্রতিটি টোকেনের দাম কমেনি, তাহলে কেন অফিসিয়ালরা বলছেন যে টাস্কের খরচ ৩০% কমেছে?
Sonnet 5.5-এর প্রকাশিত মূল্য Sonnet 5-এর সমান: প্রতি মিলিয়ন ইনপুট টোকেন 2 ডলার, আউটপুট টোকেন 10 ডলার, ক্যাশ লেখা 2.5 ডলার, ক্যাশ পড়া 0.2 ডলার, যা Opus 5.5-এর সংশ্লিষ্ট মূল্যের অর্ধেক।
অ্যানথ্রোপিকের যে দাবি যে “একটি একক কাজে সর্বোচ্চ 30% সস্তা”, তা API মূল্যসূচির কমানো নয়, বরং একই কাজ সম্পন্ন করতে মডেলটির প্রয়োজনীয় ধাপ এবং টোকেন কম। অফিসিয়ালদের মতে, এর জেনারেশন গতি 30% এর বেশি বৃদ্ধি পেয়েছে; Slack-এর অভ্যন্তরীণ পরীক্ষায় আউটপুট টোকেন প্রায় 14% কমেছে, Atlassian বলেছে এজেন্টের গতি সর্বোচ্চ 30% বৃদ্ধি পেয়েছে, এবং Lovable রিপোর্ট করেছে যে টুল কল প্রায় এক-তৃতীয়াংশ কমেছে এবং Shell-এর রানের সংখ্যা প্রায় অর্ধেক।
একটি সম্পদ ব্যবস্থাপনা কোম্পানি ২,৪৪১টি আর্থিক প্রশ্নোত্তর, এক্সট্র্যাকশন, বিশ্লেষণ এবং পূর্বানুমান কাজে পরীক্ষা করলে, Sonnet 5.5-এর গড়ে প্রতিটি কাজে প্রায় ১.২১ লক্ষ টোকেন ব্যবহার হয়, যেখানে Sonnet 5-এর ক্ষেত্রে এটি প্রায় ৪.৯৭ লক্ষ। যেহেতু এগুলি সহযোগীদের ব্যক্তিগত পরীক্ষা, তাই বাইরের কেউ কাজের কঠিনতা, প্রম্পট এবং সম্পূর্ণ আউটপুট পরীক্ষা করতে পারেন না, তবে ফলাফলগুলি একটি পরিবর্তনের দিকেই ইঙ্গিত করে: নতুন মডেলটি কম বারবার অনুসন্ধান, পুনরায় পড়া বা দীর্ঘ অভ্যন্তরীণ যুক্তিবিদ্যা করে।
এটি এজেন্টের জন্য বিশেষভাবে গুরুত্বপূর্ণ। প্রাচীন চ্যাটে, একবারে কয়েকশ টোকেন আউটপুট করা সীমিত প্রভাব ফেলে; কিন্তু দীর্ঘমেয়াদি এজেন্টগুলি প্রসঙ্গ পুনরায় পড়ে, টুলগুলি কল করে এবং ফলাফলগুলি সংশোধন করে, একটি ধাপের অপ্রয়োজনীয়তা কয়েকটি রাউন্ডের পর উল্লেখযোগ্য সময় এবং খরচের পার্থক্যে পরিণত হতে পারে।
সর্বোচ্চ যুক্তিগত শক্তি অন্য একটি খরচের সত্য প্রকাশ করে
অ্যার্টিফিশিয়াল অ্যানালিসিসের স্বতন্ত্র পরীক্ষায় সনেট 5.5-এর সর্বোচ্চ যুক্তিসঙ্গত কনফিগারেশনকে 56 পয়েন্ট দেওয়া হয়েছে, যা তার সমগ্র বুদ্ধিমত্তা ইনডেক্সে অপাস 5.5-এর 58 পয়েন্টের পিছনে।
এই সাফল্য অর্জনের জন্য খুব বেশি খরচ হয়েছে: Sonnet 5.5 প্রতিটি টেস্টে গড়ে প্রায় 193,000 আউটপুট টোকেন উত্পাদন করে, যা এই প্রতিষ্ঠান যা পরিমাপ করেছে তার মধ্যে সর্বোচ্চ, Opus 5.5 Max এবং Sonnet 5 Max-এর চেয়ে প্রায় 60% বেশি, GPT‑6 Astra Max-এর প্রায় সাতগুণ। এর অনুমানিত প্রতি প্রশ্নের খরচ 7.60 ডলার, যা Sonnet 5-এর চেয়ে প্রায় 50% বেশি।
এটি Anthropic-এর “কাজের খরচ সর্বোচ্চ 30% কমে যায়” এর সাথে সরাসরি বিরোধ করে না। অফিসিয়াল উপসংহারটি প্রধানত সাধারণ ও কম যুক্তিগত চাপের কাজগুলিকে বর্ণনা করে; Artificial Analysis হল সক্ষমতার সীমানা অর্জনের জন্য Max চালু করার ক্ষেত্রে।
দুটি ফলাফল একসাথে দেখায় যে যুক্তিগত শক্তি এখন মডেল পণ্যের একটি অংশ হয়ে গেছে। সনেট 5.5 লো বা মিডিয়াম মোডে অত্যন্ত উচ্চ মূল্য-প্রতি-পারফরম্যান্স প্রদান করতে পারে; যদি ওপাসের পিছনে পিছনে পৌঁছানোর জন্য যুক্তিগত শক্তিকে ম্যাক্সে নিয়ে যাওয়া হয়, তবে এটি প্রতি টোকেনে সস্তা হতে পারে, কিন্তু অত্যধিক উত্পাদনের কারণে এর খরচ-সুবিধা হারিয়ে ফেলতে পারে।
Artificial Analysis এছাড়াও পাওয়া গেছে যে, Sonnet 5.5-এর তথ্য সঠিকতা প্রায় 54%, যা Opus-এর 66% এর চেয়ে কম; বিজ্ঞান যুক্তি প্রকল্পগুলিতেও প্রায় ছয় পার্সেন্ট পিছিয়ে। "Opus-এর কাছাকাছি" বলা মূলত এজেন্ট টার্মিনাল অপারেশন এবং কিছু জ্ঞান-ভিত্তিক কাজের উপর ভিত্তি করে, যা সমস্ত ক্ষমতার জন্য প্রযোজ্য নয়।
বাস্তব কোড রিভিউতে, গতির সুবিধা প্রযোজ্য এবং ফ্ল্যাগশিপ ব্যবধান এখনও বিদ্যমান।
CodeRabbit একটি সেট অফ রিলিজ-ডে টেস্ট করেছে যা বাস্তব ওপেন-সোর্স প্রজেক্টের পরিচিত ত্রুটি ব্যবহার করে।
13টি কঠিন কোড রিভিউ কেসে, রিজনিংয়ের সাথে Sonnet 5.5 6টি সমস্যা শনাক্ত করে, যা Sonnet 5-এর 4টির চেয়ে বেশি; উভয়ের কার্যকরী মন্তব্যের সঠিকতা যথাক্রমে 41.2% এবং 40.0%। তবে Opus 5.5-এর স্ট্যান্ডার্ড মোড 8টি এবং Max মোড 10টি শনাক্ত করে, যা জটিল রিভিউ টাস্কে পার্থক্য এখনও স্পষ্ট বোঝায়।
44টি বাস্তব পুল রিকোয়েস্ট সহ অন্য একটি পরীক্ষায়, সনেট 5.5 গড়ে প্রতিটি রিভিউ জন্য 6 মিনিট 33 সেকেন্ড সময় নেয়, যেখানে সনেট 5 হল 13 মিনিট 31 সেকেন্ড। প্রথমটি 24% কম মন্তব্য উত্পাদন করে এবং অপ্রাসঙ্গিক মন্তব্যগুলি শুধুমাত্র আগের প্রজন্মের প্রায় এক-তৃতীয়াংশ; প্রকাশিত মূল্যের ভিত্তিতে, কোর মডেল কলের গড় খরচ প্রায় 0.46 ডলার, যেখানে সনেট 5-এর জন্য এটি প্রায় 1.16 ডলার।
তবে, 44টি PR-এর পূর্ণাঙ্গ ত্রুটি কভারেজ স্কোর প্রবন্ধটি প্রকাশের সময় সম্পন্ন হয়নি, তাই এখন পর্যন্ত শুধুমাত্র এটি দ্রুততর এবং কম আউটপুট দেয় তা নিশ্চিত করা যায়, কম লেখা মন্তব্যগুলি আরও বেশি বাস্তবিক সমস্যা উপেক্ষা করেছে কিনা তা নিশ্চিত করা যায় না। 13টি কঠিন কেসের নমুনাও খুব ছোট, কোডর্যাবিট নিজেই উল্লেখ করেছে যে এটি দিকটি পর্যবেক্ষণের জন্য যথেষ্ট, তবে সাধারণ র্যাঙ্কিং নির্ধারণের জন্য যথেষ্ট নয়।
একটি বেশি যৌক্তিক মডেল বিভাজন হলো: সনেট 5.5 প্রতিটি PR-এর জন্য দ্রুত সাধারণ পরীক্ষা করে; নিরাপত্তা, কোর আর্কিটেকচার বা ভুল উপেক্ষার খরচ অত্যন্ত বেশি হওয়া পরিবর্তনগুলির ক্ষেত্রে অপাস বা মানব বিশেষজ্ঞদের কাছে আপগ্রেড করা হবে।
ভিজুয়াল ডিজাইন শুরু হয়েছে সাধারণ কাজের মডেলের বিক্রয় পয়েন্ট হিসাবে
অ্যানথ্রোপিক বিশেষভাবে সনেট 5.5-এর ভিজুয়াল ডিজাইন ক্ষমতার প্রতি জোর দিয়েছে। অফিসিয়াল ডেমোতে সনেট 5 এবং 5.5 কে একটি একক HTML ফাইলে 400টি স্টারলিং পাখির ঝাঁক, বাতাসে গঠিত বালির ডুমুর এবং 24টি ছোট ঘন্টার সমন্বয়ে গঠিত একটি বড় ঘন্টা তৈরি করতে বলা হয়েছিল। নতুন মডেলটি দ্রুততর গতিতে অ্যানিমেশন, স্তর এবং ইন্টারফেস তৈরি করে।
এটি টেমপ্লেট ব্যবহার করে প্রেজেন্টেশনও তৈরি করতে পারে। এনথ্রোপিক একটি অভ্যন্তরীণ পরীক্ষায় একটি তালিকাভুক্ত কোম্পানির কোয়ার্টারলি ফলাফলের উপাদান, টেলিফোন কলের ট্রান্সক্রিপ্ট এবং দশটি স্লাইডের টেমপ্লেট প্রদান করেছিল, যেখানে দুজন বিশেষজ্ঞ মনে করেছিলেন যে Sonnet 5.5-এর প্রথম সংস্করণটি সরাসরি পাঠানো যেতে পারে।
এগুলি এখনও প্রস্তুতকারকদের দ্বারা প্রদর্শনের জন্য বেছে নেওয়া উদাহরণ, যা মডেলটির প্রতিটি কোম্পানি টেমপ্লেটকে স্থিতিশীলভাবে বুঝতে পারে তা প্রতিনিধিত্ব করে না। জটিল গ্রাফের ডেটা নির্ভুলতা, ব্র্যান্ড নিয়ম এবং উৎসের উল্লেখ এখনও মানুষের দ্বারা পরীক্ষা করা প্রয়োজন, কিন্তু এটি মডেলের প্রতিযোগিতামূলক নতুন দিককে প্রতিফলিত করে: শুধুমাত্র সঠিক কনটেন্ট তৈরি করা নয়, বরং প্রায় প্রস্তুত ইন্টারফেস এবং ডকুমেন্টেশন প্রদানের চেষ্টা।
সুরক্ষা ক্ষমতা বৃদ্ধি পাওয়ার সাথে সাথে কিছু অনুরোধ পুরানো মডেল দ্বারা গ্রহণ করা হবে
Sonnet 5.5 হল প্রথম Sonnet মডেল যা প্রকাশের সময় ফ্ল্যাগশিপ লেভেলের সাইবার নিরাপত্তা সুরক্ষা ব্যবহার করে। Anthropic বলেছে যে এর সাইবার নিরাপত্তা ক্ষমতা Opus 5-এর কাছাকাছি, তাই সাধারণ ভালোর সংশোধনগুলি স্বাভাবিকভাবেই চলতে থাকবে, কিন্তু উচ্চতর ঝুঁকিপূর্ণ সাইবার নিরাপত্তা অনুরোধগুলি Sonnet 5-এর কাছে স্বচ্ছভাবে প্রেরণ করা হবে।
কোম্পানিটি প্রায় 1850টি পরিস্থিতিতে ব্যবহারকারীদের ভুল তথ্য দেওয়া, ব্যবহারকারীর স্বার্থের বিরুদ্ধে কাজ করা, উচ্চ-ঝুঁকিপূর্ণ দুর্ব্যবহারে সহায়তা করা এবং পরিবেশগত সীমানা অতিক্রম করা ইত্যাদি আচরণ পরীক্ষা করেছে। অফিসিয়ালদের মতে, নতুন মডেলটি বেশিরভাগ মেট্রিকে সনেট 5-এর সমান বা এটির চেয়ে ভালো, এবং সমস্ত Claude মডেলের মধ্যে সবচেয়ে কমই কনটেইনারের সীমানা পরীক্ষা করে।
তবে, এগুলি মূলত Anthropic-এর অভ্যন্তরীণ স্বয়ংক্রিয় মূল্যায়ন, যা বাস্তব পরিবেশের ঝুঁকির পূর্ণাঙ্গ প্রমাণ হিসাবে বিবেচনা করা যায় না। কোম্পানিটিই স্বীকার করেছে যে, কোনও একটি পরীক্ষার সেটই সমস্ত ব্যর্থতার মডেল শনাক্ত করতে পারে না।
Sonnet 5.5 হল প্রথম Sonnet যা বিপরীত ডিসিলিশন ক্লাসিফায়ার যোগ করেছে এবং বিভিন্ন অ্যাকাউন্টের মধ্যে রিজনিং কনটেক্সট স্থানান্তর প্রতিরোধের জন্য "থিংকিং কনটেন্ট রিটেন" মেকানিজমকে বাড়িয়েছে। সাধারণ ডেভেলপারদের উপর এর প্রভাব সীমিত, তবে কিছু ক্রস-অ্যাকাউন্ট Claude Code ডায়ালগ মাইগ্রেশন ওয়ার্কফ্লোকে সামঞ্জস্য করতে হবে।
প্রকৃত পরিবর্তন হল টপ র্যাঙ্কিং নয়, বরং "পর্যাপ্ত শক্তিশালী মডেল" ডিফল্ট পছন্দ হয়ে উঠছে
Sonnet 5.5 নতুন মডেল আর্কিটেকচার প্রকাশ করেনি এবং Opus-এর সম্পূর্ণ ওপরে যায়নি। এর আরও গুরুত্বপূর্ণ অর্থ হলো, অতীতে ফ্ল্যাগশিপ মডেল দ্বারা পরিচালিত অসংখ্য কাজকে এখন দ্রুততর এবং ইউনিট টোকেন খরচ অর্ধেক মধ্যম-স্তরের মডেলে স্থানান্তরিত করা হয়েছে।
প্রতিদিন হাজার হাজার বার চলা কাস্টমার সাপোর্ট, কোড রিভিউ, ডেটা রিসার্চ এবং ডকুমেন্টেশন প্রোডাকশন সিস্টেমের জন্য, ডিপ্লয়মেন্টের সিদ্ধান্ত সাধারণত একক সর্বোচ্চ স্কোর দিয়ে নেওয়া হয় না, বরং প্রতিটি টাস্কের জন্য কতটা ধাপ, কতটা টোকেন, কতক্ষণ অপেক্ষা করতে হয় এবং ভুলগুলি কি আপগ্রেড করা যায় তা নিয়ে। Sonnet 5.5-এর মূল্য ঠিক এই মেট্রিকগুলিতেই কেন্দ্রীভূত।
