অ্যানথ্রোপিক ২২ সেপ্টেম্বর ক্লাউড ওপাস ৫.৫ প্রকাশ করেছে, যা ক্লাউড ৫.৫ সিরিজের প্রথম মডেল। কোম্পানি প্রধান বিক্রয় বিষয় হিসাবে সরাসরি দিয়েছে: অধিকাংশ কাজে ক্লাউড ফেবল ৫.১-এর মতো পারফরম্যান্স, এবং আগের প্রজন্ম ওপাস ৫-এর তুলনায় ৪০% কম চলার খরচ। কিন্তু এই প্রকাশের সত্যিকারের গুরুত্বপূর্ণ বিষয়টি হলো, মূল্যায়ন এবং র্যাঙ্কিংয়ের চেয়েও বেশি—অ্যানথ্রোপিক পরীক্ষার ফোকাসকে দীর্ঘসময়ের কাজ, অপরিবর্তনযোগ্য অপারেশন এবং প্রম্পট ইনজেকশন প্রতিরোধের দিকে আরও বেশি নিয়ে গেছে।
অফিসিয়ালদের মতে, ওপাস ৫.৫ জটিল এনকোডিং, গবেষণা এবং বিশেষজ্ঞ কাজে উল্লেখযোগ্য উন্নতি দেখায়। প্রাথমিক পরীক্ষকদের মধ্যে, একটি দল এটি ব্যবহার করে প্রায় ৬.৮ লাখ লাইন কোড একদিনের কম সময়ে স্থানান্তরিত করেছে; Anthropic এও জোর দিয়েছে যে মডেলটি দীর্ঘতর কনটেক্সট এবং পরিকল্পনার ধারাবাহিকতা বজায় রাখতে পারে। কেসগুলি ক্ষমতার সীমা বোঝায়, তবে সমস্ত প্রকল্পের জন্য গড় ডেলিভারি সময় হিসাবে বিবেচনা করা যাবে না। কোডবেসের স্ট্রাকচার, টেস্টিং কভারেজ এবং মানব পরীক্ষা ফলাফলকে প্রভাবিত করবে।
খরচ কমানো মানে শুধু “সস্তা সংস্করণের ফ্ল্যাগশিপ” নয়, বরং মডেল ব্যবহারের সীমানা পুনর্বিন্যাস করা।
পূর্বে, অপাস সাধারণত সবচেয়ে জটিল এবং সবচেয়ে মহঙ্গ কাজগুলির জন্য রাখা হত, যখন দৈনন্দিন কাজগুলি আরও দ্রুত মডেলগুলির উপর ছেড়ে দেওয়া হত। যদি Opus 5.5 প্রকৃতপক্ষে Fable 5.1-এর স্তরের কাছাকাছি কম খরচে পৌঁছাতে পারে, তাহলে প্রতিষ্ঠানগুলি শুধুমাত্র কয়েকটি উচ্চ-মূল্যের অনুরোধের জন্যই নয়, বরং বড় পরিমাণে কোড রিভিউ, ডকুমেন্ট বিশ্লেষণ এবং গবেষণা প্রক্রিয়াগুলিতেও ফ্ল্যাগশিপ মডেলগুলি ব্যবহার করতে পারে।
অ্যানথ্রোপিকের অফিসিয়াল দাবি অনুযায়ী, খরচ 40% কমেছে, কিন্তু এটি প্রতিটি প্রতিষ্ঠানের বিলের জন্য 40% কমে যাওয়ার গ্যারান্টি নয়। প্রকৃত খরচ ইনপুট এবং আউটপুটের দৈর্ঘ্য, ক্যাশিং, টুল কলের সংখ্যা এবং কাজটি পুনরায় চেষ্টা করা প্রয়োজন কিনা তার উপর নির্ভর করে। শক্তিশালী মডেলগুলি দীর্ঘতর কাজের জন্য ব্যবহার করা হলে মোট Token ব্যবহার বেড়ে যেতে পারে। ক্রেতাদেরকে একক মূল্যের তুলনা নয়, বরং “একটি কাজ সম্পন্ন করার মোট খরচ” পরীক্ষা করা উচিত।
দীর্ঘ কাজের ক্ষমতা একইভাবে সম্পাদনের গুণমান দ্বারা মূল্যায়ন করা উচিত। একটি বড় কোড স্থানান্তর অসংখ্য যুক্তিসঙ্গত পরিবর্তন তৈরি করতে পারে, কিন্তু প্রকৃত খরচ পুনরায় পরীক্ষা, নির্ভরশীলতা সংঘাত, ডিপ্লয়মেন্ট এবং রোলব্যাক অন্তর্ভুক্ত করে। যদি মডেলটি ইঞ্জিনিয়ারদের কয়েকদিন ধরে প্রান্তিক সমস্যা ঠিক করতে বাধ্য করে, তবে গতির সুবিধা হ্রাস পায়। সবচেয়ে মূল্যবান মূল্যায়নটি শুধুমাত্র কতটা কোড তৈরি হয়েছে তা নয়, বরং সফলতার হার, মানব হস্তক্ষেপের সংখ্যা এবং অপরিবর্তনীয় ত্রুটির রেকর্ড একসাথে ধারণ করা উচিত।
অ্যানথ্রোপিক বলেছে যে অপাস ৫.৫ কে ফ্রন্টিয়ার ডিজাইন, মেট্র ইত্যাদি বাহ্যিক মূল্যায়নকারীদের দ্বারা প্রকাশের আগে পরীক্ষা করা হয়েছে। বাহ্যিক অংশগ্রহণ বিশ্বস্ততা বাড়ায়, কিন্তু এটি সমস্ত রিপোর্ট, মূল ডেটা এবং পরীক্ষার পরিবেশের সম্পূর্ণ প্রকাশকে বোঝায় না। ব্যবহারকারীদের এখনও কোম্পানির নিজস্ব প্রতিবেদন, স্বতন্ত্র মূল্যায়নের ফলাফল এবং নিজস্ব পরিবেশে পুনরাবৃত্তির ফলাফলের মধ্যে পার্থক্য করা উচিত।
সিকিউরিটি টেস্টিং এখন শুধুমাত্র শর্ট-অ্যানসার রিজেকশন রেটের পরিবর্তে বাস্তব ঘটনার রূপগুলির দিকে মনোনিবেশ করছে।
অ্যানথ্রোপিক জানিয়েছে যে, অপাস 5.5 তাদের স্বয়ংক্রিয় আচরণ অডিটে কোম্পানির এখন পর্যন্ত সেরা পারফরম্যান্স দেখিয়েছে। পরীক্ষাটি হাজার হাজার সিমুলেটেড পরিস্থিতি কভার করে, যার মধ্যে মডেলটি কি অপসারণযোগ্য নয় এমন কাজ করে, কি ব্যবহারকারীর দেওয়া সীমানা লঙ্ঘন করে, এবং প্রম্পট ইনজেকশনের সময় মূল কাজটি বজায় রাখতে পারে কিনা তা অন্তর্ভুক্ত। কোম্পানিটি অসম্ভব কাজ, দীর্ঘস্থায়ী কাজ এবং বাস্তব দুর্ঘটনা ভিত্তিক সিনেরিওগুলিও মূল্যায়নে যোগ করেছে।
এটি হল এজেন্ট-ভিত্তিক এআই উৎপাদন পরিবেশে প্রবেশ করার পর পূরণ করা অপরিহার্য পাঠ। প্রচলিত নিরাপত্তা পরীক্ষাগুলি প্রায়শই জিজ্ঞাসা করে যে মডেলটি কি কোনো সংবেদনশীল প্রশ্নের উত্তর দেবে, কিন্তু ওয়েবসাইট ব্রাউজ করতে, টার্মিনাল কল করতে এবং ফাইলগুলি পরিবর্তন করতে সক্ষম এজেন্টগুলির ঝুঁকি বেশি হয় একটি অ্যাকশন চেইনের মধ্যে: এটি ভুল পূর্বপ্রস্তুতির ভিত্তিতে কাজ চালিয়ে যেতে পারে, অথবা ওয়েবপৃষ্ঠার মধ্যে দুষ্টুমির টেক্সটকেই নির্দেশনা হিসাবে বিবেচনা করতে পারে। একটি ভুল ক্লিক বা অনুমতির বৃদ্ধি, একটি অনুপযুক্ত উত্তরের চেয়ে আরও কঠিনভাবেই ফিরিয়ে আনা যায়।
"কম অতিক্রম" মানে এখনও "অতিক্রম হবে না" নয়। Anthropic স্পষ্টভাবে স্বীকার করেছে যে মডেলের সীমাবদ্ধতা রয়েছে। ব্যবসায়িক বাস্তবায়নের সময়ও ন্যূনতম অধিকার, অপারেশন নিশ্চিতকরণ, ট্রেসযোগ্য লগ, স্যান্ডবক্স এবং রোলব্যাক মেকানিজম প্রয়োজন। বিশেষ করে উৎপাদন ডেটাবেস, পেমেন্ট এবং ইনফ্রাস্ট্রাকচার পরিবর্তনের ক্ষেত্রে, মডেলের নিরাপত্তা স্কোর বৃদ্ধির কারণে মানুষের অনুমোদন বাতিল করা উচিত নয়।
এটি এনথ্রোপিক যে প্রযুক্তির গতি ধীর করার প্রস্তাব দেয়ার পর প্রথম মডেল প্রকাশ। কোম্পানিটি বার্তা দিতে চায় যে, ক্ষমতা বাড়ানোর পাশাপাশি বাহ্যিক মূল্যায়ন এবং বাস্তবিক দুর্ঘটনার সাথে বেশি মিলে যাওয়া নিরাপত্তা পরীক্ষা প্রকাশ প্রক্রিয়ায় অন্তর্ভুক্ত করা হবে। তবে, এই প্রতিশ্রুতির বাস্তবতা নির্ভর করবে ভবিষ্যতে ব্যর্থতার উদাহরণ, পরীক্ষার পদ্ধতি এবং সংশোধনের ফলাফলের নিয়মিত প্রকাশের উপর, শুধুমাত্র একটি প্রকাশের সর্বোচ্চ স্কোরের উপর নয়।
ব্যবহারকারীদের জন্য, Opus 5.5-এর সবচেয়ে গুরুত্বপূর্ণ পরীক্ষা হল এটির উত্তরগুলি কি আরও সুন্দর হয় নাকি এটি ঘন্টার পর ঘন্টা, বহু টুল এবং বহু ধাপের কাজে সীমাবদ্ধ থাকতে পারে এবং তথ্যের অভাবে থেমে যায় কিনা। মডেল বাজারের প্রতিযোগিতা “কে আরও বুদ্ধিমানের মতো উত্তর দেয়”-এর পরিবর্তে “কে নিয়ন্ত্রিত খরচে জটিল কাজগুলি শেষ করতে পারে”-এর দিকে সরছে। মূল্য হ্রাসের ফলে আরও বেশি মানুষের জন্য এটি পরীক্ষা করার সুযোগ খুলেছে, কিন্তু নিরাপত্তা এবং ইঞ্জিনিয়ারিংয়ের শৃঙ্খলা এই পরীক্ষাগুলিকে বাস্তবে উৎপাদনে পৌঁছাতে পারবে কিনা তা নির্ধারণ করবে।
পরীক্ষামূলক ব্যবহারের সময় একটি সরল কিন্তু কঠোর তুলনা তৈরি করুন: একই সেটের বাস্তব কাজ ব্যবহার করে Opus 5, Opus 5.5 এবং কম খরচের মডেলগুলির তুলনা করুন, সম্পন্ন হওয়ার সময়, মোট খরচ, টেস্ট পাস রেট, মানুষের সংশোধনের পরিমাণ এবং উচ্চ-ঝুঁকিপূর্ণ ক্রিয়াকলাপের সংখ্যা রেকর্ড করুন। শুধুমাত্র এই সূচকগুলি একসাথে উন্নতি হলেই আপগ্রেডের ব্যবসায়িক অর্থ রয়েছে। প্রকাশের দিনের ডেমোটি সম্ভাবনা আবিষ্কারের জন্য উপযুক্ত, কিন্তু কয়েকসপ্তাহব্যাপী অভ্যন্তরীণ মূল্যায়নই অধিকার এবংবাজেট নির্ধারণের জন্য উপযুক্ত।
