اینٹروپک نے 22 ستمبر کو کلوڈ آپس 5.5 جاری کیا، جو کلوڈ 5.5 سیریز کا پہلا ماڈل ہے۔ کمپنی نے اپنے مرکزی دعوے کو بہت سیدھا رکھا ہے: زیادہ تر کاموں میں کلوڈ فیبل 5.1 کے برابر، جبکہ پچھلی نسل کے آپس 5 کے مقابلے میں 40 فیصد تک آپریشنل لاگت کم ہوئی۔ لیکن اس جاری کرنے کا اصل دلچسپ پہلو صرف قیمت اور لسٹ نہیں، بلکہ یہ ہے کہ اینٹروپک نے ٹیسٹنگ کو لمبے وقت کے کاموں، غیر قابل واپسی کے عملوں اور پرامپٹ انجیکشن کے تحفظ کی طرف مزید بڑھایا ہے۔
افسردہ کہتے ہیں کہ Opus 5.5 پیچیدہ کوڈنگ، تحقیق اور ماہرینہ کاموں میں واضح بہتری لاتا ہے۔ ابتدائی ٹیسٹرز میں، کچھ ٹیمیں اس کا استعمال کرتے ہوئے ایک دن سے کم وقت میں تقریباً 680,000 لائنز کوڈ منتقل کر چکی ہیں؛ اینتھروپک نے بھی زور دیا ہے کہ ماڈل لمبے سیاق و سباق اور منصوبہ بندی کی مسلسلگی برقرار رکھ سکتا ہے۔ مثالیں صلاحیت کی حد کو ظاہر کرتی ہیں، لیکن انہیں تمام منصوبوں کے لیے اوسط ترسیل کے وقت کے طور پر نہیں سمجھنا چاہئے۔ کوڈ بیس کی ساخت، ٹیسٹ کوریج اور انسانی جائزہ نتائج کو متاثر کرتے ہیں۔
لاگت کم کرنا “سستا ورژن فلگشپ” کے برابر نہیں، بلکہ ماڈل کے استعمال کی سرحدوں کو دوبارہ تقسیم کرنا ہے
گزشتہ زمانے میں، Opus عام طور پر سب سے زیادہ پیچیدہ اور سب سے مہنگے کاموں کے لیے محفوظ رکھا جاتا تھا، جبکہ روزمرہ کے کاموں کو زیادہ تیز ماڈلز سونپ دیا جاتا تھا۔ اگر Opus 5.5 واقعی کم لاگت پر Fable 5.1 کے سطح تک پہنچ جائے تو، کاروباری ادارے اپنے فلگشی ماڈلز کو صرف کچھ اعلیٰ قیمت والی درخواستوں پر ہی نہیں، بلکہ بڑی تعداد میں کوڈ ریویو، دستاویزات کا تجزیہ اور تحقیقی عملوں کے لیے بھی استعمال کر سکتے ہیں۔
Anthropic کا دعویٰ ہے کہ لاگت میں 40% کی کمی آئی ہے، لیکن یہ ہر کمپنی کے بِل پر 40% کی کمی کا ضمانت نہیں دیتا۔ اصل لاگت ان پٹ اور آؤٹ پٹ کی لمبائی، کیش، ٹول کالز کی تعداد اور کام کو دوبارہ کرنے کی ضرورت پر منحصر ہے۔ زیادہ طاقتور ماڈلز کو لمبے کام دیے جانے سے مجموعی ٹوکن استعمال بڑھ سکتے ہیں۔ خریدار کو صرف اکائی قیمت کا موازنہ نہیں کرنا چاہئے، بلکہ اپنے ورک لود کے ذریعے “ایک کام مکمل کرنے کی مجموعی لاگت” کا جائزہ لینا چاہئے۔
طویل کام کی صلاحیت کو بھی کام کی معیار سے پیمانہ لیا جانا چاہیے۔ ایک بڑی کوڈ منتقلی سے بہت سے ظاہری طور پر منطقی تبدیلیاں نکل سکتی ہیں، لیکن اصل لاگت میں ریگریشن ٹیسٹنگ، منحصرہ تنازعات، ڈپلومنٹ اور واپسی شامل ہے۔ اگر ماڈل کو انجینئرز کو کچھ دن تک کنارے کے مسائل کو درست کرنے کے لیے مصروف رکھنا پڑے، تو رفتار کا فائدہ کم ہو جائے گا۔ سب سے زیادہ قیمتی جائزہ میں صرف یہ نہیں کہ کتنے کوڈ کا تخلیق کیا گیا، بلکہ کامیابی کا فیصد، انسانی دخل کی تعداد اور غیر قابل واپسی والے خطا بھی درج ہونے چاہئیں۔
اینٹروپک کے مطابق، Opus 5.5 کو Frontier Design، METR جیسے باہری جانچ کرنے والوں نے جاری کرنے سے پہلے ٹیسٹ کیا۔ باہری شرکت کیفیت میں اعتماد بڑھاتی ہے، لیکن اس کا مطلب یہ نہیں کہ تمام رپورٹس، اصل ڈیٹا اور ٹیسٹ ماحول بالکل شفاف ہو گئے ہیں۔ صارفین کو کمپنی کی طرف سے دی گئی رپورٹس، مستقل جانچ کے نتائج اور اپنے ماحول میں دوبارہ حاصل کردہ نتائج میں فرق کرنا چاہئے۔
سیفٹی ٹیسٹنگ اب حقیقی واقعات کی شکل پر توجہ مرکوز کر رہی ہے، صرف مختصر سوالات کے جواب دینے سے انکار کی شرح پر نہیں۔
Anthropic کا کہنا ہے کہ Opus 5.5 نے اپنے آٹومیٹڈ بہتری کے جائزے میں کمپنی کا اب تک کا بہترین نتیجہ حاصل کیا۔ ٹیسٹنگ میں ہزاروں محاورہ جات شامل تھے، جن میں مرکزی توجہ اس بات پر تھی کہ ماڈل کیا مشکل سے واپس لی جانے والے اقدامات کرتا ہے، کیا یہ صارف کے مقرر کردہ حدود کو عبور کرتا ہے، اور پرامپٹ انجیکشن کے سامنے اپنا اصل کام برقرار رکھتا ہے۔ کمپنی نے غیر ممکن کاموں، لمبے وقت تک جاری رہنے والے کاموں، اور حقیقی واقعات پر مبنی منظر ناموں کو بھی جائزے میں شامل کیا۔
یہ ایجینٹ AI کو پیداواری ماحول میں لانے کے بعد ضروری سبق ہے۔ روایتی سیکیورٹی ٹیسٹنگ عام طور پر پوچھتی ہے کہ ماڈل کیا کسی حساس سوال کا جواب دے گا، لیکن ویب سائٹس کو براہ راست دیکھنے، ٹرمینل کو استعمال کرنے اور فائلز کو تبدیل کرنے کی صلاحیت رکھنے والے ایجینٹس کے لیے خطرات زیادہ تر ایکشن چین سے آتے ہیں: یہ غلط پیش فرض کے تحت جاری رہ سکتا ہے، یا ویب پر موجود مضر متن کو حکم کے طور پر سمجھ سکتا ہے۔ ایک غلط کلک یا اجازتوں کا بڑھنا، ایک غلط جواب سے زیادہ مشکل سے درست ہوتا ہے۔
"کم تر حد سے باہر نکلنا" کا مطلب یہ نہیں کہ "حد سے باہر نہیں نکلے گا"۔ Anthropic نے صاف طور پر تسلیم کیا ہے کہ ماڈل کی محدود صلاحیتیں ہیں۔ کاروباری اطلاق کے دوران، کم سے کم اختیارات، عمل کی تصدیق، قابل ٹریک لاجس، سینڈ باکس اور رول بیک مکانزم ضروری ہیں۔ خاص طور پر، پروڈکشن ڈیٹا بیس، ادائیگی اور بنیادی ڈھانچے میں تبدیلیوں کے لیے ماڈل کے سیفٹی اسکور میں اضافے کے باوجود انسانی منظوری کو ختم نہیں کیا جانا چاہیے۔
یہ Anthropic کے “سائٹ کی رفتار کو سست کرنے” کے بعد پہلا ماڈل جاری کرنا ہے۔ کمپنی کا مقصد یہ سگنل دینا ہے کہ وہ صلاحیتیں بڑھاتے رہیں گی، لیکن باہری جائزے اور حقیقی واقعات کے قریب سیفٹی ٹیسٹنگ کو جاری کرنے کے عمل میں شامل کرے گی۔ تاہم، اس وعدے کی تصدیق صرف ایک جاری کرنے میں سب سے اعلیٰ اسکور کے بجائے، مستقبل میں ناکامیوں، ٹیسٹنگ طریقہ کار اور درستگی کے اثرات کے مستقل افشا سے ہوگی۔
صارف کے لیے، Opus 5.5 کا سب سے زیادہ ٹیسٹ کرنے کے قابل پہلو یہ نہیں کہ اس کے جوابات زیادہ خوبصورت ہیں، بلکہ یہ ہے کہ کیا یہ گھنٹوں، متعدد ٹولز اور متعدد مراحل والے کاموں میں پابندی برقرار رکھ سکتا ہے اور معلومات کی کمی پر روک لگا سکتا ہے۔ ماڈل کے مارکیٹ میں مقابلہ "جو زیادہ ذکی جواب دے" سے بدل کر "جو پیچیدہ کام کو قابل کنٹرول لاگت پر مکمل کرے" کی طرف ہو رہا ہے۔ قیمتوں میں کمی سے زیادہ لوگوں کو ٹرائل کرنے کا موقع ملتا ہے، لیکن حفاظت اور انجینئرنگ کی پابندیاں ہی یہ فیصلہ کرتی ہیں کہ ان ٹرائلز کو حقیقی پروڈکشن میں شامل کیا جا سکتا ہے یا نہیں۔
تجربتی استعمال کے دوران، کمپنیاں ایک سادہ لیکن سخت موازنہ تیار کر سکتی ہیں: ایک ہی مجموعہ کے حقیقی کاموں کا استعمال کرتے ہوئے Opus 5، Opus 5.5 اور کم لاگت والے ماڈلز کا موازنہ کریں، مکمل ہونے کا وقت، کل اخراجات، ٹیسٹ پاس ریٹ، انسانی ترمیم کی مقدار اور اعلیٰ خطرہ والے اقدامات کی تعداد درج کریں۔ صرف اس صورت میں اپ گریڈ کا تجارتی معنی ہوگا جب یہ تمام اشارے одно ساتھ بہتر ہوں۔ جاری ہونے کے دن کا ڈیمو ممکنات کو دریافت کرنے کے لیے مناسب ہے، جبکہ متعدد ہفتہ جاری اندر کا جائزہ اختیارات اور بجٹ کے فیصلے کے لیے مناسب ہے۔
