اینٹروپک کے پاس حالیہ وقت میں کلاؤڈ ماڈل کے متعدد ٹیکنیکل چیلنجز کا سامنا ہے۔ کوڈ جنریشن میں واتر مارک امڈ کرنے کی پابندیوں کی وجہ سے آزادی کم ہو گئی ہے؛ سونٹیٹ 5 کا ایڈاپٹوو تھنکنگ مکینزم ایک ہی ماڈل کو مختلف کمپوٹیشنل وسائل کے استعمال کے لیے ایڈجسٹ کرنے دیتا ہے، جس سے پروڈکٹ لائن کی صلاحیتوں کے درمیان کھینچاؤ پیدا ہو گیا ہے؛ 1M کنٹیکسٹ نظریہ طور پر کافی لگتا ہے، لیکن لمبے ایجنٹ سیشنز میں ماڈل واقعی صرف تقریباً 20%-30% تک ہی مؤثر طور پر استعمال کر پاتا ہے، اس کے بعد حالت میں اشتعال اور غفلت پیدا ہو جاتی ہے؛ کنٹیکسٹ کمپریشن کے دوران یہ الگ کرنا مشکل ہوتا ہے کہ کون سی معلومات اب بھی درست ہیں، عارضی فرضیات غلطی سے حقائق میں تبدیل ہو سکتی ہیں؛ ایجنٹ کے ماحول میں خود بخود تبدیلی کرنے کے بعد، ماڈل اب اصل مسئلے کے بجائے اپنے خود بنائے گئے نئے غلطیوں کا تجزیہ شروع کر دیتا ہے۔ مضمون میں بتایا گیا ہے کہ لمبے ایجنٹ کی قابلِ اعتمادیت اب صرف ماڈل کے اکلوتے مرحلے کے اداء پر نہیں بلکہ حالت کی واضحیت، اقدامات کی تصدیق پذیری اور غلطیوں کو واپس لینے کی صلاحیت پر زیادہ منحصر ہو رہی ہے۔مضمون کا مصنف، ذریعہ: LeiPhone
مڈل کے اسکور میں کمی سے زیادہ پریشانی یہ ہے کہ مڈل اب بھی اپ گریڈ ہو رہا ہے، لیکن صارفین کو لگنے لگا ہے کہ یہ دن بدن زیادہ استعمال کے لیے مشکل ہوتا جا رہا ہے۔
اینٹروپک نے حال ہی میں اس طرح کا کچھ محسوس کیا ہے۔
گزشتہ کچھ دنوں میں X پر ایک پوسٹ میں کلود کے اس دوران کے کچھ عام ناراضگیوں کو اکٹھا کیا گیا: متن اور کوڈ میں مشین قابل پڑھنے والے نشانات شامل ہو رہے ہیں، سونٹ 5 کا عملی تجربہ ماڈل اپ گریڈ کے دعوؤں کے ساتھ مطابقت نہیں رکھتا، فیبل 5 زیادہ مہنگا ہے، لیکن اس کا Opus 5 سے واضح فرق محسوس نہیں ہوتا؛ اور ایک اور زیادہ توجہ کا مطالبہ یہ ہے کہ فیبل 5 کا حوالہ صرف تقریباً 20%–30% تک استعمال ہوتا ہے، اور اس کے بعد اس کی صلاحیتیں گھٹنے لگتی ہیں۔

یہ چند باتیں ظاہری طور پر کوئی تعلق نہیں رکھتیں، ایک جیسے جنریشن میکنزم کا مسئلہ، ایک جیسے ماڈل کی صلاحیت کا مسئلہ، ایک جیسے قیمت تعین کا مسئلہ، اور ایک تو لمبے کانٹیکسٹ میں خرابی کا مسئلہ لگ رہا ہے۔
لیکن کلائیڈ کے موجودہ ٹیکنالوجی اسٹیک کے حوالے سے، وہ دراصل پانچ بہت مخصوص جگہوں پر گھسٹ رہے ہیں: ماڈل کیسے جنریٹ ہوتا ہے، انفرینس کے دوران کتنی کمپوٹیشن خرچ کرنے کو تیار ہے، مختلف ماڈلز کیوں ہر دفعہ زیادہ مشکل سے ہائیرارکی کرتے ہیں، لمبے کنٹیکس کیوں ختم ہونے سے پہلے ہی فیل ہو جاتے ہیں، اور تجربات میں صلاحیتیں اصل ایجنٹ ٹاسک میں کیوں کم ہو جاتی ہیں۔
اس لیے اینتھرپک کا حالیہ مسئلہ شاید صرف "ماڈل کا کمزور ہونا" نہیں ہے۔ زیادہ تر ایسا لگتا ہے کہ کلاؤڈ کے طاقتور ہوتے جانے کے ساتھ، جنریشن، کمپیوٹیشن، کنٹیکسٹ اور ایجینٹ رن ٹائم کے درمیان ایک دوسرے کو ڈراگ کرنے لگا ہے۔

01
پہلا گناہ: کوڈ کے جنریشن اسپیس کو تباہ کر دیا گیا
ماشینی قابل پڑھنے والے نشانات عام متن میں ڈالے جاتے ہیں، جس کا ٹیکنیکل چیلنج یہ ہے کہ مستقل سگنل برقرار رکھا جائے اور جنریشن کی معیار میں تبدیلی کم سے کم کی جائے۔ کوڈ تک پہنچنے پر یہ مسئلہ واضح طور پر مشکل ہو جاتا ہے، کیونکہ قدرتی زبان اور کوڈ کے ٹوکن کا تقسیم مختلف ہوتا ہے۔

کاغذ: https://arxiv.org/pdf/2301.10226
Natural language often has multiple semantically similar candidates. The same meaning can be expressed with different words or reordered syntax, and models often have some generation redundancy at many positions. A common approach to text watermarking is to exploit this redundancy by slightly altering sampling probabilities among multiple acceptable tokens, accumulating enough statistical patterns over time.
کوڈ میں بہت زیادہ کم انتروپی کے مقامات ہیں۔ متغیر کے اعلان کے بعد، بعد کے حوالے تقریباً صرف ایک ہی نام استعمال کر سکتے ہیں؛ JSON کے فیلڈز، حوالہ علامات اور قوسین سخت ساختی پابندیوں کے تحت ہوتے ہیں؛ فنکشن کے پیرامیٹرز انٹرفیس کے مطابق ہونے چاہئیں؛ راستوں، ریگولر ایکسپریشنز، SQL، شیل کمانڈز میں، ایک ٹوکن میں تبدیلی سے فوراً رویہ بدل سکتا ہے۔
احتمالی تقسیم کے مطابق، یہ مقامات عام طور پر بہت تیز ہوتے ہیں۔ صحیح ٹوکن اعلی احتمال پر قبضہ کرتا ہے، جبکہ دیگر امکانات دوسرے اظہار نہیں بلکہ غلطی ہو سکتے ہیں۔ اس لیے، کوڈ ڈیجیٹل واٹر مارک کا بنیادی پابندی اصل میں کوڈنگ کی صلاحیت ہے۔
اگر کوئی پوزیشن صرف ایک ہی منطقی آؤٹ پٹ رکھتی ہے، تو اس میں اضافی سگنلز کے لیے تقریباً کوئی جگہ نہیں ہوتی؛ اگر سسٹم صرف اعلیٰ اینٹروپی پوزیشنز پر مارکرز ڈالتا ہے، تو اسے کوڈ کا مختصر ہونا، ساختی ٹوکن کا زیادہ تناسب، اور استعمال کے لیے کافی پوزیشنز کی کمی کا سامنا ہوتا ہے۔
اس طرح، تشخیص کی طاقت، تولید کی معیار اور تبدیلی کے خلاف مزاحمت کے درمیان ب без تنازعہ ہو جاتا ہے: اگر سگنل بہت کمزور ہو تو اسے تشخیص کرنا مشکل ہو جاتا ہے، اگر پابندیاں بہت زیادہ ہوں تو درست تولید متاثر ہو سکتی ہے، اور اگر فارمیٹنگ یا مقامی دوبارہ لکھنے کے بعد بھی تشخیص کی صلاحیت برقرار رکھنا ہو تو زیادہ سگنل ریڈنڈنسی کی ضرورت ہوتی ہے۔

اینٹروپک نے کلاؤڈ ٹیکسٹ ٹوکن کے طریقہ کار کو ظاہر نہیں کیا ہے، اس لیے کلاؤڈ کوڈ کی معیار میں تبدیلی کو براہ راست کسی ایک پانی کے نشان الگورتھم پر منحصر نہیں کیا جا سکتا۔
یہ واضح ہے کہ ایک اور تبدیلی یہ ہے کہ کوڈ جنریشن اب بڑھتے ہوئے محدودیتوں کو بھی پورا کر رہا ہے۔ معنائی اور اجرائی درستگی کے علاوہ، اسے ٹول پروٹوکول، سٹرکچرڈ فارمیٹ، سیکورٹی قواعد اور سورس ٹیگز کی پابندی بھی ماننی پڑ سکتی ہے، جبکہ کوڈ خود ان اضافی محدودیتوں کو شامل کرنے کے لیے قدرتی زبان کے مقابلے میں کم آزادی رکھتا ہے۔

02
دوسرا گناہ: ماڈل لیولز اب کمپیوٹیشنل کریو کی طرف بدل رہے ہیں
سونٹ 5 کا ایڈاپٹوو تھنکنگ صرف مدل کو تھوڑا اور سوچنے کا موقع نہیں دیتا۔
پہلے سونیٹ، اوپس، فیبل کے بارے میں بات کرتے وقت، انہیں کچھ مخصوص صلاحیتیں سمجھنا آسان تھا۔ اب effort کے شامل ہونے کے بعد، ایک ہی ماڈل مختلف ٹیسٹ-ٹائم کمپیوٹ انٹروالز میں آ سکتا ہے، اور ماڈل کا نام اب ایک درخواست میں حقیقی طور پر کتنی صلاحیت لگائی گئی ہے، اسے مکمل طور پر ظاہر نہیں کر سکتا۔

حوالہ جات: https://platform.claude.com/docs/en/build-with-claude/effort
یہ تبدیلی کوڈنگ ایجنٹ میں خاص طور پر واضح ہے۔ کلاؤڈ ایک بگ کا سامنا کرتے ہوئے صرف ترمیم کا منصوبہ تیار نہیں کرتا، بلکہ یہ بھی فیصلہ کرتا ہے کہ کون سے فائلیں پڑھی جائیں، کون سی کال چین کو ٹریس کیا جائے، کتنے ممکنہ فرضیات برقرار رکھے جائیں، ٹیسٹ چلائے جائیں یا نہیں، انحصاروں کی جانچ جاری رکھی جائے یا نہیں، اور کب ثبوت کافی سمجھے جائیں۔
ان اقدامات کو ایک تلاش کے درخت کے طور پر دیکھا جا سکتا ہے۔ کم حسابی کوشش کا مطلب ہے کہ شاخیں جلدتر کٹ جائیں اور فیصلہ جلد تر لیا جائے؛ زیادہ کوشش سے ماڈل تلاش اور تصدیق جاری رکھ سکتا ہے، جس سے ثبوت کی کمی کی صورت میں فوری اقدام کرنے کا احتمال کم ہو جاتا ہے۔

حوالہ جات: https://platform.claude.com/docs/en/build-with-claude/effort
اس لیے effort صرف thinking کی لمبائی کو调节 نہیں کرتا، بلکہ ایک Agent کے کام کے دوران کتنی بڑی تلاش کی حد کی اجازت دی جاتی ہے۔ اس سے Anthropic کے ماڈل کی لیئرنگ ب без تبدیل ہو جائے گی۔
اگر ایک عام کوڈنگ کا کام Opus کے لیے اب پہلے سے مشکل نہیں، تو effort میں اضافہ کرنے کے بعد، Opus شاید جلد ہی پرفارمنس پلیٹ فارم کے علاقے میں داخل ہو جائے۔ فیبل کے پاس چاہے زیادہ طاقتور بنیادی ماڈل ہو، لیکن اس کے پاس کم ہی ترقیاتی مشکلات باقی ہیں جو واضح تجربے میں فرق پیدا کر سکیں۔
صارف درخواست شروع ہوتے ہی مدلز کے درمیان قیمت کا فرق ادا کرتا ہے۔ اس لیے فیبل کی قیمت زیادہ واضح ہوتی ہے، جو عام کوڈ وضاحت، چھوٹے پیمانے پر دوبارہ ڈیزائن، یا عام ڈیبگنگ نہیں بلکہ ناشناں کوڈ بیس، متعدد مراحل کی منصوبہ بندی، ٹولز کے درمیان آپریشن، لمبے عرصے تک خود مختار انجام دینا، اور خطا کے بعد بحالی کی ضرورت والے کام ہوتے ہیں۔

حوالہ جات: https://www.anthropic.com/news/claude-opus-5
اس کا مطلب ہے کہ اعلیٰ ماڈلز جو چیزیں بیچ رہے ہیں، وہ تبدیل ہو رہی ہیں۔ وہ صرف “اس دور کا جواب زیادہ مضبوط” نہیں بیچ رہے، بلکہ زیادہ پیچیدہ راستے کی اضافی قابلیت بھی بیچ رہے ہیں۔
مسئلہ یہ ہے کہ اس فائدہ کو ظاہر ہونے کے لیے کام کافی لمبا ہونا چاہیے، اور جب کام لمبا ہو جاتا ہے، تو مدل کی صلاحیت واحد فیصلہ کن عنصر نہیں رہتی، بلکہ سیاق و سباق کی حالت مرکزی مقام حاصل کر لیتی ہے۔

03
تیسری گناہ: لاکھوں تاریخی ڈیٹا کو محفوظ کر سکتی ہے، لیکن موجودہ حالت کو سمجھ نہیں پاتی
1M کنٹیکس دیکھ کر، اسے ایک بہت بڑی ورک میموری کے طور پر سمجھنا آسان ہے، اس لیے جب کلاؤڈ صرف 200K یا 300K ٹوکن استعمال کرنے کے بعد غلطیاں کرنے، دہرائے یا حالت کی بگاڑ شروع کر دے تو، یہ بہت غیر منطقی لگتا ہے۔
لیکن کنٹیکس ونڈو کی صرف صلاحیت کا جائزہ لیا جاتا ہے، حالت کی ایک جانس کا نہیں۔ لمبی ایجنٹ سیشن صرف ایک ساکت دستاویز نہیں ہوتے، بلکہ ایک لگاتار شامل ہوتے ہوئے اجرائی تاریخ ہوتے ہیں۔

حوالہ جات: https://platform.claude.com/docs/en/build-with-claude/context-windows
ایک فائل کو متعدد بار تبدیل کیا جا سکتا ہے؛ کسی بگ کو ابتدائی طور پر کیش مسئلہ سمجھا جاتا ہے، لیکن بعد میں پتہ چلتا ہے کہ یہ توازن سے آ رہا ہے؛ کوئی ٹیسٹ پہلے ناکام ہو سکتا ہے، پھر کامیاب ہو جاتا ہے، اور نئے تبدیلیوں کی وجہ سے دوبارہ ناکام ہو جاتا ہے۔ پرانی معلومات حالات کے تبدیل ہونے پر خودبخود حذف نہیں ہوتیں، نئی معلومات صرف اس کے بعد جاری رکھی جاتی ہیں۔
یہاں کا مسئلہ صرف ریٹریول تک محدود نہیں ہے۔ ماڈل کو صرف موجودہ کام کے ساتھ متعلق معلومات تلاش کرنی ہوں گی، بلکہ یہ بھی فیصلہ کرنا ہوگا کہ ان معلومات کا اب بھی کام کرنا چاہئے یا نہیں۔
پرانے فنکشن اور نئے فنکشن بہت مشابہ ہیں، پرانے ٹیسٹ لاگ اور نئے ٹیسٹ لاگ میں بہت سے ایک جیسے ٹوکن شامل ہیں، اور جو تجزیہ پہلے ہی مسترد کر دیا گیا ہے، وہ بھی موجودہ مسئلے کے ساتھ معنائی طور پر بہت متعلق ہو سکتا ہے۔ ایٹنشن کو ان مواد کو تلاش کرنا مشکل نہیں ہے، مشکل بات یہ ہے کہ ان کے درمیان کوریج کا تعلق طے کرنا۔
ڈیٹا بیس کو ورژن نمبر، اپ ڈیٹ کا وقت، ٹرانزیکشن اور واضح فیلڈس کے ذریعے موجودہ حالت کو برقرار رکھا جا سکتا ہے، جبکہ قدرتی زبان کا متن عام طور پر اس قسم کی ساخت سے محروم ہوتا ہے۔ یہ زیادہ قریب ہے ایپنڈ-اوسلوگ کے، جہاں ماڈل کو خود ہی واقعات کے ترتیب سے موجودہ دنیا کو دوبارہ تعمیر کرنا پڑتا ہے۔

حوالہ جات: https://platform.claude.com/docs/en/build-with-claude/context-windows
اس لیے، لمبے سیاق کی پیچیدگی token کے استعمال کے تناسب کے ساتھ سیدھا مطابقت نہیں رکھتی۔ 250K token کا ایک سٹیٹک دستاویز، 250K token کے ایجنٹ کے تاریخی سیاق سے کہیں زیادہ آسانی سے قابلِ معالجہ ہو سکتا ہے، کیونکہ بعد والے میں بہت سے ترمیم شدہ آبجیکٹس، مراحل کے جائزے، ٹولز کے نتائج اور فیصلہ کردہ حالتیں شامل ہوتی ہیں۔
سوچ کی تاریخ اس پیچیدگی کو مزید بڑھائے گی۔ مکالمہ میں صرف "کیا ہوا" ہی نہیں، بلکہ "اس وقت اس کا کیوں فیصلہ کیا گیا" بھی محفوظ ہو سکتا ہے۔ اگر ابتدائی استدلال ایک ایسے فرض پر مبنی ہے جو بعد میں مسترد کر دیا گیا ہو، تو وہ استدلال اب بھی اس لیے کہ اس کا موجودہ سوال سے زبردست تعلق ہے، بعد کے فیصلوں میں شرکت کرتا رہے گا۔
تو 1M کنٹیکس کی حقیقی حد صرف اتنا ہی نہیں کہ کتنی معلومات ڈالی جا سکتی ہیں، بلکہ یہ بھی ہے کہ جب ایک ہی آبجیکٹ کے زیادہ سے زیادہ تاریخی ورژن ظاہر ہو جائیں، تو ماڈل اب بھی موجودہ ورژن کو مستقل طور پر واپس حاصل کر سکتا ہے یا نہیں۔

04
چوتھا گناہ: تاریخ کو دبایا جاتا ہے، اور حالت کو دوبارہ بنایا جاتا ہے
جب ماحول جاری رہتا ہے، تو کمپیکشن ایک قدرتی طریقہ لگتا ہے: پرانی تاریخ کو مختصر کریں اور جاری رکھیں۔ لیکن ایجنٹ کے سیناریوز میں کمپیکشن عام خلاصہ کے برابر نہیں ہے۔
ایک مثال کو خلاصہ میں چھوڑ دینا عام طور پر صرف معلومات کی مکملیت کو متاثر کرتا ہے؛ ایجنٹ کے ٹریک کو دبانے کے دوران، ایک اب بھی درست پابندی کو نظرانداز کرنا، بعد کے اجرائی راستے کو براہ راست تبدیل کر سکتا ہے۔

حوالہ جات: https://platform.claude.com/cookbook/tool-use-context-engineering-context-engineering-tools
کمپیکشن کو یہ نہیں سمجھنا چاہیے کہ "کون سی چیزیں اہم ہیں" بلکہ یہ سمجھنا چاہیے کہ "اب کون سی چیزیں درست ہیں"۔ ایک تاریخ میں ایک ساتھ مکمل ہو چکے کام، بعد میں منسوخ کردہ فیصلے، اب بھی لاگو ہونے والے انٹرفیس کے پابندیاں، ختم ہو چکے ٹیسٹ نتائج اور عارضی ورکئیراؤنڈز موجود ہو سکتے ہیں۔ کمپیکٹر کو ان وقتی حالت کو دوبارہ ترتیب دینا ہوگا تاکہ اگلے دور کے لیے ایک قابل استعمال نمائندگی حاصل ہو سکے۔
اگر "موجودہ طور پر م suspicions کی جا رہی ہیں کہ مسئلہ کیش سے آ رہا ہے" کو "مسئلہ کیش سے آ رہا ہے" میں دبادیا جائے، تو عارضی فرض حقیقت بن جائے گا؛ اگر ایک پہلے مسترد شدہ منصوبہ اب بھی خلاصہ میں شامل ہو جائے، تو بعد والے ایجنٹ قدیم راستہ اختیار کر سکتے ہیں؛ اگر کوئی اہم پابندی خلاصہ میں شامل نہ ہو، تو ماڈل اسے بعد میں دوبارہ نہیں دیکھے گا۔
اس لیے کمپیکشن کا اہم اشارہ کمپریشن ریٹ نہیں بلکہ اسٹیٹ فیدلیٹی ہے۔ یہی وجہ ہے کہ گِٹ، ٹیسٹ، ٹاسک فائلز، میموری اور سٹرکچرڈ ہینڈ آف لمبے وقت کے ایجینٹ میں آہستہ آہستہ اہمیت حاصل کر رہے ہیں۔
وہ صرف ماڈل کے لیے دستیاب معلومات کو بڑھانے کے لیے نہیں ہیں، بلکہ قدرتی زبان کے تاریخی ریکارڈ سے کچھ طویل مدتی حالتیں باہری سسٹم میں منتقل کرتی ہیں۔ گٹ موجودہ کوڈ ورژن کو واضح کرتا ہے، ٹیسٹ قابل تصدیق نتائج فراہم کرتے ہیں، ٹاسک فائلز مکمل ہونے کی حالت درج کرتے ہیں، اور ساختی حالت موجودہ نتائج اور تاریخی کوششوں کو الگ کرتی ہے۔
کنٹیکس غنی تاریخ کو برقرار رکھ سکتا ہے، لیکن طویل مدت تک مکمل اسٹیٹ مینجمنٹ کی ذمہ داری نہیں اٹھا سکتا۔

حوالہ جات: https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents

05
پانچواں گناہ: ماڈل اپنے خود کے بنائے ہوئے بگ کو درست کرتا ہے، جس سے غلطیاں زیادہ بڑھ جاتی ہیں
پچھلے کچھ سوالات اب بھی ماڈل کیسے ان پٹ کو سمجھتا ہے، اس کی وضاحت کرتے ہیں۔ ایجنٹ اگلے مرحلے پر ہے کیونکہ یہ ماحول کو فعال طور پر تبدیل کرتا ہے۔
عام چیٹ میں، ماڈل کا ایک بار غلط جواب دینا عام طور پر صرف آؤٹ پٹ ٹیکسٹ تک محدود رہتا ہے۔ ایجنٹ کوڈ میں تبدیلی کر سکتا ہے، کمانڈز چلا سکتا ہے، ڈیپینڈنسیز انسٹال کر سکتا ہے، کنفیگریشنز تبدیل کر سکتا ہے، اور ان اقدامات سے پیدا ہونے والے نئے نتائج کو دوبارہ پڑھ سکتا ہے۔
اس طرح، غلطیاں صرف جائزہ کی غلطیاں نہیں رہیں، بلکہ ماحول کے تبدیل ہونے کی بھی بن گئیں۔ فرض کریں کہ کلاؤڈ نے ایک بگ کو کیش مسئلہ سمجھ لیا، اس لیے اس نے کیش منطق، دوبارہ کوشش کے طریقے اور کچھ کالنگ پوائنٹس تبدیل کر دیے۔ بعد میں ٹیسٹ میں نئے ایکسپشنز ظاہر ہوئے۔
یہ غلطیاں حقیقی ہیں، لیکن وہ اصل بگ کے قدرتی نتیجے نہیں ہیں، بلکہ پچھلے ترمیم کے نتیجے میں پیدا ہوئی ہیں۔ اس سے ایجنٹ ایک خاص ناکامی کی حالت میں داخل ہو جائے گا: ماڈل اپنے خود بنائے گئے ڈیٹا کے تقسیم کا تجزیہ شروع کر دے گا۔

حوالہ جات: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
اگر یہ "یہ نئی خطاں پچھلے ترمیم کے بعد ظاہر ہوئیں" کو پہچان سکے، تو اسے واپس لے کر اصل فرضیہ کو دوبارہ چیک کیا جا سکتا ہے؛ اگر اس علاوہ سبب اور اثر کا تعلق قائم نہیں ہوا، تو نئی خطاں مسلسل الگ مسائل کے طور پر دیکھی جائیں گی اور ایک کے بعد ایک درست کی جائیں گی۔
اس وقت ہر ایک مقامی عمل کے پیچھے ممکنہ طور پر دلیل ہو سکتی ہے، لیکن پوری ایجینٹ کی سرگرمی اصل مسئلے سے الگ ہو چکی ہے۔ اس لیے لمبے ایجینٹ کی قابلیت صرف ایک مرحلے کی درستگی پر منحصر نہیں ہونی چاہیے۔ زیادہ اہم بات یہ ہے کہ جب غلطی ماحول میں داخل ہو جائے تو نظام کیا چیک کر سکتا ہے، اس کا سبب تلاش کر سکتا ہے اور اسے درست کر سکتا ہے۔
Git diff سے ماڈل کو پتہ چل سکتا ہے کہ کن تبدیلیوں نے حال ہی میں واقع پایا، ٹیسٹس یہ تصدیق کر سکتے ہیں کہ کوئی سلوک خراب ہو گیا ہے یا نہیں، چیک پوائنٹ اور رول بیک غلطیوں کے پھیلاؤ کو محدود رکھ سکتے ہیں، اور الگ evaluator ماڈل کی اپنی وضاحت کے علاوہ اضافی جانچ فراہم کر سکتا ہے۔
ان اجزاء کا مقصد، اصل میں ایجینٹ کو بند حلقوں والی درستگی کی صلاحیت فراہم کرنا ہے۔

حوالہ جات: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents

06
اختتام: بینچ مارک کی کمی، راستے کی قابلیت ہے
بہت سے بینچ مارکس یہ چیک کرتے ہیں کہ کیا ماڈل کو ایک اچھی طرح سے شروع کیا گیا ماحول دیا جائے تو وہ کام مکمل کر سکتا ہے یا نہیں۔ اصل ایجینٹ کے لیے ایک اضافی مشکل یہ ہے کہ ماحول اپنے اپنے اقدامات کے ساتھ لگاتار تبدیل ہوتا رہتا ہے۔ اس لیے، دو ماڈلز جن کی آخری کامیابی کی شرح تقریباً ایک جیسی ہو، ان کا اصل تجربہ بالکل مختلف ہو سکتا ہے۔
ایک ماڈل شروع میں بہت درست فیصلے کر سکتا ہے، لیکن اگر اس نے غلط راستہ اپنایا تو وہ لگاتار غلطیوں کو درست کرنے کی کوشش کرتا رہتا ہے؛ دوسرا ماڈل ایک مرحلے میں ضروری طور پر زیادہ طاقتور نہیں ہو سکتا، لیکن وہ جلدی سے پتہ لگا سکتا ہے کہ کوئی تبدیلی نئی مسئلہ پیدا کر رہی ہے، اور پھر اسے واپس لے کر راستہ دوبارہ منتخب کرتا ہے۔
آخر نقطہ کو دیکھ کر، ان دو افعال کو الگ کرنا مشکل ہے۔ اگر ایجنٹ کا کام مزید لمبا ہو جائے، تو زیادہ معنی خیز اشارے یہ ہوں گے کہ کمپیکشن کے بعد کتنی اہم حالتیں برقرار رکھی گئیں، غلط تبدیلی کے بعد غلطی کا سبب کون سا مرحلہ تھا، ٹولز کے استعمال کے ساتھ اندر کی حالتیں حقیقی ماحول کے ساتھ مسلسل مطابقت رکھتی ہیں یا نہیں، اور جب انحراف ہو جائے تو اسے درست کرنے میں کتنا اخراج آتا ہے۔
یہ اشارے ایک ریسپانس کی کتنی ذکی ہونے کا امتحان نہیں لیتے، بلکہ یہ یہ جانچتے ہیں کہ ایک ٹریجکٹری قابل کنٹرول رہ سکتی ہے یا نہیں۔
اس لحاظ سے، اینتھرپک کی طرف سے حالیہ طور پر ابھرے گئے کچھ مسائل دراصل مختلف سطحوں پر مبنی ہیں۔ جب یہ مسائل اکٹھے ظاہر ہوئے، تو کلوڈ کی ٹیکنالوجی کی سرحدیں بھی تبدیل ہونے لگیں۔
پہلے تو یہ پوچھا جاتا تھا کہ ماڈل کسی ایک سوال کو حل کر سکتا ہے یا نہیں، اب یہ ایک اور مشکل سوال ہے: جب ایک کام کئی گھنٹوں تک چل رہا ہو، دہوں سے زیادہ ٹول کالز ہو چکی ہوں، کئی بار اسٹیٹ کمپریشن ہو چکا ہو اور کئی بار کوڈ میں تبدیلیاں کی جا چکی ہوں، تو کیا سسٹم اب بھی ایک قابلِ اعتماد موجودہ دنیا برقرار رکھ سکتا ہے؟
ماڈل کی صلاحیتیں مزید بڑھ رہی ہیں، جس سے ہر ایک مرحلے کے فیصلے کی حد بڑھتی جا رہی ہے۔ اور لمبے ایجینٹ کا مستقل طور پر کام کرنا، اب ایک دوسری صلاحیت پر زیادہ منحصر ہو رہا ہے: کیا حالت واضح ہے، کیا اقدامات قابل تصدیق ہیں، اور کیا غلطیاں قابل واپسی ہیں۔
