"کرے گا" سے "چلائے گا" تک، لمبے مدتی ایجینٹ کو کیا کم ہے؟
آج کے دور میں، جب ایجنٹ تیزی سے ترقی کر رہے ہیں، تو Harness نے بڑے ماڈلز کو حقیقی دنیا تک پہنچا دیا ہے، جو ٹولز کو کال کر سکتے ہیں، کوڈ میں تبدیلی کر سکتے ہیں اور تجربات چلا سکتے ہیں۔ لیکن جب کام کئی منٹ سے لے کر کئی دن تک پھیل جائے، تو سسٹم کو اب بھی ایک انسان کو اسکرین کے سامنے لگا رکھنا پڑتا ہے تاکہ اگلے قدم کی طرف رہنمائی کی جا سکے۔
اس بوتل نیک کا بنیادی سبب صرف ماڈل کی صلاحیتوں کا کم ہونا نہیں، بلکہ موجودہ ایجینٹس زیادہ تر "انفیکشن" کو آٹومیٹ کرتے ہیں، لیکن اس کے اوپر کے "ڈرائیونگ" کو حقیقی طور پر آٹومیٹ نہیں کرتے۔ ہارنس ماڈل کو اقدام کرنے کی صلاحیت فراہم کرتا ہے، جبکہ انسان ماڈل کو فیصلہ کرنے کی صلاحیت دیتا ہے۔ جب انسان چلا جائے، تو منصوبہ بھی روک جاتا ہے۔ اور جب تک مکث ریوارڈ فیدبیک نہ ہو، ایجینٹ کا انجام اور رد عمل بھی سست اور بے چین لگتا ہے۔
اس مسئلے کو حل کرنے کے لیے، مائیکروسافٹ، شنگھائی جیائوٹونگ یونیورسٹی جیسے اداروں نے ارگس کو اوپن سورس کیا ہے، جو لمبے دور کے تحقیقی کاموں کے لیے ایک جامع ایجنٹ استدلال رن ٹائم ہے، اور ٹیکنیکل رپورٹ جاری کی ہے۔ نظام ثبوت سے متاثر، خود بہتر بننے والے، متعدد ایجنٹ تعاون، اور مرکزی اور تخصص شدہ حوزوں کے الگ کرنے والے ڈیزائن کے ذریعے، ایجنٹ کو بھرپور معیاری فیڈبیک کے بغیر کئی دن تک متعدد شعبوں میں مستقل تحقیق کرنے کی اجازت دیتا ہے۔
رپورٹ میں 27 کیمپینز اور 1,548 گھنٹے کی گھڑی کی وقت شامل ہیں۔ اوسطاً ہر 40.7 گھنٹے میں ایک فعال درخواست پر انسانی مداخلت کی ضرورت پڑی؛ رپورٹ کا ورک ڈیوٹی فیصد 95.1% سے 98.7% تھا۔ اس Argus ڈیلیوری نے صرف اعلیٰ اسکور والے بینچ مارک نہیں دیا، بلکہ ایک مکمل پروڈکشن لیول کا نتائج کا مجموعہ پیش کیا۔ ٹیم نے AI4AI، GPU Kernel، ماڈل ٹریننگ، AI4Science، چپ ڈیزائن، AI4math، AI4System جیسے وسیع کاموں پر نتائج پیش کیے، جو Argus کی عام صلاحیت اور حقیقی تحقیقی سطح کے ذہانت کو ظاہر کرتے ہیں۔

شکل 1: ارگس رن ٹائم، کابیلیٹی بینچ مارک اور ڈیلیوری ریزولٹس کا جائزہ۔

- تقریر کا عنوان: Argus: دنوں کے لیے ہیرس کو کون چلاتا ہے؟
- کاغذ: https://arxiv.org/abs/2608.05144
- کوڈ: https://github.com/lbx154/Argus
- پروجیکٹ کی ویب سائٹ: https://argusbot.cn/
- پروجیکٹ کے نتائج کا اوپن سورس لائبریری: https://github.com/Argus-AiTeam
- پروجیکٹ میتھ ہیلپ لائیو: https://open.argusbot.cn/#counterexample-live
01
ہدف کی بنیاد پر سے شواہد کی بنیاد پر منتقلی:
ایجینٹ کا اگلا قدم کون فیصلہ کرے گا؟
گزشتہ دو سالوں میں ایجنٹ انجینئرنگ کی اہم ترقیات ہارنیس پر مرکوز رہی ہیں: خود چلنے والے گاڑیوں کے FSD کے مثال کے طور پر، ماڈل انجن کی طرح ہے، جبکہ ہارنیس ٹرانسمیشن سسٹم کی طرح ہے، لیکن اصل میں گاڑی کہاں جائے گی، یہ اسکرین کے سامنے بیٹھے انسان کا فیصلہ ہے۔ مختصر کاموں میں، جیسے عام آٹو پارکنگ، کام خود بخود واضح ردعمل فراہم کرتا ہے؛ لیکن جب کام کئی دنوں تک پھیل جائے، تو تحقیقی مسائل عام طور پر مستقل انعام نہیں دیتے اور نہ ہی شروع سے ہی واضح مقاصد ہوتے ہیں۔ موجودہ ایجنٹس اس لحاظ سے اپنا اصل瓶颈 ظاہر کرتے ہیں: وہ ابھی تک انجام دینا جانتے ہیں، لیکن عدم یقین میں مستقل جائزہ لینا نہیں جانتے۔

شکل 2: ارگس، خودکار تحقیق کو لاگو کرکے انسان کا کردار مستقل ڈرائیونگ کی جگہ سے سہولت کی جگہ میں تبدیل کرتا ہے۔
ارگس اس پوزیشن کو ڈرائیور کہتی ہے جو ہارنیس کے اوپر پہلے کبھی آٹومیٹ نہیں ہوا تھا۔ اس کا کام یہ ہے کہ منصوبہ اور حقیقت میں تنازع ہونے پر بھی، ثبوت کے مطابق ہدایت جاری رکھے۔ تحقیق کے آغاز میں لکھے گئے مقاصد صرف معلومات کے کم ترین مرحلے کی ابتدائی فرضیات ہوتے ہیں؛ اگر ایجنٹ صرف مقصد-مبنی طریقے سے پیش گئے ہوئے مقصد کا تعاقب کرتا رہے، اور ناممکن مقاصد پر بار بار ٹوکن ضائع کرتا رہے، تو مقصد کی سختی پیدا ہو جائے گی۔ جبکہ ثبوت-مبنی طریقہ کار منطق کو الٹ دیتا ہے: اگلی قدم، منصوبے کی ابتدائی فرضیات کے بجائے موجودہ ثبوت سے طے ہوتا ہے۔ عمل کے دوران حاصل ہونے والے تمام نتائج، راستہ بدلنے کے لیے مؤثر ثبوت ہوتے ہیں؛ نظام بالکل ثبوت سے چلتا ہے۔ خاص طور پر، ڈرائیور کو موجودہ ثبوت کے مطابق درج ذیل چار سوالات کا بار بار جواب دینا ہوگا:
کیا یہ کام مکمل ہو چکا ہے اور اس کی معیار کافی اچھا ہے؟
2. موجودہ شواہد کے ساتھ، اگلے مرحلے میں سب سے زیادہ قابلِ توجہ کام کیا ہے؟
3. اس دور سے حاصل کی گئی تجربات کے مطابق مستقبل کے سسٹم کے رویے میں کیا تبدیلی کی جانی چاہئے؟
4. باقی سوالات کیا ایسے فیصلوں سے متعلق ہیں جن کو صرف انسان ہی لے سکتا ہے؟
02
ایک عام کسٹمائزڈ لانگ رن ٹائم سیٹ اپ کریں
ارگس لمبے مدتی منصوبوں کو مستقل کیمپین میں منظم کرتا ہے، جنہیں مخصوص حدود والے مشن میں تقسیم کیا جاتا ہے۔ اس کا بنیادی حلقة یہ ہے: منیجر → پلانر → انجینئر ⇄ ریویور → منیجر:
OpenAI Codex کے /goal ماڈل کے حوالے سے، ارگس کی ڈیزائن کی سمت کو زیادہ واضح طور پر سمجھا جا سکتا ہے۔ /goal ایک ایجنٹ کے ایک منفرد چکر کو ایک مقصد حالت کے ساتھ مستقل چکر میں تبدیل کرتا ہے؛ جبکہ ارگس تحقیقی منصوبوں کو متعدد کرداروں، متعدد ہارنسز، اور طویل مدتی رن ٹائم میں جمع ہونے والی معلومات کے ساتھ منظم کرتا ہے۔ پہلا سوال کرتا ہے: "ایجنٹ کو کیسے روکے بغیر چلاتے رہیں؟" جبکہ دوسرا سوال کرتا ہے: "جب ایجنٹ روکے بغیر چل رہا ہو، تو اسے کیسے مؤثر طریقے سے کام پر لگایا جائے؟" یہ بالکل رن ٹائم لیول پر Goal-Driven سے Evidence-Driven میں منتقلی کے مطابق ساختی فرق ہے۔
1. مینیجر مرحلہ تبدیلی، پروسیجر کی منظوری، اور جامع حکمت عملی پر کنٹرول رکھتا ہے؛
2. پلانر موجودہ ثبوت کے مطابق مخصوص کاموں کی منصوبہ بندی کرتا ہے؛
3. انجینئر حقیقی کوڈ بیس، تجربات، اور اجراء میں داخل ہو جائیں؛
4. جائزہ کنندہ مصنوعات کا مستقل جائزہ لیتا ہے اور نوآوری اور اثرات کا جائزہ لے کر مینیجر کو رپورٹ کرتا ہے یا انجینئر کو واپس بھیج دیتا ہے۔
یہاں اہم بات یہ نہیں کہ متعدد کردار ہیں، بلکہ کنٹیکس کو الگ کرنا ہے — متعدد کردار ایک دوسرے کے ساتھ مل کر اس بات سے بچتے ہیں کہ ایجنٹ صرف ایک سادہ لوکل کلائمبِنگ ایلگورتھم بن جائے، ہر کردار کے پاس اپنا منفرد کنٹیکس ہوتا ہے لیکن وہ مشترکہ ورک اسپیس کا استعمال کرتے ہیں، تاکہ منصوبہ بندی، انجام دینا اور تصدیق کا کام صرف ایک ایجنٹ پر نہ ڈالا جائے، جس سے ٹوکن کی کارکردگی بڑھتی ہے۔ اسی لیے، آرگس کے ایک ٹاسک میں، Pi، Codex، Claude Code کو одно وقت فعال کیا جا سکتا ہے، ڈیپسیک ہارنیس مختلف ہارنسز کے ساتھ، جو اعلیٰ کسٹمائزیشن کو یقینی بناتے ہیں۔
سسٹم ایک مکمل آرٹی فیکٹ محفوظ کرتا ہے؛ صرف ثبوت کی حد پر پہنچنے والے تجربات ہی ویکی اور سکل میں داخل ہوتے ہیں اور منصوبہ، عمودی یا جیگل سکوپ کے مطابق بعد کے کاموں کے لیے دوبارہ استعمال کیے جاتے ہیں۔
اسی دوران، Core اور Vertical الگ رہتے ہیں: Core کردار کی اجازتیں، ثبوت جمع کرانا اور انسانی حدود کے لیے ذمہ دار ہے، جبکہ Vertical، شعبہ کے ماہرین کی طرف سے ریاضی، GPU، مواد وغیرہ کے کاموں میں کیا ثبوت معتبر ہے اور متعلقہ انسانی مہارت اور علم کو تعریف کرتا ہے؛ Vertical تحقیقی کاموں کی تحویل کی معیار کو واضح طور پر بڑھا سکتا ہے، اور انسانی ماہرین اور ایجنٹ کے ساتھ مشترکہ ترقی، اور کسٹمائزڈ ورک فلو کے لیے بھی ایک انٹرفیس فراہم کرتا ہے۔

شکل 3: ارگس کا لمبے عرصے تک چلنے کا طریقہ۔ چار کردار مستقل حالت کے گرد گردش کرتے ہیں، اور کیمپین آٹھ تحقیقی مراحل کے درمیان آگے بڑھ سکتا ہے یا پیچھے ہٹ سکتا ہے۔
03
1548 گھنٹے کے بعد، ارگس نے کیا چھوڑ دیا؟
لمشروعِ طویل المدت Agent کو کامیاب بنانے کا اصل معیار یہ ہے کہ کیا وقت کو حقیقی تحقیقی نتائج میں تبدیل کیا جا سکتا ہے۔ Argus کے اوپن سورس ہونے کے ایک ماہ سے بھی کم عرصے میں، ہم نے بنیادی ڈھانچہ، مواد، چپ، ریاضی اور AI سسٹمز کی تحقیق میں عظیم کامیابی حاصل کر لی ہے، اور ہم پہلی ٹیم ہیں جس نے مکمل اینڈ تو اینڈ ریاضی کے تخمنوں کے حل کے لیے فلٹرنگ لاگز شائع کیے ہیں، جس میں تمام رن ٹریکس سیشنز سمیت تمام ڈیٹا کو کھلا کر دیا گیا ہے۔ درج ذیل Argus کے اوپن سورس ہونے کے بعد حاصل کردہ کامیابیوں کا خلاصہ ہے:

شکل 4: ارگس کے نمائندہ تحقیقی نتائج، اہم اشاریے اور قبولیت کے معیارات
جیسا کہ اوپر کی جدول میں ظاہر ہے، ارگس نے پہلے AI4System & Infra میں مستقل عمل کو قابل قبول حقیقی ڈیلیوری میں تبدیل کیا، جس سے خودکار اجراء سے خودمختار تحقیق کی طرف پہلا واضح انجینئرنگ نتیجہ حاصل ہوا؛ پھر، کام AI بنیادی ڈھانچے سے AI4Science، AI4Hardware، AI4Math تک وسعت پذیر ہوا، اور جائزہ کا معیار "تعین شدہ کام مکمل ہوا یا نہیں" سے "کیا یہ ابھی تک حل نہ ہونے والے حقیقی تحقیقی مسائل کا جائزہ لے سکتا ہے" میں تبدیل ہو گیا، جس سے خودکار تحقیق خودکار ڈیلیوری سے آگے بڑھ کر خودکار تلاش تک پہنچ گئی؛ اس بنیاد پر، ارگس نے AI4AI کے رخ میں اکیلے نتائج سے مکمل تحقیقی عمل تک وسعت پذیر کی، جس میں ثبوت کے ذریعے کام کو مستقل طور پر آگے بڑھایا جاتا ہے، اور انسان کو ہمیشہ اسکرین کے سامنے بیٹھنے کی ضرورت نہیں پڑتی، جس سے حقیقی ڈیلیوری، علاقائی تلاش، اور مکمل عمل کی خودمختار تحقیق کا ایک تدریجی راستہ تشکیل پاتا ہے۔

شکل 5: ارگس کا مکمل پیپر پروڈکشن پروسیس میں انجام۔
یہ تمام نتائج ایک ماہ کے اندر حاصل کیے گئے ہیں، ان کو جوڑ کر، ارگس ایک تدریجی طور پر گہری ہونے والی قیمت کی سلسلہ ہے: خودکار شے کا ایک بار کا عمل، ثبوت سے ہدایت پذیر تحقیق کی ترقی تک وسعت پذیر ہو گیا ہے، جس سے تحقیقی پیش رفت میں بڑی تیزی آئی ہے، اور یہی "جب انسان اسکرین سے دور ہو جائے تو ایجنٹ کو کون چلائے گا؟" کا سب سے براہ راست جواب ہے۔
اختتام
اسکرین بند ہونے کے بعد، پروجیکٹ صفر نہیں ہوا
لمبے مدتی ذہانت یہ ہے کہ ٹوکن کو ذہانت میں تبدیل کیا جائے، اور پھر اس ذہانت کے ذریعے ایک تحقیقی منصوبہ آگے بڑھایا جائے اور حقیقی قیمت پیدا کی جائے۔ ارگس وہ مدلز کو جو اب تک الگ الگ تھے، ایک لگاتار کام کرنے والی تحقیقی نظام میں منظم کرتا ہے، جہاں Evidence-Driven رہنمائی کرتا ہے، اور خود کو ترقی دے کر تجربات کو صلاحیتوں میں تبدیل کرتا ہے۔
ارگس صرف ایک لمبا چلنا والے ایجنٹ نہیں دکھاتا، بلکہ تحقیق کے طریقہ کار کا ایک نیا انداز ہے: ہارنیس ماڈل کے کام کرنے کا طریقہ حل کرتا ہے، ڈرائیور نظام کو جاری رکھنے کا فیصلہ کرتا ہے، اور تحقیقی رفتار اب انسانی کام اور تفریح کے وقت سے محدود نہیں۔ اس کا مطلب ہو سکتا ہے کہ تحقیق کا تیز ہونے والا دور آ رہا ہے۔ اسکرین بند ہو سکتی ہے، لیکن تحقیق جاری رہتی ہے۔
لکھاری کا تعارف
ارگس کی قیادت مائیکروسافٹ اور شنگھائی جیائوٹونگ یونیورسٹی کے محققین نے کی ہے، جس میں کئی یونیورسٹیوں کے محققین شامل ہیں۔
یہ مضمون ویچن گروپ "مشین سینٹر" سے ہے
