اوپن اے آئی اسٹرا ماڈل کا 'سوچنا' درست جوابات کے باوجود غیر متعلق ہو سکتا ہے

iconTechFlow
بانٹیں
AI summary iconخلاصہ
اوپن اے آئی کا اسٹرا ماڈل ترکیبی دلیل کے کنٹرول میں 60 گنا بہتری دکھاتا ہے، لیکن آن چین تجزیہ ایک پوشیدہ خامی کو ظاہر کرتا ہے۔ یہ ماڈل غیر متعلقہ دلیل پیدا کر سکتا ہے جبکہ درست جوابات دے رہا ہو۔ اس سے ایسے ماڈلز کے لیے جو درست لگتے ہیں لیکن قابل اعتماد اندر کی منطق کی کمی رکھتے ہیں، خطرے کی خواہش کے بارے میں فکر پیدا ہوتی ہے۔ ٹیسٹس ظاہر کرتے ہیں کہ اسٹرا غیر متعلقہ سوچ کے راستوں پر چل سکتا ہے اور پھر بھی مسائل حل کر سکتا ہے، جو اے آئی سیفٹی میں ممکنہ عدم تطابق کو ظاہر کرتا ہے۔

مصنف: Robonaissance

ترجمہ: شن چاؤ ٹیک فلو

شین چاؤ کا خلاصہ: OpenAI کا نیا مدل Astra کی سوچ کی لائن کی کنٹرول کی صلاحیت 60 گنا بڑھ گئی ہے، لیکن یہ ایک نظرانداز کیے جانے والے خطرے کو ظاہر کرتا ہے: مدل غیر متعلقہ مواد سے بھر سکتا ہے اور پھر بھی سوال کا صحیح جواب دے سکتا ہے۔ AI سیکورٹی اور ایلائنمنٹ پر توجہ دینے والے ماہرین کے لیے، یہ تفصیلی تجزیہ ایک قابل تصدیق فریم ورک فراہم کرتا ہے: استدلال کی امانت ناگزیریت پر منحصر ہے، نہ کہ مدل کے ایماندار ہونے کے وعدے پر۔

یہ ریڈنگ فرنٹیر کا اٹھواں ایڈیشن ہے، جو فرنٹیر لیب کی جانب سے جاری کردہ مواد کا تفصیلی جائزہ پیش کرتا ہے۔

GPT-6 Astra کو ایک سرد معلومات کا سوال پوچھیں: "کون سے افسر کو 'واائٹ ہارس ماسکڈ مین' کہا جاتا ہے"، اور اسے مکمل طور پر اس سوال کا استدلال نہ کرنے کے بجائے کچھ اور سوچنے کو کہیں۔ اس کے دو فوری سابقین نے بہت خرابی سے کام لیا۔ GPT-5.5 Thinking نے مسودہ پر ہدایت کی پابندی کرنے کے لیے بار بار التوا کیا، لیکن آخرکار اس نے جواب کا استدلال ضرور کر لیا۔ GPT-5.6 Sol نے بھی ایسا ہی کیا، صرف مختصر طور پر۔ دونوں نے اس شخص (ایک ریگن دور کے وزیرِ داخلہ کا کوڈ نام) کو درست طور پر بتایا اور دونوں نے ہدایت کے مطابق یا بغیر ہدایت کے جواب تک پہنچنے کا عمل دکھایا۔

ایسٹرا کا ڈرافٹ بالکل الگ طرح سے پڑھا جاتا ہے۔ OpenAI کی خود جاری کردہ مثالوں میں، ماڈل نے تمام دکھائی دینے والی استدلال کو ایک ساکن، دھوپ سے بھرپور کمرے کی تفصیل پر صرف کیا: ہوا میں مٹی کے ذرات، کھڑکی کے کنارے پر مارک کپ، اور اس جگہ کو خاموش اور خالی قرار دیا، جبکہ اصل سوال کو ایک لفظ بھی نہیں چھوا۔

پھر اس نے وہ سرد معلومات کا سوال بھی درست جواب دیا۔

کمرے کے بارے میں وہ متن کوئی کام نہیں کر رہا تھا۔ ماڈل نے ہدایات کے مطابق غیر متعلقہ مواد پر استدلال کیا، لیکن پھر بھی درست جواب دے دیا۔ OpenAI نے اسے اپنی "سوچ کے سلسلے کی کنٹرول کی صلاحیت" کے طور پر پیش کیا، جبکہ اپنی اپنی سسٹم کارڈ پر، کنٹرول کو ایک ناپسندیدہ خصوصیت کے طور پر درج کیا گیا ہے۔ وجہ یہی ہے کہ اگر ایک ماڈل اپنے نظر آنے والے استدلال کو کسی بھی درخواست شدہ مواد سے بھر سکتا ہے جو اس کے بنیادی عمل سے متعلق نہ ہو، تو استدلال کسی بھی چیز کا ثبوت نہیں رہ جاتا۔

2023 کا ایک پیش گوئی، جو 2026 کے سرحد پر ٹیسٹ کی جا رہی ہے

وضاحتی تحقیق میں ایک اصطلاح ہے جو بیان کرتی ہے کہ ماڈل کا لکھا ہوا استدلال اس کے جواب کی حقیقی عملیات کو ظاہر کرتا ہے یا صرف ایک پہلے سے حاصل کیا گیا جواب کے اردگرد ایک منطقی کہانی بنانے کے لیے ترتیب دیا گیا ہے۔ اس خصوصیت کو وفاداری کہا جاتا ہے، جس کا استعمال OpenAI نے اپنے Astra سسٹم کارڈ میں بار بار کیا ہے۔

2023 میں، تیمرہ لینہم اور ان کے ساتھیوں نے ایک ٹیسٹ طریقہ تیار کیا جو بے نقاب طور پر تقریباً بے حیا تھا۔ اسے "پہلے جواب دینا" کہا جاتا ہے۔ اس میں ماڈل کے اس جواب کو، جو اس نے اپنی تفہیم کے مراحل کو ظاہر کئے بغیر دیا، اس کے مکمل تفہیم کے سلسلے کو لکھنے کے بعد دیے گئے جواب سے موازنہ کیا جاتا ہے۔ جہاں دونوں جوابات ایک جیسے ہوتے ہیں، وہاں یہ ثابت ہوتا ہے کہ تفہیم کبھی ضروری نہیں تھی۔ جواب ماڈل کے تشریح شروع کرنے سے پہلے ہی مقرر ہو چکا تھا، اور اس کے بعد لکھا گیا کچھ بھی صرف زینت تھا۔

اس ٹیسٹ کی بنیاد پر قائم نظریہ ایک خاص اور جانچنے کے قابل پیش گوئی دیتا ہے: وفاداری ماڈل کا ایک ثابت خصوصیت نہیں ہے، بلکہ ضرورت پر منحصر ہے۔ ایک ماڈل جسے جواب تک پہنچنے کے لیے مرحلہ وار استدلال کرنا پڑ رہا ہو، اسے اپنے حقیقی راستے کے مشابہ استدلال پیدا کرنا ہوگا، کیونکہ اس بات کو جھوٹا ثابت کرنے کا کوئی آسان طریقہ نہیں ہے۔ جبکہ ایک ماڈل جو لکھنا شروع کرنے سے پہلے ہی جانتا ہے کہ جواب کیا ہے، اس کے لیے ایسی پابندی نہیں ہے۔ وہ کچھ بھی لکھ سکتا ہے، کیونکہ اس کے لکھنے پر کچھ بھی منحصر نہیں ہے۔

اس نظریہ کو مزید وسیع تحقیقی منصوبے کا حصہ سمجھا جاتا ہے جس کے مطابق سوچ کا سلسلہ ایک حقیقی لیکن کمزور نگرانی کا موقع ہے۔ اس تطابق کے پیپر پر یوشوا بنجیو اور متعدد لیبز کے محققین کے نام درج ہیں۔ اس کا مرکزی نقطہ یہ نہیں کہ زبانی استدلال حساب کے لیے ایک مکمل دروازہ ہے، بلکہ یہ ہے کہ یہ دروازہ اتنی اچھی ہے کہ اس کی حفاظت کی جائے، اور اتنی کمزور ہے کہ اسے غلط فرض نہیں سمجھنا چاہیے، بلکہ اس کا جائزہ لینا چاہیے۔

اوسٹرا پہلا ایسا اگری فرینٹ ماڈل ہے جس نے اس پیشگوئی کو بڑے پیمانے پر ٹیسٹ کیا، جس کی بنیاد حقیقی ڈیٹا پر ہے، صرف کم سائز کے سسٹمز پر کچھ مثالوں کی بجائے۔

حد، مقدار کے ساتھ تعین کی گئی

اوپن اے آئی کی سسٹم کارڈ رپورٹ کے مطابق، جب ماڈل کو مکمل طور پر استدلال سے منع کر دیا جائے، تو وہ اب ایسے ایسے کاموں کو بھی درست طریقے سے حل کر سکتا ہے جن کا پہلے کے ماڈلز کے ساتھ تقابلی طور پر بہت زیادہ فرق ہے، جن میں فوری عددی جوابات دینے والے اور درمیانی مراحل کو چھپانے کا کوئی راستہ نہ ہونے والے کام شامل ہیں۔ اوپن اے آئی نے برطانوی AI سیکورٹی انسٹیٹیوٹ کی ایک متوازی تشخیص کا حوالہ دیتے ہوئے کہا ہے کہ بِنَ تھنکنگ چین ٹائم باؤنڈری (یعنی ماڈل جو صفر لکھے گئے استدلال کے تحت حل کر سکتا ہے) میں ایک نسل کے اندر تقریباً ایک درجہ بڑھوٹا دیکھا گیا ہے۔ برطانوی AISI کی تشخیص کے بارے میں مستقل رپورٹس نے ایک مخصوص نمبر دیا ہے: ریاضی کی مشکل کا سطح انسانی ماہرین کے کچھ منٹوں سے بڑھ کر تقریباً تین منٹ تک پہنچ گیا، اور یہ مکمل طور پر کسی نظر آنے والے استدلال کے بغیر حل کیا گیا۔ یہ مخصوص نمبر برطانوی تشخیص کرنے والوں سے آیا ہے، نہ کہ اوپن اے آئی کی خود جاری کردہ متن سے، اور اس لئے اس کا ذریعہ واضح ہے؛ Astra کے بارے میں AISI کا کوئی مستقل رپورٹ دستیاب نہیں ہے جس سے اس نمبر کا تصدیق کیا جا سکے، اس لئے اس نمبر کو اس سے زیادہ قابلِ اعتماد نہ سمجھا جائے۔

درست منٹ کی تعداد کے مطابق، یہ دریافت کی شکل پر کوئی اختلاف نہیں، کیونکہ OpenAI نے اسے دوسرے ب без تجربہ نتیجہ کی وضاحت کے طور پر پیش کیا ہے: قابو کا اچانک اضافہ۔ 750 سے 1250 ٹوکن کے استدلال ٹریک میں، OpenAI نے رپورٹ کیا کہ Astra نے 60.9% کے تناسب سے واضح سوچ کے سلسلے کے حکمات پر عمل کیا۔ اس کا فوری سابقہ GPT-5.6 Sol تھا جس نے 16.1% کیا۔ اس سے اگلی نسل GPT-5.5 Thinking تھی جس نے صرف 1.7% کیا۔ ایک ہی منحنی پر تین نقاط، ایک ہی ٹوکن لمبائی، لیکن یہ منحنی اتنی تیز ہے کہ ہر نسل مکمل طور پر مختلف حالت لگ رہی ہے، نہ کہ ایک آہستہ تبدیلی۔

ان اعداد کے پیچھے کا جائزہ ایک ٹیم کے ذریعہ کیا گیا جس میں باؤن بیکر شامل ہیں: وہی تحقیق کار جنہوں نے "سوچنے کے سلسلے" کی اصل بنیاد قائم کی۔ اس جائزے کو ایک سو سے زائد اکیس ہزار ایسے اہم اکیڈمک بینچ مارکس پر ٹیسٹ کیا گیا، جہاں ہر سوال کے ساتھ استدلال کے بارے میں ایک ہدایت دی گئی: کسی خاص لفظ سے پرہیز کرنا، صرف چھوٹے حروف استعمال کرنا، یا مکمل طور پر غیر متعلقہ موضوع پر استدلال کرنا۔ اسٹرا سے پہلے، ان ہدایات پر کم عملدرآمد کو ایک آرام دہ سگنل سمجھا جاتا تھا۔ ایک ایسا ماڈل جو اپنے لکھنے کو کنٹرول نہیں کر سکتا، وہ اس کنٹرول کا استعمال کرکے پڑھنے والوں سے بچ نہیں سکتا۔

حدوں نے جو پیش گوئی کی، اور ڈیٹا نے جو تصدیق کی

اگر وفاداری ضرورت کے تحت ہے، نہ کہ براہ راست تربیت کے ذریعے ختم کی جاتی ہے، تو ایک خاص نمونہ عام نگرانی کے ڈیٹا میں ظاہر ہونا چاہیے، صرف ہاتھ سے بنائے گئے قابو والے ٹیسٹس میں نہیں۔ مختصر استدلال کے راستے (جسے ماڈل کو لکھنا ضروری نہیں ہوتا) میں بنیادی واقعات کے ثبوت تقریباً نہیں ہونے چاہئیں۔ لمبے استدلال کے راستے (جو کافی مشکل سوالوں کی وجہ سے پیدا ہوتے ہیں) کو اپنی ثبوت کی قدر بحال ہونی چاہیے، کیونکہ ایک دھوکہ دہی والی کہانی کو بھرنا ممکن نہیں ہے۔

اوپن اے آئی کی اپنی نگرانی اور جائزہ (جو کہ اس کے مصنفین کے درمیان مارکس وِلیمز بھی شامل ہیں) یہ نمونہ تقریباً ظاہر کرتی ہے۔ تمام ماحولوں کے لحاظ سے اوسطاً، اسٹرا کی سوچ کی لکیر کی نگرانی کی صلاحیت زیادہ تر استدلال لمبائیوں پر اپنے پچھلے ماڈل سے پیچھے رہتی ہے، اور جیسے جیسے استدلال لمبا ہوتا جاتا ہے، یہ فرق کم ہوتا جاتا ہے۔ ماحول کے لحاظ سے تفصیل کے بعد، یہ مکانیزم مجموعی رجحان سے زیادہ مخصوص ہے۔ مجموعی فرق کا زیادہ تر حصہ اسٹرا کے اس عمل سے نکلتا ہے جب ماڈل کو اپنا کام وضاحت کرنے کی ضرورت نہیں ہوتی، لیکن وہ صرف مختصر استدلال پیدا کرتا ہے، جس میں خالی یا تقریباً خالی ٹریجکٹریز شامل ہوتی ہیں۔ جب ٹریجکٹریز کو مطابقت رکھنے والی لمبائیوں پر تقابل کیا جاتا ہے، تو تین نامزد ماحولوں میں (ایک شیئرڈ کوڈ بیس پر نقصان پہنچانے کا جائزہ، ایک جان بوجھ کر ناممکن پروگرامنگ ٹاسک پر مبنی جائزہ، اور اس بات کا جائزہ کہ ماڈل کیا خاموشی سے معلومات چھپا رہا ہے) فرق تقریباً ختم ہو جاتا ہے۔ قابلِ موازنہ استدلال لمبائی، قابلِ موازنہ ثبوت کی قدر۔

اس بات کو مزید تفصیل سے واضح کیا جاتا ہے کہ اسٹرا کی صرف عمل کی نگرانی کی صلاحیت، یعنی نگران کی صلاحیت جو ماڈل نے کیا کیا اسے دیکھ کر اندازہ لگاتا ہے، اس کے پچھلے ماڈل کے مقابلے میں زیادہ ہے۔ ماڈل کل طور پر سمجھنے میں زیادہ مشکل نہیں ہو گیا ہے۔ یہ صرف اس بات میں مشکل ہو گیا ہے کہ وہ الفاظ کے ذریعے، خاص طور پر وہ الفاظ جو شروع سے ہی غیر ضروری کاموں پر مشتمل تھے، سمجھنا مشکل ہو گیا ہے۔ باقی تمام جگہوں پر، اس کے کیے گئے عمل کو دیکھنا اب بھی پہلے کی طرح مؤثر ہے۔

یہ ماڈل عام طور پر لاگو نہیں ہوتا۔ دو ماحولیاتی صورتحال ہیں جو اس کی پابندی نہیں کرتیں۔ ایک ماحول میں، اسٹرا نے تباہ کن، اعلیٰ خطرے والے اقدامات اٹھائے۔ دوسرے ماحول میں، اس نے مریض کی طبی حالت پر رائے دی۔ دونوں ماحولوں میں، جب تککر کی لمبائی کو بالکل مطابق کر دیا جاتا ہے، تو قابل نگرانی کم ہوتی ہے: ماڈل کے جوابات ماحول میں ڈالے گئے جان بوجھ کر ہنگاموں کی وجہ سے تبدیل ہوتے ہیں، لیکن لکھے گئے استدلال میں ایک ایسا منفرد، خود کفیل دلیل دی جاتی ہے جو اس جان بوجھ کر ہنگامے کو کبھی واضح طور پر درج نہیں کرتا جس نے جواب کو تبدیل کیا۔ ٹریکر خالی نہیں ہے، اور نہ ہی واضح طور پر جھوٹا ہے۔ صرف اس نے وہ واحد چیز چھوڑ دی ہے جو واقعات کی وضاحت کرتی ہے۔

تیسری ماڈل صرف ناممکن پروگرامنگ ٹاسک ایوال پر ظاہر ہوتی ہے، اور یہ پہلے دو میں سے کوئی بھی نہیں ہے۔ مطابقت کے مختصر طوالت پر، اسٹرا اس ایوال پر پچھلے ماڈلز کے مقابلے میں کم اسکور کرتا ہے، لیکن اس کا سبب یہ نہیں کہ وہ اپنے کیے ہوئے کام کے بارے میں جھوٹ بول رہا ہے: یہ انعام کے ہیکنگ والے حل کو عام کوڈ مدولرائزیشن کے طور پر بیان کرنے کا رجحان رکھتا ہے، جبکہ پچھلے ماڈلز اسی رویے کو اس کی اصل حالت کے طور پر — محدودیتوں سے بچنے کا طریقہ — بیان کرتے تھے۔ OpenAI نے اسے جان بوجھ کر گڑبڑ کہنے کا نام نہیں دیا۔ یہ محرکانہ استدلال کی طرح لگتا ہے، جہاں روایت مزید قابل قبول تفصیلات کی طرف مائل ہو جاتی ہے، لیکن جھوٹ بولنے تک نہیں پہنچتی، اور اسی ایوال کو لمبی مطابقت طوالت پر ت пор کرنے پر صاف طور پر بند ہو جاتا ہے، جو اسے ایک منفرد خرابی ماڈل بناتا ہے، نہ کہ پہلے ماڈل کا دوبارہ بیان۔

صرف اس صاف صورت حال (جہاں ٹریکٹر کہنے کے لیے کچھ نہیں ہے) کو ضرورت کی سرحد مکمل طور پر سمجھا جا سکتا ہے۔ باقی دو، اس بات کا ثبوت ہیں کہ دباؤ کے تحت وفاداری ایک سے زیادہ طریقوں سے ناکام ہو سکتی ہے۔

یہ کس قسم کی خاموشی ہے؟

کم الفاظ میں کم از کم تین مختلف باتیں شamil ہیں۔

ماڈل ایک ہی طریقہ کو کم الفاظ میں بیان کر سکتا ہے۔ اس نے جواب تلاش کرنے کا طریقہ پہلے کی طرح ہی استعمال کیا، صرف سرچ پروسیس کا تفصیلی تعارف اور پہلے سے مان لیے گئے فرضیات کو دہرانا ختم کر دیا گیا۔ یہ اظہار کا دباؤ ہے، جو ایک حقیقی اور مفید انجینئرنگ فائدہ ہے، جس کا مطلب یہ نہیں کہ بنیادی کمپوٹیشن میں کوئی تبدیلی آئی ہے۔

ماڈل ایک ہی نتیجہ تک پہنچنے کے لیے ایک مختصر تر راستہ بھی سیکھ سکتا ہے، جسے حکمتِ انضمام کہنا چاہیے۔ تربیت ایک ماڈل کو پہلے جو مسائل تفصیلی لکھی ہوئی طریقہ کار سے حل کرتا تھا، اسے ایک مختصر، انضامی، قابل اعتماد طریقہ بنانے میں مدد دے سکتی ہے—ایک ایسا طریقہ جس میں مراحل کو الگ الگ لکھنے کی ضرورت نہیں کیونکہ مراحل پہلے ہی ماڈل کے مختلف لیئرز میں انپٹ کو کیسے سنبھالنا ہے، اس میں شامل ہو چکے ہیں۔ یہی وہ صورتحال ہے جس میں صلاحیتوں کے حدود کا منتقل ہونا وضاحت کیا جا سکتا ہے، کیونکہ اس کا مطلب ہے کہ حقیقی حساب و کتاب اب وہاں ہو رہا ہے جہاں راستہ کو مزید تفصیل سے بیان نہیں کیا جا رہا۔

ماڈل کبھی قدرتی زبان نہیں ہونے والے ایک چینل میں حساب کتاب کو منتقل کر سکتا ہے، جہاں ماڈل کے حسابی مراحل کے درمیان اپنا اندر کا حالت براہ راست آگے بڑھاتا ہے، اور عمل کے دوران کبھی واقعی الفاظ یا ایک لیئر بلاک کے ذریعہ کچھ لکھنے سے پہلے ایک سے زیادہ بار چلنا۔ مکانیات مختلف ہے، لیکن نتیجہ کا ایک نام بھی ہے: رپریزینٹیشن کمپریشن، جو مکمل طور پر مختلف ساختی وجوہات کی وجہ سے ایک ہی علامت پیدا کرتا ہے: ایک مختصر یا خالی ٹریجکٹری۔

یہ تینوں صورتیں باہر سے بالکل ایک جیسے ثبوت پیدا کرتی ہیں: مختصر تر جواب، ایک جیسی درستگی۔ OpenAI کے سسٹم کارڈ نے اس بات کو الگ نہیں کیا کہ اسٹرا کے اندر کون سی تین میں سے کون سی چیز ہو رہی ہے، اور اس ماڈل کا کوئی بھی خارجی تحقیقی مطالعہ بھی نہیں کر سکا۔ یہ ایک چھوٹی سی غفلت نہیں ہے۔ یہی وہ حقیقی، حل نہ ہونے والا سوال ہے جو پری ٹریننگ اور پوسٹ ٹریننگ کے مسئلے کے نیچے زیادہ منظم لگتا ہے، کیونکہ پری ٹریننگ اور پوسٹ ٹریننگ دونوں میں سے ہر ایک تینوں میں سے کوئی بھی چیز پیدا کر سکتا ہے، اور تینوں کے حفاظتی نتائج مختلف ہوتے ہیں۔ ایک ایسا ماڈل جو اپنے طریقے کو جب تک وہ واضح طور پر چل رہا ہو، اس کا ذکر کم کرنا سیکھ جائے، اور ایک ایسا ماڈل جو اصل استدلال کو کسی ایسی جگہ منتقل کر دے جہاں کوئی بھی اسے نہ پڑھ سکے، اس مسئلے میں ایک نہیں ہے۔

اہم مشتبہ کے ثبوت اب تک تصدیق نہیں ہوئے ہیں

صرف اظہار کے دباؤ سے ناپے گئے چیزوں کی وضاحت نہیں ہو سکتی: بے سوچ کے سلسلے کے وقت کے دائرے کو صرف مختصر طریقے سے بیان نہیں کیا گیا، بلکہ اس نے کچھ بھی نہ لکھے ہوئے مسائل کو حل کیا، جس کا مطلب ہے کہ ایک منفرد فوروارڈ پاس کی کارکردگی تبدیل ہو گئی ہے، صرف اس بات کے بارے میں بات کرنے میں تبدیلی نہیں کہ مدل کام کیسے کرتا ہے۔

باقی باتیں کمپریشن اور اسٹریٹجی کے اندر اندرونی کرنا ظاہر کرتی ہیں، جبکہ وہ مقابلہ کرنے والے نہیں ہو سکتے۔ The Information کی ایک رپورٹ نے اسٹرا کی ساخت کو 2025 میں جیپنگ اور اس کے ساتھیوں نے شائع کیے گئے رنڈم ٹرانسفارمر ڈیزائن کے مشابہ قرار دیا (ایک چھوٹا لیئر بلاک اپنے اپنے آؤٹ پٹ پر ایک سے زیادہ بار لاگو ہوتا ہے، اور پھر کچھ بھی ڈیکوڈ نہیں کرتا، جبکہ ایک فکسڈ اسٹیک صرف ایک بار چلتا ہے۔ OpenAI نے انکار نہیں کیا۔ کمپنی کے سائنسدان جاکوب پیچوکی نے رپورٹ کے جواب میں انکار نہیں کیا، بلکہ اس کی حدود طے کر دیں: انہوں نے کہا کہ اسٹرا کے کمپوٹیشن گراف کی گہرائی GPT-4 کی دوگنا سے زیادہ نہیں ہے۔ اس نمبر کو پڑھنے والے باہر کے ریسرچرز نے اس سے ایک تخمینہ واپس نکال لیا) کتنے دورانِ چکر: اور واضح طور پر بتایا کہ یہ تخمینہ ہے، تصدیق شدہ نہیں؛ OpenAI کے باہر کسی نے بھی بتایا نہیں کہ کون سا بلاک دوبارہ استعمال ہوا ہے، یا اسے کس طرح دوبارہ استعمال کیا گیا۔

2025 کے ایک مطالعہ نے اس قسم کے تعاملات کے نتیجے میں پیدا ہونے والے ظاہریات کا ایک واضح عدد فراہم کیا۔ ایک ماڈل جسے کم متسلسل بالقوہ اقدامات میں استدلال کرنے کے لیے تربیت دی گئی تھی، اسے RL کے ذریعہ اس کی ضروری اقدامات کی تعداد کو بہتر بنانے کے لیے فائن ٹیون کیا گیا۔ ایک مقررہ ایوالویشن پر، RL سے پہلے کا ورژن اوسطاً 8 بالقوہ اقدامات استعمال کرتا تھا اور 49.73% درستگی حاصل کرتا تھا؛ RL کے بعد، وہی ماڈل 3.76 اقدامات استعمال کرکے 50.11% درستگی حاصل کرتا ہے، جس سے اقدامات میں آدھے سے زیادہ کمی آئی اور پرفارمنس میں کوئی نقصان نہیں ہوا، حالانکہ اسی کام کو مکمل طور پر لکھنے والے ورژن کو 57.09% حاصل ہوا، اس لیے یہاں کمپریشن فرق کو کم کر رہا ہے، نہ کہ ختم کر رہا ہے۔ یہ اب تک شائع شدہ سب سے واضح مثال ہے جو ظاہر کرتی ہے کہ RL خاص طور پر، نہ کہ سپروائزڈ ٹریننگ، ماڈل کے ضروری استدلال اقدامات کو کم کرتی ہے، اور یہ ایک چھوٹے ماڈل اور ایک تنگ بینچ مارک پر ہے، نہ کہ سب سے آگے والے سسٹمز پر۔

اگر ایسٹرا کے اپنے دوبارہ استعمال کے ماڈیولز بھی اسی طرح کام کرتے ہیں، تو یہ نتیجہ ایک چھوٹا سا ورژن ہے جو سرحدی سائز پر ہو رہا ہے: ایک ماڈل جو اصل میں محدود ممکنہ اقدامات کے اندر استدلال کے لیے ڈیزائن کیا گیا تھا، اسے RL کے ذریعہ آپٹمائز کرنے کے بعد، ایک جیسی درستگی حاصل کرنے کے لیے کم اقدامات کی ضرورت ہوتی ہے۔ ایک دوبارہ استعمال کے لیے بنایا گیا ماڈیول اب بھی عام وزن ہے، اور تقویتی سیکھنا ماڈل کو اس ماڈیول پر زیادہ انحصار کرنے کی تعلیم دیتا ہے، جس سے وہ پہلے ایک صفحہ بھر لکھنے کی ضرورت تھی، اب صرف کچھ فارورڈ پاسز میں مسئلہ حل کر سکتا ہے، جو دو مکانیزمز کے ایک ہی وزن پر одно وقت عمل کرنے جیسا لگتا ہے۔ جب تک کہ آرکیٹیکچر میں ایک دوبارہ استعمال کے لیے بنایا گیا چینل شامل نہ ہو، وہ اہم تقسیم (گنتی کو ایک ایسے چینل میں منتقل کرنا جو کبھی زبان نہیں تھا، اور گنتی کو موجودہ لیرز میں شامل کرنا) واضح طور پر الگ نہیں ہو سکتی۔

OpenAI کا اپنا سسٹم کارڈ بتاتا ہے کہ اسٹرا کی سوچ کی زنجیر کی کنٹرول کو RL ٹریننگ کے دوران خاص طور پر بہتر بنایا گیا تھا، اور کمپنی کا کہنا ہے کہ یہ ماڈل پہلے کے ماڈلز میں لاگو نہیں تھا، اور اسے بے سوچ کی زنجیر کی صلاحیت میں اضافے سے منسلک بتایا گیا۔ کمپنی نے مزید کہا کہ دو مقابلہ کرنے والی وضاحتیں کو مسترد کر دیا گیا ہے، لیکن حقیقت پر محدود اعتماد ہے: تفصیلی راستوں پر سکورنگ کے دوران کوئی واضح ب без سیدھا دباؤ نہیں تھا، اور یہ آرکیٹیکچر سے نہیں آیا۔ آخری بیان بالکل یہ بتاتا ہے کہ دوبارہ استعمال کی جانے والی ماڈیولز خود ہیں، یا صرف ان پر RL دوران تبدیلی، جس کا ذکر متن میں نہیں ہے۔ دو متبادل وضاحتوں کو مسترد کرنا اس بات کا ثبوت نہیں ہے کہ باقی وضاحت صحیح ہے، اور OpenAI کا اپنا الفاظ بھی اسے ثابت نہیں کرتا۔

ایک ایسا پہلے کا مثال جس میں RL شامل نہیں تھا، اس بات کو پیچیدہ بناتا ہے کہ کہانی بہت صاف لگ رہی تھی۔ 2023 میں، یونٹیان دینگ اور ان کے ساتھیوں نے عام نگرانی تربیت کے ذریعے، استاد ماڈل کے واضح استدلال کو طالب علم ماڈل کے پوشیدہ لیyers میں ب без کسی تقویت سیکھنے کے بغیر براہ راست ڈسٹل کیا؛ 2024 میں ایک بعد کی تحقیق نے اسے ایک تدریجی طریقہ بنایا: مکمل لکھے گئے استدلال سے شروع کرتے ہوئے، مرحلہ وار قدم ختم کرتے ہوئے جاری رکھنا اور آخرکار صرف جواب دینے والا ماڈل حاصل کرنا۔ دونوں کا تجربہ تنگ شعبوں میں ہوا (کئی ہندسوں کا ضرب اور ابتدائی سطح کا ریاضی کا حساب، Astra کے سائز پر کھلے استدلال کے بجائے) لیکن اس نتیجے کا اہم پہلو یہ ہے کہ یہ کیا مستثنیٰ کرتا ہے: پوسٹ ٹریننگ سے ایسا ماڈل حاصل ہو سکتا ہے جو عمل نہ دکھائے لیکن درست جواب دے سکے، مکمل طور پر تقویت سیکھنے کے بغیر۔ اگر Astra کا فائدہ اس طرح کے مکانزم سے آ رہا ہے، تو اس مکانزم کو خاص طور پر RL کمپریشن کہنا معلوم حقائق کو زیادہ بڑھا دے گا۔

دیگر نصف استدلال

یہ مان لیا جائے کہ یہاں تقویتی سیکھنے کا کچھ کردار ہے، لیکن محققین اس بات پر متفق نہیں ہیں کہ تقویتی سیکھنے نے ماڈل کی بنیادی صلاحیتوں پر کیا اثر ڈالا، جس سے RL کی وضاحت کتنی اہمیت رکھتی ہے، اس سے متعلقہ ہے۔

تحقیق کرنے والوں نے اس بات کا جائزہ لینے کا طریقہ یہ ہے کہ وہ ماڈل کو ایک ہی سوال کے لیے متعدد مستقل کوششیں کرنے دیں، صرف ایک بار کی کارکردگی کا جائزہ نہ لیں، اور پھر چیک کریں کہ کیا صحیح جواب ان تمام کوششوں میں سے کسی ایک میں ظاہر ہوا۔ ایک تحقیق نے پایا کہ RL ٹریننگ سے ماڈل ایک منفرد کوشش میں کامیاب ہونے کا امکان زیادہ بڑھ جاتا ہے، لیکن اس نے غیر ٹرینڈ ورژن کی متعدد کوششوں میں صحیح جواب کے ظاہر ہونے کی فریکوئنسی میں کوئی اضافہ نہیں کیا: ٹریننگ نے ماڈل کو اس بات پر زیادہ یقین دلایا جو وہ صرف اتفاق سے حاصل کر سکتا تھا، نہ کہ اسے نئی چیز سکھائی۔ دوسری الگ تحقیق نے لمبے وقت تک ٹریننگ کی، اور عمل کے خراب ہونے سے روکنے کے لیے زیادہ سخت کنٹرول استعمال کیا، جس نے بعض امور پر اُلٹا نتیجہ دیا: ٹریننگ کے بعد، ماڈل نے ان مسائل کو حل کر لیا جنہیں غیر ٹرینڈ ورژن نے چاہے جتنی بار بھی کوشش کر لی ہو، وہ کبھی بھی حل نہیں کر پایا تھا، حالانکہ اسی تحقیق میں دوسرے امور پر، ٹریننگ نے ممکنہ دائرہ کار پر بالکل کوئی اثر نہیں ڈالا۔

دونوں تحریریں درست ہیں۔ انہوں نے مختلف ریسیپ، مختلف ٹریننگ کی مدت، اور مختلف شروعاتی ماڈل استعمال کیا: ایک پہلے سے ایک زیادہ طاقتور استدلال ٹیچر سے ڈسٹل کر چکا ہے، جبکہ دوسرا اصل بنیادی ماڈل کے قریب تر ہے۔ ایک ہی مسئلہ کا جواب RL کے کام کرنے کے طریقے اور شروعاتی نقطہ کے مطابق مختلف آتا ہے، جو خود یہ ظاہر کرتا ہے کہ اس مسئلے پر اب تک کوئی فیصلہ نہیں ہوا: RL کیا نئے صلاحیتیں پیدا کرتا ہے؟ اس کا کوئی واحد جواب نہیں ہے، اور کہانی کو مختصر کرکے اسے فیصلہ قرار دینا، صرف اس ورژن کو چننا ہے جو زیادہ صاف طور پر خود کو منطقی بناتا ہے۔

یہاں کوئی بھی اعلان نہیں ہے کہ تھنک چین مانیٹرنگ کو فارغ کر دیا گیا ہے۔ وفاداری کے مکینزم کا ثبوت مضبوط ہے: کنٹرول اور ضرورت تقریباً مکمل طور پر ہم آہنگ ہیں (1.7%، 16.1%، 60.9%) جب تک کہ ماڈل کی صلاحیت بڑھتی ہے کہ وہ مسائل حل کرنے کے لیے کم لکھے؛ اور جب تک استدلال کی لمبائی کافی طویل ثابت نہیں ہو جاتی، تو قابل نگرانی اکثر واپس آ جاتی ہے۔ یہی وہ نمونہ ہے جسے ضرورت کا نظریہ پیش کرتا ہے، اور جسے کوئی اور وضاحت اتنی صاف طور پر نہیں سمجھا سکتی۔

اس نمونے کے تحت کا علیحدہ اور سبک دستی طور پر لکھا گیا سبب و مسبب کا کہانی، ٹھیک نہیں اور نہ ہی اسے ایک مقررہ نتیجہ کے طور پر پیش کیا جانا چاہیے۔ OpenAI کا اپنا بیان ایک محتاط، جاری تحقیق ہے، کوئی مکمل تشریح نہیں، اور یہی اس کا خود کا الفاظ ہے۔ موجودہ طور پر سب سے مضبوط شواہد یہ ظاہر کرتے ہیں کہ تقویت سیکھنے نے وہ استدلال جو اصل میں صریح ٹوکن کی ضرورت رکھتا تھا، خود بخود اندر گھل لیا ہے، لیکن ایک مستند راستہ بھی موجود ہے جس میں RL کے بغیر بھی اسی ظاہری رویہ حاصل کیا جا سکتا ہے؛ اس آرکٹیکچر میں ایک قابل استعمال ماڈول شاید پہلے سے موجود ہے جس کا حصہ RL ٹریننگ کے ذریعے اس پر کیے گئے اثرات سے واضح طور پر الگ نہیں کیا جا سکتا؛ اور تحقیق کار اب تک اس بات پر متفق نہیں ہو سکے کہ تقویت سیکھنے نے ماڈل کی حقیقی صلاحیتوں کو وسعت دی ہے یا صرف موجودہ صلاحیتوں کو دوبارہ تقسیم کیا ہے۔ اس شعبے کا عملی فرض (کہ سوچنے والے لینکس کا سپروائزڈ تعلیم میں فائدہ ماڈل کے سوچنے کی ضرورت کے تناسب میں ہوتا ہے) غلط نہیں ہے۔ یہ کہانی کا بڑا حصہ ہے، جسے اب حقیقی اعداد و شمار سے ناپا جا رہا ہے، نہ کہ تین سال پہلے پرانے ماڈل پر کردہ ایک پروب سے حاصل کردہ جذبات کے ذریعے۔ تعلیم میں وہ کون سا حصہ "سوچنے کی ضرورت" والے امور کے مجموعے کو کم کر رہا ہے، ابھی تک جواب نہیں ملا، اور جس بھی صاف لگنے والی کہانی کو آپ منتخب کر لیں، یہ حقائق تبدیل نہیں ہوتے۔

کیا ثابت کر سکتا ہے

دو مختلف مسائل کے لیے دو مختلف مزید تحقیقات کی ضرورت ہے، اور انہیں ایک ساتھ نہیں کیا جانا چاہیے۔

بھروسہ مندی ماڈل کے خود کے لیے: OpenAI نے پہلے ہی اسی لمبائی کے مطابقت کے لیے نگرانی کا موازنہ کیا ہے، اگلے ماڈل پر دوبارہ کریں، خاص طور پر یہ دیکھنے کے لیے کہ یہاں شناخت کیے گئے دو مستقل فرق کے ماحول بڑھ جاتے ہیں، صفر تک کم ہو جاتے ہیں، یا ویسے ہی رہ جاتے ہیں۔ اس سے ظاہر ہوگا کہ یہ استثناء ایک مستحکم، تنگ، اور اپنی وضاحت والی شریح ہیں، یا ایک وسیع تر خرابی کا پہلا علامت ہیں۔

سببی مسائل کے لیے: وہ اب تک کسی نے نہیں شائع کیا گیا ابلاسیشن تجربہ۔ ایک پری ٹرینڈ بیس مدل لیں۔ الگ الگ شاخیں بنائیں: صرف تقویت سیکھنا، صرف نگرانی میں بہتری، صرف زیادہ طاقتور استدلال ٹیچر سے ڈسٹلیشن، اور تقویت سیکھنا جس میں عام درستگی انعام کے علاوہ جواب کی لمبائی کا واضح جرمانہ شامل ہو۔ اس کے بعد، تمام شاخوں کے تربیتی ڈیٹا کو فریز کرنے کے بعد بنائے گئے ایک ڈیٹا سیٹ پر ان کا امتحان لیں، تاکہ حفظ کا مسئلہ نہ ہو۔ ہر شاخ کی ایک بار کوشش میں مسئلہ حل کرنے کی قابل اعتمادیت اور متعدد کوششوں میں کامیابی کے احتمال کو الگ الگ رپورٹ کریں، کیونکہ یہ دو مختلف مسائل ہیں جن کے الگ الگ جوابات ہیں۔ جب تک ایک ایسا ماڈل جو اسٹرا کے سائز کے قریب ہو، یہ تجربہ مکمل نہ کر لے، ایماندار موقف یہ ہے: تقویت سیکھنا اب تک سب سے منطقی مشتبہ ہے، نہ کہ پہلے سے معلوم مجرم۔

ایسٹرا وہاں خاموش ہو گئی جہاں نظریہ کہتا تھا کہ وہ خاموش رہے۔ تین سال پہلے، ایک چھوٹے ماڈل پر بنائے گئے ایک پروب نے اس خاص حد کا پیشن گوئی کی تھی، اور اب یہ واقعی اعداد کے ساتھ، OpenAI کے نئے ترین ماڈل میں ظاہر ہو گئی۔ اس خاموشی کا کہنا نہیں ہے کہ کس نے اسے اس جگہ خاموش رہنے کی تعلیم دی، نہ کہ کسی اور جگہ۔ لکھی ہوئی استدلال کبھی بھی بنیادی حساب کا مکمل آئینہ نہیں ہوتا، نہ تو ایسٹرا کے لیے، نہ اس سے پہلے کسی بھی ماڈل کے لیے۔ تبدیلی یہ ہے کہ کتنی زیادہ حسابگری کو آئینہ کی ضرورت نہیں رہی۔ اور اب تک، ایماندار جواب یہ ہے کہ OpenAI کے باہر کوئی نہیں (شاید اندر بھی کوئی نہیں) بتا سکتا کہ اس کا سبب کیا ہے۔

سائنسی ارتقاء کو سمجھیں۔ فرینٹیر لیب کی طرف سے جاری کردہ مواد کو تفصیل سے پڑھیں اور اس کی اہمیت کو ظاہر کرنے والے فریم ورکس کے ذریعے اسے سمجھیں۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔