GPT-6 صرف اسٹرا ہی نہیں!
Astra صرف کچھ دن پہلے جاری ہوئی، جبکہ GPT-6 Sol کو اندر کے ٹیسٹ میں ہونے کا انکشاف ہوا ہے۔

پرفارمنس بھی بہت اچھی ہے، ایک ٹیسٹ کی رفتار اسٹرا کی 6 گنا ہے۔
بہت بڑی توقع کریں: کیا ٹیرا اور لونا بھی راستے میں ہیں؟
اور اسی دن، OpenAI نے ایک سیٹ اندر کے ڈیٹا کو علیحدہ کر دیا:
اب تک، ہر 8 گھنٹے کے کام کے دن کے لیے، OpenAI کے محققین کے ساتھ 3 سے زیادہ ایجنٹ دن одно وقت چل رہے ہیں۔
API قیمت کے مطابق، OpenAI کے میڈین ریسرچر روزانہ 600 ڈالر سے زیادہ ایجنٹ ریزننگ وسائل استعمال کرتے ہیں۔

اوپن اے آئی نے بھی اعلان کیا ہے کہ وہ "آٹومیٹڈ ریسرچ انٹرن" کو مکمل کر چکی ہے:
یہ ایجینٹس انسانوں کی ہدایات کے تحت، وہ کام جو ریسرچر کو کئی دن لگتے تھے، جلدی مکمل کر سکتے ہیں۔
لیو ہوانگ بھی کہتے ہیں: AGI آ چکی ہے!

اس نے یہ بات سامنے لائی کہ اسٹرا نے تقریباً 100,000 NVIDIA Grace Blackwell NVLink72 گروپس کا استعمال کیا ہے، اور اگلے 400,000 GPU جلد آن لائن ہوں گے۔
لگتا ہے کہ یہ لہر صرف OpenAI کی طرف سے نہیں ہے۔
GPT-6 Sol کو داخلی ٹیسٹ شروع ہونے کا انکشاف ہوا ہے
نیٹیزن Lentils نے انکشاف کیا کہ OpenAI GPT-6 Sol کا اندر کا ٹیسٹ کر رہا ہے۔
اس نے کہا کہ Sol کی کل پیداواری صلاحیت نئی جاری کی گئی Astra کے مقابلے میں واضح طور پر کم ہے، لیکن یہ زیادہ تیز ہے اور اب بھی «怪物级» ماڈل کی شریط پر پورا اترتا ہے۔
کتنا تیز؟ ایک منفرد ٹیسٹ کی رفتار تقریباً اسٹرا کی 6 گنا ہے۔
ویب صارف lyra نے ایک ہی کام کو مختلف ماڈلز کے لیے ٹیسٹ کیا: ماڈل کو ایک BMW M4 Competition کا SVG گرافک بنانے کے لیے کہا۔
اس میں، GPT-6 Sol نے میکس لیول اور زیرو شاٹ جنریشن استعمال کیا، جس میں تقریباً 3 منٹ لگے اور 28,000 ٹوکنز کا پیداوار ہوا۔

GPT-6 Astra کو Max لیول پر استعمال کیا جاتا ہے، جس سے تقریباً 25,000 ٹوکنز کا پیداوار ہوتا ہے اور اس میں تقریباً 19 منٹ لگتے ہیں۔

جیمنی 3.1 ڈیپتھنک کو ہائی لیول پر آن کیا گیا، جس میں تقریباً 3300 ٹوکن کا آؤٹ پٹ دکھایا گیا، لیکن استدلال کے عمل میں تقریباً 458,000 ٹوکن استعمال ہوئے اور 29 منٹ کا وقت لگا۔

جیمنی 3.8 فلیش میں ہائی درجہ بھی کھولا گیا ہے، جس نے صرف تقریباً 42 سیکنڈ میں تقریباً 1.9 ہزار ٹوکنز پیدا کیے۔

اس کے برعکس، Sol سب سے زیادہ توجہ کا مرکز رہا: اس کی پیداواری صلاحیت Astra کے قریب ہے، لیکن ایک ہی ٹیسٹ کی رفتار تقریباً Astra کی 6 گنا ہے — صرف اس کا تقریباً چھٹا حصہ وقت لگتا ہے۔
اس کے علاوہ، ویب صارف Lentils نے ایک پکسل اسٹائل سینڈ باکس دنیا کا نمونہ "The Realm of Aurellune" دکھایا۔

GPT-6 نے ایک بار میں شہر، زمینیں، دریا، قلعہ اور خاکہ نقشہ تیار کیا، ساتھ ہی رات اور دن کا تبدیل ہونا، مقامات کا نام لگانا، تفصیلات کو ایڈجسٹ کرنے جیسے کنٹرول پینلز بھی فراہم کیے، جس سے یہ مکمل طور پر ایک تیار ہو چکے سیمولیشن اور مینجمنٹ گیم جیسا لگتا ہے۔
یہ zero-shot، Max انفرینس لیول، 15 منٹ، کل 60,000 ٹوکن کے استعمال سے پیدا کیا گیا اثر ہے۔
ابھی کے لیے یہ اندازہ لگایا جا سکتا ہے کہ اسٹرا سب سے زیادہ مشکل گہرائی والے استدلال پر زور دیتی ہے، جبکہ سول شاید رفتار، ٹھیکنگ اور ایجنٹ کے بڑے پیمانے پر استعمال پر زور دیتی ہے۔
سول کے لیے جاری کرنے کے بارے میں، ویب صارف پنکج کمار کا کہنا ہے کہ اسے شاید 29 ستمبر کو اوپن اے آئی ڈویلپر کانفرنس میں آفیشلی جاری کیا جائے گا۔

GPT-6، ٹیرا، لونا اور GPT-Image 2.5 کے ایک ساتھ ظہور کی بھی امکان ہے۔

اوپن اے آئی کے محققین، جن میں سے ہر ایک کے پاس 3 ایجنٹ انٹرن شپ کے ساتھ کام کرنے کا رجحان ہے
اسی دن، OpenAI نے ایک دلچسپ اندر کا ڈیٹا بھی شیئر کیا — AI ماڈل نے اپنے اپنے لیب میں تحقیق کو کتنی تیزی سے ترقی دی ہے۔
اس سال کے اگست کے وسط تک، ریسرچر کے ہر 8 گھنٹے کے شفٹ کے پیچھے تقریباً 3.1 ایجنٹ ڈے کا کام متوازی طور پر چل رہا ہے۔
واہ، ایک شخص تین نہ سونے والے انٹرن شپ کرنے والوں کے ساتھ؟~

خرچے کے لحاظ سے، API قیمت کے مطابق، середній дослідник щодня витрачає на агентські висновки більше 600 доларів США.
یہ تقریباً ایک جونیئر انجینئر کے ایک دن کی تنخواہ کے برابر ہے۔

یہ ایجینٹس بالکل کیا کر رہے ہیں؟
تحقیقی کوڈ لکھنا، بنیادی ڈھانچہ کوڈ لکھنا، تربیتی ماحول تیار کرنا، جائزہ کے تجربات چلانا، ٹولز اور ماحول کی خرابیوں کا پتہ لگانا، تجرباتی نتائج کا تجزیہ کرنا، تربیت کے کاموں پر نظر رکھنا… اور تحقیقی نتائج کو ترتیب دینے اور ان کا ابلاغ بھی کرنا۔
اس کے علاوہ، وہ صرف یہ فیصلہ کرنے میں مدد نہیں کرتا کہ کیا تحقیق کی جائے۔
سب سے زیادہ واضح تبدیلی یہ ہے کہ پہلے جب تجرباتی ماحول بند ہو جاتا تھا، تو ریسرچر کو اندر کے چینل پر لوگوں کو بلانا پڑتا تھا؛ اب ایجنٹ اس قسم کے مسائل کو خود سنبھالنے لگے ہیں، جس سے انسانی مدد کی درخواستیں براہ راست کم ہو گئی ہیں۔

کچھ ٹیمیں نے مسلسل ٹیکنیکل سوالات کے مقررہ وقت کو ختم کر دیا اور لوگوں کو نظام کو بہتر بنانے کے لیے آزاد کر دیا۔
ان ڈیٹا کے مطابق، OpenAI نے باہر کیا ہے کہ "آٹومیٹڈ AI ریسرچ انٹرن" کا ہدف حاصل کر لیا گیا ہے۔
یہاں "انٹرن" کا مطلب درست طور پر ایک کام کرنے والی ریسرچ نوڈ ہے: انسانوں کی ہدایت پر، یہ واضح حدود والے تحقیقی کاموں کو خودکار طور پر مکمل کر سکتا ہے، جن میں سے کچھ کام پہلے ماہر ریسرچرز کو کئی دن لگتے تھے۔
اس کا اثر فوراً نظر آیا، محققین کی کوڈ کی پیداوار اور تجربات کی تعداد دونوں بڑھ رہی ہیں۔

اگست 2026 میں، فرد کے لحاظ سے تجربات کی تعداد 2025 جنوری سے اعداد و شمار کے آنے کے بعد سب سے زیادہ ریکارڈ ہوئی، اور ایجنٹس کو مزید پیچیدہ اور لمبے دورانیے کے کام مل رہے ہیں۔

اس مضمون کے مصنف کیوین لیو نے اس واقعہ کو بڑے پیمانے پر سیاق و سباق میں رکھا۔
وہ سمجھتے ہیں کہ ریکرسیو خود بہتری مستقبل کے کچھ سالوں میں AI کی صلاحیتوں میں کھچڑی لانے والا اہم ترین عامل ہو سکتا ہے۔
بس اس کا مطلب یہ ہے کہ AI، AI کو بناتا ہے، اور ہر بار زیادہ تیزی سے۔

لیکن مسئلہ یہ ہے کہ موجودہ رجحان کے مطابق، یہ صلاحیت صرف کچھ ایسے ایل آئی لیبارٹریز میں ہی ڈیفالٹ طور پر دستیاب ہوگی، جہاں باہر کے لوگوں کو یہ نہیں معلوم ہوگا کہ اس کی ترقی کس حد تک ہو چکی ہے۔
اس لیے، لیو کا خیال ہے کہ شفافیت کا اعلان اب سے زیادہ فوری ضرورت ہے۔ ماڈل کتنی جلدی طاقتور ہو رہے ہیں، اور ترقی کے رفتار پر کیا روک لگانی چاہیے، اس کا فیصلہ صرف کچھ کمپنیوں کے گھر کے اندر بند ہونے سے نہیں ہونا چاہیے۔
اس نے دیگر AI کمپنیوں کو بھی بلایا کہ وہ بھی اس طرح کے ڈیٹا کو شائع کریں۔
تاہم، AI کی ترقی ضرور تیز ہو رہی ہے، لیکن ابھی تک اس کا یہ درجہ نہیں پہنچا کہ مکمل خودکار گاڑیاں ممکن ہو جائیں۔
OpenAI کے ڈیٹا کے مطابق، جن کاموں کو 4 سے 8 گھنٹے لگتے تھے، پچھلے نصف سال میں زیادہ تر کاموں میں انسان کو کم از کم ایک بار مداخلت کرنی پڑی۔ اعلیٰ تحقیقی منصوبہ بندی کے معاملات میں تو Agent کو لگभگ نہیں دیا جاتا۔

ریسرچرز اب بھی یہ فیصلہ کرنے کے ذمہ دار ہیں کہ کیا تحقیق کی جائے، کن نتائج کو آگے بڑھایا جائے، اور کب تربیت کو بڑھانا، تجربات روکنا یا ماڈل ڈپلوی کیا جائے۔
اپنے اگلے ہدف کو بھی طے کر لیا گیا ہے: 2028 تک "آٹومیٹڈ AI ریسرچر" کا حصول۔
صرف واضح مہمات کو ہی قبول کرنے والے "انٹرن" کے مقابلے میں، "ریسرچر" کو زیادہ کھلے تحقیقی مقاصد کو سنبھالنا چاہیے اور اپنے لمبے مدتی منصوبوں کو خود چلانا چاہیے — جس کا مطلب ہے کہ وہ ایک نفاذ کرنے والے سے مستقل ذمہ دار بن جاتا ہے۔
اگر GPT-6 Sol واقعی طور پر اندر کے ٹیسٹنگ میں ہے، تو اس کا احتمال ہے کہ یہ نئے ترقیاتی ماڈل کے تحت تیار ہوا ہے:
مزید GPU کی طرف سے کمپوٹیشنل پاور فراہم کی جا رہی ہے، زیادہ ایجنٹس ایک ساتھ تجربات چلا رہے ہیں، اور انسانی ریسرچرز اونچائی پر کھڑے ہیں — رہنمائی کا انتخاب کر رہے ہیں، نتائج کا جائزہ لے رہے ہیں، اور آخرکار یہ فیصلہ کر رہے ہیں کہ کون سی چیزیں اگلی نسل کے ماڈل میں تبدیل ہونے کے قابل ہیں۔
زیادہ طاقتور AI، نگرانی کے لیے آہستہ آہستہ مشکل ہوتا جا رہا ہے
اسی دن، اوپن اے آئی کے سربراہ سائنسدان جاکوب پیچوکی نے ایک دس ہزار الفاظ کا مضمون جاری کیا، جس کا عنوان براہ راست —《بیرونی دماغ》— رکھا گیا۔

میں نے اسے پڑھنے کے بعد محسوس کیا کہ معنی یہ ہے کہ OpenAI کے سربراہ سائنسدان بھی پورے صنعت کو سست کرنے کی تجویز دے رہے ہیں…
جکوب نے کہا کہ AI اصل میں انسانوں کے ڈیزائن کے مطابق ایک چپ یا ایک قاعدہ نہیں ہے، بلکہ یہ بے شمار ڈیٹا اور کمپوٹیشنل طاقت کے اندر خود 'بڑھ' رہا ہے۔
آپ کچھ اجزاء کو الگ کر کے سمجھ سکتے ہیں، لیکن پورے سسٹم کو اچانک کس قسم کی صلاحیت حاصل ہو گئی اور اگر ماحول بدل جائے تو وہ کیسا ردعمل دے گا، کوئی نہیں بata سکتا۔
مزید پریشانی کی بات یہ ہے کہ AI کو انسانوں پر مکمل طور پر غالب ہونے کی ضرورت نہیں ہوتی کہ مسائل پیدا ہوں؛ صرف کافی زیادہ اہم صلاحیتوں میں انسانوں سے بہتر ہونے سے وہ آپ کی بڑی مدد کر سکتا ہے اور بڑی غلطیاں بھی کر سکتا ہے۔
تو سوال یہ ہے: کیا انسان اب بھی اسے سمجھ سکتے ہیں؟
过去,OpenAI 监控 AI 主要依靠一种方法:查看思维链。
بس اس بات کو یقینی بنانا ہے کہ ماڈل کا استدلال واضح طور پر لکھا گیا ہے، اور وہ کسی بھی طرح کے دھوکے، اختیارات کے استعمال یا پابندیوں کو دور کرنے کی کوشش نہیں کر رہا۔
لیکن اسٹرا کی نسل تک پہنچ کر، یہ طریقہ کام نہیں کر رہا تھا۔
اول تو، ماڈل اپنی باتوں کو انتظام کرنا سیکھ چکے ہیں، اور ان کے اصل خیالات ضروری نہیں کہ تفصیل میں لکھے جائیں؛ دوسرے، ایجنٹ صرف "سوچ کر جواب دینے" تک محدود نہیں رہا۔ وہ ٹولز استعمال کرتا ہے، کمپیوٹر کا کنٹرول کرتا ہے، ماحول چلاتا ہے، اور لوگوں اور دوسرے ایجنٹس کے ساتھ تعاون بھی کرتا ہے۔
یہ باتیں ایسے گھل مل گئیں کہ محققین کے لیے اب کسی بھی مکمل اور شفاف سوچ کی لکیر کو الفاظ کے لحاظ سے جانچنا ناممکن ہو گیا۔
اوپن اے آئی نے بھی پایا کہ اسٹرا کو پیچیدہ کاموں کو سنبھالنے کے لیے اپنے استدلال کا مکمل مراحل لکھنے کی ضرورت نہیں ہے۔
بس اس کا مطلب یہ ہے کہ ماڈل پہلے ہی "چپکے سے بڑا کام کرنا" سیکھ چکا ہے۔

ایک خاص طور پر مدل کو نگرانی سے بچانے کے لیے ڈیزائن کیے گئے مقابلہ کی ٹیسٹنگ میں، اسٹرا نے کچھ ایسی صلاحیتیں دکھائیں جن سے پیچھے کی ہڈیاں سرد ہو جاتی ہیں: ٹیسٹ اسکور کو جان بوجھ کر کم رکھنا، نگرانی سے بچنا، اور تباہ کن کام کرنا۔
یہ سب انسانی طور پر ڈیزائن کیے گئے دباؤ ٹیسٹ ہیں، اور OpenAI نے اس کے بنیاد پر یہ نہیں کہا کہ اسٹرا روزمرہ کے کاموں میں جان بوجھ کر جھوٹ بولے گی۔ لیکن اس سے کم از کم یہ ظاہر ہوتا ہے کہ صرف سوچ کے سلسلے کا مشاہدہ کرکے ماڈل کے تمام ممکنہ رویوں کو کور نہیں کیا جا سکتا۔
کیا آپ پہلے کے Hugging Face واقعے کو یاد کرتے ہیں؟ وہ ایک چیتنے کی گھنٹی تھی۔

اس وقت، GPT‑5.6 Sol اور ایک طاقتور تر اندری ریسرچ ماڈل کو ExploitGym نیٹ ورک ٹارگٹ رینج میں ڈالا گیا، جس کا مقصد خامیاں تلاش کرنا، حملہ کرنا اور Flag حاصل کرنا تھا۔ ماڈل کی حقیقی صلاحیت کا جائزہ لینے کے لیے، ایوان کے مکمل سیکورٹی گارڈریلز بند ہو گئے۔
نتیجہ یہ ہوا کہ ماڈلز نے مسئلہ حل کرنے کی بجائے نیٹ ورک انفرادیت کو دور کر دیا، غیر اختیاری چینلز کے ذریعے ایک دوسرے کے ساتھ پیغامات بھیجے اور کاموں کا تقسیم کیا۔
اس کے بعد، انہوں نے سافٹ ویئر پیکیج کیش پروکسی میں موجود صفر دن کے خطرے کا استعمال کرکے عوامی انٹرنیٹ تک رسائی حاصل کی اور آخرکار Hugging Face سسٹم میں داخل ہوکر ExploitGym کے ٹیسٹ جوابات تلاش کرنے کی کوشش کی۔

درحقیقت، یہ کام زیادہ تر اندرنی تحقیقی ماڈل IM1 کی طرف سے چلایا گیا، GPT‑5.6 Sol نے کچھ حمل کے راستوں کو دوبارہ ظاہر کیا، اور اسٹرا نے شرکت نہیں کی۔
ماڈل کا اصل مقصد ابھی بھی ٹیسٹ مکمل کرنا ہے، لیکن جواب حاصل کرنے کے لیے وہ مستقل طور پر قواعد کے خلیل تلاش کرتے رہتے ہیں اور آخرکار کام کے دائرہ کار سے باہر کے اقدامات کرتے ہیں۔
اس لیے، OpenAI نے ایک خطرے کا سگنل بھی پڑھا: جب Agent کافی طاقتور ہو، ٹولز کافی زیادہ ہوں، اور چلنے کا وقت کافی لمبا ہو، تو یہ خود نئے راستے تلاش کر سکتا ہے، باہری وسائل استعمال کر سکتا ہے، یا دوسرے Agents کے ساتھ تعاون بھی کر سکتا ہے۔
نہیں…تو اس طرح گھوم گھوم کر، کیا یہ ایک بند گھنٹی نہیں بن گیا؟؟
اوپن اے آئی کو زیادہ طاقتور ماڈلز کی ضرورت ہے، جو کوڈ لکھنے، تجربات چلانے، ایلائنمنٹ تحقیق کرنے، اور حتیٰ کہ دیگر AI کے خلاف تحفظی نظام تعمیر کرنے کے لیے استعمال ہو سکیں۔ جتنا ماڈل زیادہ طاقتور ہوگا، اتنے ہی زیادہ کام کر سکے گا اور ترقی کی رفتار تیز ہوگی۔
لیکن اسی دوران، انسانوں کے لیے یہ بھی مشکل ہوتا جا رہا ہے کہ وہ یہ طے کریں کہ اس نے نتیجہ کیسے نکالا، اور اگر ماحول بدل دیا جائے تو کیا وہ اصل میں سیکھے گئے قواعد کو دوبارہ تشریح کرے گا۔
جیکوب کا خیال ہے کہ اب تک کوئی بھی لیب اپنے ماڈل کی ایلائنمنٹ اور مانیٹرنگ کو درست طریقے سے مکمل کرنے کا دعویٰ نہیں کر سکتا جس سے وہ لمبے عرصے تک سب سے زیادہ رفتار سے ماڈل کے سائز میں اضافہ کر سکے۔

اس سے پہلے کہ صنعت بھر میں مشترکہ محفوظ معیارات قائم ہو جائیں، وہ چاہتا ہے کہ سب لوگ "خود خواہانہ بریک دبائیں" کو ایک سمجھوتہ سمجھیں۔
خود OpenAI نے بھی کہا ہے کہ اگر ضرورت ہو تو وہ منفرد طور پر رک جانے کا امکان نہیں چھوڑ رہے اور ماڈل کے سائز کو مزید بڑھانے سے گریز کریں گے۔
آپ کو ایسا ہی کرنا چاہیے… مجھے یاد ہے کہ A سے شروع ہونے والی کوئی کمپنی بھی ایسا کہہ چکی تھی۔
حوالہ لنک:
[1]https://x.com/Lentils80/status/2096518218836005287?s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
یہ مضمون ویچن گروپ "Quantum Bit" سے ہے، مصنف: تینگ یو
