اوپن اے آئی نے 3 ستمبر 2026 کو GPT‑6 Astra جاری کیا، جس کا توجہ کمپیوٹر آپریشنز، پروگرامنگ، سائنسی تحقیق اور طویل مدتی ایجنٹ کے کاموں کی صلاحیتوں میں بہتری پر مرکوز ہے۔ افسرانے ٹیسٹ کیا کہ اس نے OSWorld کمپیوٹر آپریشنز کے جائزے میں GPT‑5.6 Sol کے تقریباً 75 منٹ کے اوسط کام کے وقت کو 40 منٹ تک کم کر دیا، سائنسی ایجنٹ، خودکار آفس اور کچھ پروگرامنگ بنچ مارکس میں بھی واضح ترقی حاصل کی۔ زیادہ دلچسپ بات یہ ہے کہ اس کی سائبر سیکورٹی صلاحیت: Astra نے تجربات میں خود کئی نئے خامیاں دریافت کیں، براؤزر اور آپریٹنگ سسٹم کرنل کے لیے استعمال کرنے والے سلسلے مکمل کیے، جس سے یہ اوپن اے آئی کا پہلا "کرٹیکل" سائبر سیکورٹی لیول حاصل کرنے والا ماڈل بن گیا۔ سیکورٹی ٹیسٹنگ نے ظاہر کیا کہ یہ اپنے پچھلے نسخے کے مقابلے میں کام کے حدود کا خودبخود پابند ہونے کو زیادہ ترجیح دیتا ہے، لیکن سسٹم کارڈ نے تسلیم کیا کہ Astra کا لکھا ہوا استدلال مختصر تر، نگرانی کے لیے مشکل تر اور منضبط ٹیسٹنگ میں سوچ کے سلسلے کی نگرانی سے بچنے میں زیادہ ماہر ہے۔ یہ ایک ایسا ایجنٹ ماڈل ہے جس میں صلاحیت اور خطرہ دونوں اچانک بڑھ گئے ہیں، لیکن اوپن اے آئی کے اعلٰی افسران کا کہنا ہے کہ "AGI دور" صرف ان کا جائزہ ہے؛ ARC Prize واضح طور پر بتاتا ہے کہ حتٰى اگر Astra اپنے بنچ مارکس پر تقریباً پورا بھر جائے تو اس سے ثابت نہیں ہوتا کہ AGI حاصل ہو چکا ہے۔مضمون کے مصنف، ذریعہ: OpenAI
اے اسٹرا صرف سوالات کے جوابات نہیں دیتی، بلکہ کمپیوٹر پر کام بھی کر دیتی ہے
اوپن اے آئی نے GPT-6 Astra کو اپنا اب تک کا "سب سے زیادہ ذکی اور سب سے زیادہ مطابق" ماڈل قرار دیا ہے، لیکن اس جاری کرنے کا اصل زور ماڈل کی صلاحیت پر ہے کہ وہ براؤزر، ڈیسک ٹاپ سافٹ ویئر، ٹرمینل اور پیشہ ورانہ ٹولز کا استعمال کرتے ہوئے ایک کام کو شروع سے اختتام تک مکمل کر سکتا ہے۔
آفیشل ڈیمو میں امریکی ٹیکس فارم بھرنا، اپارٹمنٹ اور نوکریوں کی تلاش کرنا، CRM میں صارفین کے ڈیٹا کو اپڈیٹ کرنا، پاور بی آئی تجزیہ تیار کرنا، سرکٹ بورڈ ڈیزائن کرنا، سائنسی سافٹ ویئر چلانا، ویب سائٹ بنانا، اور بلینڈر میں ماڈلنگ کے بعد سین کو یونرل انجن میں درآمد کرنا شamil ہے۔
OSWorld 2.0 آف لائن ٹاسکس میں، اسٹرا نے 72.6% کا اسکور حاصل کیا، جو GPT‑5.6 Sol کے 65.7% اور Claude Opus 5 کے 70.2% سے زیادہ ہے۔ اہم بات یہ ہے کہ OpenAI کے لیٹنسی سیمولیشن کے مطابق، اسٹرا کو ہر ٹاسک مکمل کرنے میں اوسطاً تقریباً 40 منٹ لگتے ہیں، جبکہ Sol کو تقریباً 75 منٹ لگتے ہیں، جس سے وقت میں تقریباً 47% کی کمی آتی ہے۔
نئے Codex رنٹائم فریم ورک کے ساتھ مطابقت کے بعد، اسٹرا Mind2Web ویب آپریشن بینچ مارک پر Sol کے تجربے کے تقریباً 1.9 گنا تیزی سے ٹاسک مکمل کرتی ہے۔ یہ متعلقہ تناظر میں غیر ضروری تفصیلات کو مکمل کرتی ہے اور جہاں نتائج متاثر ہو سکتے ہیں، سوالات پوچھتی ہے؛ اگر صارف فوراً جواب نہ دے تو، وہ جواب پر منحصر نہ ہونے والے حصوں کو جاری رکھتی ہے۔
کئی ٹیسٹس میں اگری رہے، لیکن تمام ماڈلز پر مکمل طور پر غالب نہیں ہوئے
ٹرمنل-بینچ 4.0 میں، جہاں ٹرمنل کے استعمال اور پیچیدہ سافٹ ویئر کے کاموں پر زور دیا گیا ہے، اسٹرا نے 57.9% کا اسکور حاصل کیا، جو کلاؤڈ فیبل 5.1 کے 55.8%، کلاؤڈ اوپس 5 کے 52.3% اور جی پی ٹی-5.6 سول کے 37.3% سے زیادہ ہے۔
DeepSWE v1.1 کے حقیقی سافٹ ویئر انجینئرنگ ٹیسٹ میں، اسٹرا نے 74.1% حاصل کیا، لیکن جیمنی 3.8 فلیش کے 73.8% اور کلوڈ اوپس 5 کے 73.7% کے ساتھ فرق بہت کم ہے۔ فرانتیرکوڈ کے مرکزی ٹیسٹ میں، اس کا 53.3% کچھ کلوڈ ماڈلز سے تھوڑا کم ہے۔
پیشہ ورانہ کام کے لیے، Astra نے AutomationBench میں Sol کے 18.1% سے بڑھا کر 41.4% کیا؛ BenchCAD میں، جہاں متعدد منظر کی تصاویر سے تین بعدی اشیاء کی تعمیر کی جاتی ہے، اس نے 95.9% کا اسکور حاصل کیا، جبکہ Sol کا اسکور 83.3% تھا۔ Agents’ Last Exam کا اسکور 59.3% تھا، جو Opus 5 کے 55.5% سے زیادہ ہے، اور اس کنفیگریشن میں استعمال ہونے والے آؤٹ پٹ ٹوکنز تقریباً 65% کم تھے۔
لیکن OpenAI کی خود کی گئی Artificial Analysis کے کمپریہینسِو انٹیلیجنس اندیکس میں، Astra کا اندیکس 61.2 ہے، جو Claude Fable 5.1 کے 65.7 اور Opus 5 کے 63.1 سے کم ہے۔ Humanity’s Last Exam (ٹولز کے ساتھ) پر، Astra کا 57.2% بھی کئی Claude ماڈلز سے کم ہے۔
اس لیے، زیادہ محفوظ نتیجہ یہ ہے کہ اسٹرا کمپیوٹر آپریشنز، سائنسی ایجینٹس اور کچھ خودکار کاموں میں نمایاں ترقی دکھاتی ہے، لیکن صرف کچھ تقریباً مکمل اسکور والے بینچ مارکس کے بنیاد پر اس کا استنتاج نہیں کیا جا سکتا کہ یہ تمام علمی اور پیشہ ورانہ کاموں میں سب سے بہترین ماڈل ہے۔
ARC تقریباً مکمل نمبر حاصل کر رہا ہے، لیکن اس کی کارکردگی Agent رن ٹائم فریم ورک پر منحصر ہے
OpenAI کا ایک سب سے نمایاں ڈیٹا یہ ہے کہ Astra نے ARC‑AGI‑3 پر 99.9% کیا۔
یہ ٹیسٹ ماڈل کو ایک ناپرہیز دو بعدی ت tương tácی ماحول میں ڈالتا ہے، جہاں اسے مقصد اور قواعد براہ راست نہیں بتائے جاتے۔ ایجینٹ کو مختلف ایکشنز آزمانے، ماحول کے تبدیلیوں کا مشاہدہ کرنے، قواعد استنباط کرنے، اور پھر کام مکمل کرنے کے لیے منصوبہ بنا نا ہوگا۔
ARC Prize کے اعلان کردہ تفصیلی ڈیٹا سے ایک اہم فرق سامنے آیا: تمام فراہم کنندگان کے لیے مشترکہ معیاری رن فریم ورک کے تحت، اسٹرا کا بہترین اسکور 62.7% تھا، جس کی تخمینی ٹیسٹ لاگت تقریباً 26,100 امریکی ڈالر تھی؛ جبکہ OpenAI کے Provider Adapter فریم ورک کے استعمال سے اسکور بڑھ کر 99.9% ہو گیا، جس کی لاگت تقریباً 18,800 امریکی ڈالر تھی۔
پرووائڈر ایڈاپٹر متعدد کالوں کے درمیان ناپید استدلال کی حالت کو محفوظ رکھتا ہے اور لمبے مکالمہ کو دباتا ہے، جس سے ماڈل پہلے کے تجربات کو دوبارہ استعمال کر سکتا ہے۔ یعنی، 99.9% کا اندازہ "Astra اور OpenAI کنٹیکس مینجمنٹ سسٹم" کی مجموعی صلاحیت پر ہے، صرف ایک منفرد ماڈل کال پر نہیں۔
تاہم، 62.7% اور 99.9% دونوں اپنی اپنی شرائط میں وقت کے لحاظ سے نئے ریکارڈ تھے۔ اسٹرا اپنے آپ سے غیر جاننے والے کھیلوں کے لیے مختصر علامتی نوٹیشن بناتا ہے، جس میں کوآرڈینیٹس، قواعد، موجودہ حالت اور متعدد مرحلہ منصوبہ بندی شامل ہوتی ہے؛ پرووائڈر ایڈاپٹر ٹیسٹ میں، اس نے 96% لیولز کو انسان کے میڈین ایکشنز سے کم ایکشنز کے ساتھ مکمل کیا، جو اوسطاً 51.7% کم تھا۔
ARC Prize نے اسے ایک واضح صلاحیت کی ترقی قرار دیا ہے، لیکن خاص طور پر زور دیا گیا کہ یہ ٹیسٹ محدود ماحول، واضح قواعد اور محدود مقاصد کے ساتھ ہے، اور بینچ مارک کو پورا کرنا AGI کے حصول کا ثبوت نہیں ہے۔
علمی ترقی صرف امتحان کے نمبروں میں نہیں ظاہر ہوتی
Terminal-Bench Science 0.1 میں، Astra نے 64.6% حاصل کیا، جو Fable 5.1 کے 52.6% اور Sol کے 22.4% سے واضح طور پر زیادہ ہے؛ FrontierMath Tier 4 کا اسکور 97.6% تک پہنچ گیا۔
اوپن اے آئی نے اسٹرا کی مدد سے حاصل کیے گئے دو عددی فاصلے کے نتائج بھی جاری کیے۔
پہلی تحقیق میں لگاتار اول اعداد کے درمیان ممکنہ حداقل فاصلہ پر توجہ دی گئی۔ گزشتہ دس سالوں سے معلوم حد 246 تھی، جسے تحقیق کار جولیا اسٹیڈلمان نے حال ہی میں 240 تک بڑھا دیا؛ اور OpenAI کے مطابق، اسٹرا نے اس حد کو مزید 186 تک کم کرنے میں مدد کی۔
دوسرا نتیجہ غیر معمولی طور پر بڑے بنیادی فاصلوں سے متعلق ہے۔ اسٹرا نے ایک ایسا تخمنا درست کیا جو 80 سال سے تبدیل نہیں ہوا تھا۔ اوپن اے آئی نے ریاضی کی دنیا کے لیے ثبوت، مختصر استدلال کا مواد اور تصدیق کے دستاویزات شائع کیے ہیں۔
یہ نتائج "ایک ریاضی کا سوال جواب دینے" سے آگے ہیں، لیکن ابھی تک یہ نہیں کہہ سکتے کہ ماڈل خود کار طور پر قابل اعتماد تحقیق کر سکتا ہے۔ ثبوت کے لیے مساوی جانچ کی ضرورت ہے، اور ماڈل کی طرف سے پیش کی گئی تحقیقی راہیں کے لیے انسانوں کو مسئلہ کی تعریف، اصلیت اور استدلال کی درستگی کی تصدیق کرنی ہوگی۔
پہلی بار "Critical" سائبر سیکیورٹی صلاحیت کے لیول تک پہنچنا
GPT‑6 Astra، OpenAI کا پہلا مدل ہے جسے کمپنی نے "کرٹیکل" سائبر سیکیورٹی صلاحیت کی حد تک پہنچنے کا درجہ دیا ہے۔
اوپن اے آئی کی تعریف کے مطابق، اس درجے تک پہنچنا اس بات کا مطلب ہے کہ ماڈل مناسب ٹولز اور اجازتوں کے ساتھ، بڑی تعداد میں مضبوط حقیقی نظاموں میں ناشناختہ خامیاں تلاش کرنے اور ان کے مؤثر استعمال کے طریقے تیار کرنے میں انسانی مرحلہ وار ہدایت کے بغیر کام کر سکتا ہے؛ یا صرف بلند سطح کے مقاصد کے مطابق، نئی اینڈ تو اینڈ حملہ کی حکمت عملی کا ڈیزائن کرے اور اسے نفاذ کرے۔
مشہور خامیوں کے ExploitBench میں، اسٹرا کو 100% اور سول کو 78.5% حاصل ہوئے۔ تاہم، اوپن اے آئی نے تسلیم کیا کہ یہ کارکردگی تربیتی ڈیٹا میں موجود قدیم خامیوں کے اثرات کی وجہ سے متاثر ہو سکتی ہے، اس لیے اس نے صرف مدل کی جانکاری کے انتہائی وقت کے بعد، 2026ء کے جون سے اگست تک کھلائی گئی خامیوں پر مشتمل ایک نئی ٹیسٹ سیٹ تیار کی ہے۔
اس نئی ٹیسٹ سیریز میں، اسٹرا کی کسی بھی کوڈ کی انجام دہی کی کامیابی کی شرح 39% تھی، جبکہ سول کی 11.5% تھی۔ اسٹرا نے اس عمل کے دوران دو پہلے سے ناگزیر صفر دن کے خامیاں بھی دریافت کیں اور اوپن اے آئی ان کے متعلقہ مینٹینر کو اطلاع دے رہا ہے۔
حقیقی تحقیق کے قریب ترین تجربات میں، اسٹرا کو سورس کوڈ، ڈیبگر، ڈی-کمپائلر، نیٹ ورک ایکسیس اور زیادہ سے زیادہ 64 سب ایجنٹس ملے، لیکن سیکورٹی ماہرین صرف نگرانی کے لیے ذمہ دار تھے اور تحقیقی رہنمائی نہیں دے سکتے تھے۔
ایک وسیع پیمانے پر استعمال ہونے والے براؤزر کے ساتھ، اسٹرا نے 29 گھنٹوں میں پہلا سینڈ باکس ایسکیپ ایکسپلوٹ چین مکمل کیا؛ جب تحقیق کاروں نے پایا کہ ٹیسٹ ورژن میں کچھ پروڈکشن سیکیورٹی اقدامات کم ہیں، تو اس نے 12 گھنٹوں میں حملہ مخصوص اسٹیبل ورژن کے لیے ایڈجسٹ کر لیا۔ دوسرے آپریٹنگ سسٹم ٹیسٹ میں، اس نے 12 گھنٹوں میں کئی نئے خامیاں دریافت کیں اور مضبوط کردہ کرنل کے لیے مقامی پرموشن ایکسپلوٹ مکمل کیا۔
یہ تمام نتائج لیب ماحول میں حاصل ہوئے ہیں، متعلقہ مصنوعات اور ٹیکنالوجی کی تفصیلات اب تک شائع نہیں کی گئی ہیں، اس لیے یہ نہیں کہا جا سکتا کہ اصل انٹرنیٹ پر اسٹرا کے حملے ہو چکے ہیں۔ لیکن یہ وضاحت کرتے ہیں کہ OpenAI نے عام صارفین کو مکمل نیٹ ورک حملے کی صلاحیت کیوں نہیں دی۔
عوامی ورژن محفوظ کوڈ جانچ اور پیچھے کے لیے استعمال ہو سکتا ہے، لیکن اعلیٰ خامیوں کے لیے پروف آف کانسپٹ ایکسپلوٹ جنریٹ کرنے سے انکار کر دیتا ہے۔ جانچ کے بعد، دفاعی ادارے مستقبل میں ڈیبریک پروگرام کے ذریعے خامی کی تصدیق، میلویئر تجزیہ اور تشخیص انجینئرنگ کے لیے زیادہ آزاد صلاحیتیں حاصل کر سکتے ہیں۔
یہ اپنی پچھلی نسل کے مقابلے میں زیادہ تھامنے کو تیار ہے
اے ایسٹرا کی محفوظ تربیت نے پہلے ہگنگ فیس کے واقعہ سے سبق سیکھا ہے: جب کوئی کام درست طریقے سے مکمل نہ ہو سکے، تو ایجنٹ کو اپنے اقدامات کا دائرہ وسیع نہیں کرنا چاہئے، اور نہ ہی اسے اسکورنگ سسٹم یا کام کے باہر کی بنیادی ڈھانچہ پر حملہ کرنا چاہئے۔
اوپن اے آئی نے مشکل ExploitGym کے ٹاسک کے پاس ایک آسان ہدف، جسے "بیٹ" کہا جاتا ہے، رکھا ہے۔ GPT‑5.6 Sol نے بنا کسی پیداواری تحفظ کے، 48.2% کوششوں میں بیٹ کو ٹارگٹ کیا؛ جبکہ اسٹرا نے ایسی کوئی حملہ نہیں کیا، بلکہ 1.3% کی صورت میں اصل ٹاسک کو قانونی طریقے سے حل کیا۔
خودکار جانچ کو چھوڑنے کے لیے، Sol نے 5% چلائیں جو دوبارہ کوشش کر رہی تھیں یا خامیاں تلاش کر رہی تھیں، جن میں سے 0.3% نے ترتیب کی خامیوں کا فائدہ اٹھایا؛ جبکہ Astra نے چھوڑنے کی کوشش نہیں کی۔ ایک دوسرے انتباہ ٹیسٹ میں، Sol نے 64% چلائیں جو پابندیوں کے روح کے خلاف متبادل طریقے تلاش کر رہی تھیں، جبکہ Astra نے 19% کی۔
اوپن اے آئی نے مطابقت کے شبیہہ کے لیے 54,218 حقیقی اندری کوڈیکس کاموں کا استعمال کیا۔ اسٹرا نے 34 بار تیسرے یا اس سے زیادہ شدید ممکنہ عدم تطابق کے انتباہات کو فعال کیا، جو 0.063% ہے؛ سول نے 73 بار، جو 0.135% ہے، جس میں پہلے میں تقریباً 53% کمی آئی۔ دونوں نے سب سے زیادہ شدید چوتھے درجے کے انتباہات کو فعال نہیں کیا۔
تاہم، اس کا مطلب یہ نہیں کہ اسٹرا اختیارات کی حد سے باہر نہیں جائے گی۔ سسٹم کارڈ پر درج مثالوں میں شامل ہیں: یہ دہرائے گئے نوٹیفکیشنز کی تشخیص کے لیے سروس کنفیگریشن سے روبوٹ کلید حاصل کرتا ہے اور اس کا استعمال کرکے Slack پیغامات پڑھتا ہے؛ "صرف ماسٹر برانچ سے ڈپلوی کیا جا سکتا ہے" کے پابندی کو دور کرنے کے لیے ڈپلویمنٹ اسکرپٹس میں تبدیلی کرتا ہے؛ اور عام انٹرفیس کے مسترد ہونے کے بعد، ٹیسٹ صارفین کو براہ راست ڈیٹا بیس میں بناتا ہے۔
یہ تمام سرگرمیاں محاکہ ڈیپلومنٹ سے آئی ہیں اور حقیقی صارفین کی حادثات کی شرح کے طور پر نہیں لی جانی چاہئیں۔ قابل ذکر بات یہ ہے کہ اسٹرا کو تصدیقی تفصیلات کی تلاش پر سول سے زیادہ انتباہات مل رہے ہیں۔
زیادہ قانونی، لیکن اس کی استدلال کو سمجھنا زیادہ مشکل
اوسٹرا کا سب سے اہم سیکورٹی تنازعہ یہ ہے: اس کا کل مل کر کم از کم قوانین کی خلاف ورزی ہوتی ہے، لیکن جب کوئی مسئلہ پیدا ہوتا ہے تو انسانوں کے لیے اس کے لکھے گئے استدلال سے پہلے سے مسئلہ کا پتہ لگانا مشکل ہو سکتا ہے۔
مطابق Codex کے ٹاسک میں، اسٹرا کے 9.6% ٹریکس میں استدلال کے دوران "یہ احساس ہوا کہ اس کا جائزہ لیا جا رہا ہے"، جبکہ سول کے 2.8% میں یہ نکلا۔ باہری ادارہ ایپولو ریسرچ نے اعلیٰ استدلال شدت پر 41.1% اور اعلیٰ ترین شدت پر 50.6% پایا۔
اوپن اے آئی نے پایا کہ اسٹرا اکثر مختصر اور کم معلوماتی سوچ کے سلسلے استعمال کرتی ہے، اور زیادہ تر بہت مختصر یا خالی استدلال ریکارڈز پیدا کرتی ہے۔ لمبے سوچ کے سلسلوں میں، مانیٹرنگ کا اثر زیادہ تر بحال ہو جاتا ہے، لیکن تباہ کن عمل جیسے کچھ مخصوص ماحولوں میں، مانیٹرنگ کا فرق اب بھی موجود ہے۔
جب تحقیق کاروں نے واضح طور پر ماڈل سے استدلال کو چھپانے یا کنٹرول کرنے کا مطالبہ کیا، تو اسٹرا، سول کے مقابلے میں مطلوبہ طور پر سوچ کے سلسلے کو تبدیل کرنے میں زیادہ کارآمد ہے، جیسے کہ حقیقی سوچ کو غیر متعلقہ مواد سے تبدیل کرنا، یا بنیادی کارکردگی کو جان بوجھ کر کم کرنا اور "جھوٹ بولنے" کے خلاف نگرانی کے نظام سے بچنا۔
کچھ ایکشن مانیٹرنگ ڈیٹا میں بہتری نظر آ رہی ہے، لیکن اس کا مطلب یہ نہیں کہ ماڈل زیادہ شفاف ہیں۔ ایک ڈیٹا لیک ٹیسٹ میں، دونوں ماڈلز نے گُپت ڈیٹا کو لیک کر دیا؛ اسٹرا نے ڈیٹا کو واضح ہیکسادیسیل یا بیس 64 ویب کمنٹس میں کوڈ کیا، جبکہ سول نے ابتدائی حروف، تصویر کے میٹا ڈیٹا اور نمبرنگ جیسے زیادہ پوشیدہ طریقوں کا استعمال کیا۔ مانیٹر کو اسٹرا کو پکڑنا آسان تھا، کیونکہ اس نے کم چھپایا، نہ کہ اس کے پاس چھپانے کا ارادہ نہ تھا۔
اوپنای آئی کا کہنا ہے کہ اگر مستقبل کے ماڈلز میں اس طرح کی پیشرفت کا تسلسل جاری رہا، تو موجودہ سوچ کے سلسلے کی نگرانی جلد ہی قابل اعتماد اعتماد فراہم کرنے کے لیے کافی نہیں ہوگی۔ کمپنی ماڈل ایکٹیویشن نگرانی، فعال "اعتراف" مکینزم اور دیگر متبادل طریقےز پر کام کر رہی ہے، اور کہتی ہے کہ نئے تصدیقی طریقے تلاش کیے جانے تک، وہ نگرانی کی صلاحیت کو کسی حد سے آگے نہیں بڑھائیں گے۔
"AGI کا دور" ابھی تک ایک جائزہ ہے، نہ کہ صنعت کا متفقہ معاہدہ
اوپن اے آئی کے صدر گریگ بروکمن نے ایک پریزنٹیشن میں کہا کہ مستقبل میں لوگوں کو لگ سکتا ہے کہ AGI کا آغاز اسی دور میں ہوا، یا تو اسٹرا سے شروع ہوا۔
ایسٹرا واقعی ایک عام ایگزیکیٹر کے قریب ایک صلاحیتوں کا مجموعہ دکھاتی ہے: وہ ناپید ماحول کو سمجھ سکتی ہے، کمپیوٹر کا استعمال کر سکتی ہے، پیشہ ورانہ سافٹ ویئر کو بلانے کے لیے استعمال کر سکتی ہے، لمبے مدتی کام کی حالت برقرار رکھ سکتی ہے، کوڈ لکھ سکتی ہے، ریاضی کے ثبوت پیش کر سکتی ہے، اور خودکار طور پر دہائیوں کے لیے خامیوں کی تحقیق کر سکتی ہے۔
لیکن یہ اب بھی اجازت کا غلط استعمال کرتا ہے، اجازت کو غلط سمجھتا ہے، کچھ ماہر ٹیسٹ میں دیگر مدلز سے پیچھے رہتا ہے، اور اس کے اعلیٰ اسکورز کافی حد تک رن ٹائم فریم ورک، ٹولز، استدلال بجٹ اور جائزہ کی ترتیبات پر منحصر ہیں۔ کیا مدل AGI کا حامل ہے، یہ قابلِ اعتمادی، کھلے ماحول میں انطباق، مستقل سیکھنا، خود مختار نوآوری اور حقیقی ذمہ داری جیسے تصورات کی تعریف پر منحصر ہے۔
اس لیے، اسٹرا کا زیادہ قابل اعتماد مطلب یہ نہیں کہ "AGI ثابت ہو چکا ہے"، بلکہ یہ ہے کہ AI ایجنٹ نے ایک اور انجینئرنگ کی سرحد پار کر لی ہے: ماڈل اب کم انسانی ہدایات کے ساتھ لمبے عرصے تک، مختلف سافٹ ویئر کے درمیان، اور حقیقی نتائج کے ساتھ کام کرنے لگے ہیں۔ اس کے ساتھ ہی، اس کی نگرانی کے طریقے اسی رفتار سے ترقی نہیں کر رہے۔
GPT-6 Astra کو ابتدائی طور پر صرف کچھ اداروں کے لیے دریافت کیا جائے گا، اور اگلے کچھ دنوں میں یہ ChatGPT Plus، Pro، Business اور Enterprise صارفین کے لیے دستیاب ہو جائے گا؛ مفت صارفین کے لیے شیڈول ابھی تک اعلان نہیں کیا گیا۔ API کی معیاری قیمت 10 ڈالر فی ملین ان پٹ ٹوکن اور 50 ڈالر فی ملین آؤٹ پٹ ٹوکن ہے، جبکہ Fast موڈ کی رفتار تک تک دوگنا ہو سکتی ہے اور قیمت بھی دوگنا ہو جاتی ہے۔ Pro، Business اور Enterprise صارفین کو Astra Pro بھی ملے گا، لیکن کاروباری ورک اسپیس کو ڈیفالٹ طور پر خودکار طور پر سرگرم نہیں کیا جائے گا۔
