GPT-6 Astra کا ARC-AGI-3 میں تقریباً مکمل اسکور AGI پر بحث کا باعث بن گیا

iconMetaEra
بانٹیں
AI summary iconخلاصہ
GPT-6 Astra نے ARC-AGI-3 پر تقریباً مکمل نمبر حاصل کیے، جس میں سمبولک ورلڈ ماڈل کا استعمال کرتے ہوئے 96 فیصد کاموں میں انسانوں سے بہتر پہیلیاں حل کیں۔ اس ٹیسٹ کی لاگت 18,000 امریکی ڈالر تھی، جس پر تنقید کرنے والوں نے کہا کہ اس نے حقیقی AGI کے بجائے باہری ٹولز پر انحصار کیا۔ جبکہ رِسک-آن ایسٹس میں دلچسپی بڑھ رہی ہے، اس ماڈل کی کارکردگی سے سوال اٹھتا ہے کہ حقیقی AI کی ترقی اور اعلیٰ لاگت والی کمپوٹیشن میں کیا فرق ہے۔ CFT ایجنسیاں پہلے ہی دیکھ رہی ہیں کہ AI کی ترقیات تنظیمی فریم ورکس پر کس طرح اثر ڈال سکتی ہیں۔
GPT-6 Astra نے ARC-AGI-3 ٹیسٹ میں 100% کے قریب سکور حاصل کیا، جس سے توجہ کھینچی گئی۔ یہ ماڈل "سymblic world model" کو تخلیق کرکے حقیقی دنیا کو منطقی علامات اور علیحدہ کوڈ میں تبدیل کرتا ہے، اور نئے گرافک گیمز میں خودکار طور پر DSL الجبرا سسٹم بناتا ہے تاکہ ماحول کے قوانین کو ریکارڈ کیا جا سکے، اور "وائرچل سینڈ باکس" بنانے کے بعد اس میں سیمیولیشن کرکے اقدامات کرتا ہے۔ تاہم، اعلیٰ سکور کے پیچھے ہر سوال کے لیے 360 امریکی ڈالر، اور پورے ٹیسٹ کے لیے 18,000 امریکی ڈالر کا مہنگا کمپوٹیشنل خرچ شامل ہے۔ ARC Prize فاؤنڈیشن کے صدر گریگ کامرڈ نے بتایا کہ اعلیٰ سکور Harness کے باہری فریم ورک پر منحصر ہے، اور یہ حقیقی AGI کی کامیابی نہیں بلکہ صرف یہ ثابت کرتا ہے کہ AI ذکی ہوتا جا رہا ہے۔

مضمون کا مصنف، ذریعہ: Leifengwang

AI کی ذہانت ٹیسٹ کو توڑ دیں! GPT-6 Astra کا سمبولک ورلڈ ماڈل، کریٹیو بیک اسٹریٹ ہے یا کریڈٹ کی طاقت سے اسکور کیا گیا؟

ہر سوال پر 360 امریکی ڈالر خرچ کرتے ہوئے، کیا GPT-6 نے حقیقی طور پر AGI کو پاس کر لیا ہے؟

اوپن اے آئی کا طاقتور ترین ماڈل GPT-6 Astra بالآخر متعارف کرایا گیا، جس نے کمپیوٹر آپریشن، سائنسی تحقیق اور سیکیورٹی دفاع میں حیرت انگیز کامیابی حاصل کی ہے۔ اور متعدد نمایاں کامیابیوں میں، عام لوگوں کے درمیان سب سے زیادہ بحث کا موضوع ARC-AGI-3 ٹیسٹ میں اس کا 100% کے قریب اسکور ہے۔

AI کی ذہانت ٹیسٹ کو توڑ دیں! GPT-6 Astra کا سمبولک ورلڈ ماڈل، کریٹیو بیک اسٹریٹ ہے یا کریڈٹ کی طاقت سے اسکور کیا گیا؟

ARC-AGI-3 کیا ہے؟ یہ عالمی ٹیکنالوجی دنیا کی طرف سے AI کی "بُھرائی" کے لیے تسلیم شدہ امتحان ہے، جسے آپ AI کے لیے مینسا کلب کے داخلے کے امتحان کے طور پر سمجھ سکتے ہیں۔

اس ٹیسٹ میں صرف متغیر شکل کے نمونوں کے سوالات ہیں، جنہیں یاد کر کے تیار نہیں کیا جا سکتا؛ AI کو انسان کی طرح ماحول کا جائزہ لینا، مقصد کا اندازہ لگانا، اور فوری رد عمل اور استدلال کے ذریعے نمونے دریافت کرنے ہوں گے۔ یہ مختلف جائزہ سطحوں میں اعلیٰ سطح کا ہے اور AI کو صرف ایک ٹول بنائے رکھنا ہے یا اصل ذہانت رکھتا ہے، اس کا اصل اختبار ہے۔

اور GPT-6 Astra نے اس ٹیسٹ کو بالکل ختم کر دیا، جبکہ پچھلا ماڈل GPT-5.6 Sol کا اسکور صرف 38.3% تھا، جو حقیقت میں ایک بہت بڑی قفزہ ہے۔ یہ ذہانت انسانوں کو بھی زبردست طور پر پیچھے چھوڑ دیتی ہے، 96% لیولز میں، یہ انسانوں کے مقابلے میں زیادہ کارآمد ہے اور اوسطاً انسانوں کے مقابلے میں 51.7% کم ایکشنز لگاتی ہے۔

اگر ایک AI مکمل طور پر ناپرہیز ماحول میں منطقی قوانین قائم کرنے اور مسائل حل کرنے کی صلاحیت رکھتا ہے، تو ہم خیال کر سکتے ہیں کہ مستقبل میں، شاید یہ ناپرہیز آٹو نومیٹڈ ڈرائیونگ کے حالات میں صحیح فیصلے کرے گا، یا نئے، ناپرہیز وائرس کے احتجاج کے دوران، جلدی سے اثرات دار دوا کی مولیکولر سٹرکچر کا اندازہ لگائے گا۔

GPT-6 Astra کو اتنے ذکی کیوں بنایا گیا، اس کی تحقیق کے لیے ARC Prize کی اہلیت نے اس کے بیک اینڈ ریکارڈز کا جائزہ لیا اور پایا کہ جب یہ کھیل کھیلتا ہے، تو یہ موثر "سمبولک ورلڈ مڈل" تخلیق کرتا ہے۔

AI کی ذہانت ٹیسٹ کو توڑ دیں! GPT-6 Astra کا سمبولک ورلڈ ماڈل، کریٹیو بیک اسٹریٹ ہے یا کریڈٹ کی طاقت سے اسکور کیا گیا؟

سِمبولک ورلڈ مڈل "ورلڈ مڈل" کا ایک جدید تر اختراع ہے۔ جب ورلڈ مڈل فنکار کی طرح مستقبل کی پیشگوئی کے لیے تصاویر استعمال کرتا ہے؛ تو سِمبولک ورلڈ مڈل ایک ریاضیدان کی طرح ہے جو حقیقی دنیا کو منطقی علامات اور علیت کے کوڈ میں تصور کرتا ہے۔

یہ ٹیکنالوجی AI کے لیے اعلیٰ استدلال کی طرف جانے کا ضروری مرحلہ سمجھی جاتی ہے۔

سِمبول ورلڈ ماڈل کیا ہے؟

گزشتہ زمانے میں، بہت سے بڑے ماڈلز ARC-AGI سیریز بینچ مارک میں اچھے اسکور نہیں حاصل کر پائے کیونکہ وہ "جبری تجربہ و غلطی" کی عادی ہو چکے تھے۔ AI گیم کی تصویر کو پکسلز میں تقسیم کر دیتا تھا، پہلے کہیں بھی کلک کر دیتا تھا، اگر غلط نکلا تو دوسری طرف جاتا تھا، اور اس طرح اتفاق سے گیم پورا کر لیتا تھا۔

اس موڈ میں، چاہے کچھ اسکورز کو توڑ دیا جائے، AI کو گیم کے قوانین کا حقیقی طور پر سمجھنا یا掌握 نہیں ہوتا۔

سymbold world ماڈل کی طرف سے مکمل کنٹرول کا سبب یہ ہے کہ یہ اردگرد کے ماحول کے فزیکل قوانین اور علیت و معلولیت کو پوری طرح سمجھنے کے بعد، تفصیلی حسابات کے ذریعے فیصلہ کرتا ہے۔

عملی ٹیسٹ میں، جب GPT-6 Astra کسی نئے گرافکس گیم میں داخل ہوتا ہے، تو وہ اپنے خود بنائے گئے DSL، ایک مخصوص الجبرائی علامات کے نظام کا استعمال کرتے ہوئے، ماحول کے بارے میں بہت سارے نوٹس لینا شروع کر دیتا ہے۔ مثال کے طور پر، وہ گیم کے مخفی قواعد، آنے والے حکمات کی ترتیب، اور ہر پکسل کی حرکت کو مکمل طور پر کوآرڈینیٹ سسٹم پر نقشہ بناتا ہے۔

اس الجبری ریکارڈنگ کے طریقے سے منفرد اور واضح عالمی حالت حاصل ہوتی ہے، جو پہلے کے ماڈلز کے قدرتی زبان کے تعامل سے پیدا ہونے والے اشکالات کے مقابلے میں درستگی میں ایک ایپک ترقی لاتا ہے۔

پھر، وہ ذہن میں پائیتھن کوڈ کا ایک منطق تیار کرتا ہے: "اگر میں A دبانے والا ہوں، تو گراف 90 ڈگری بائیں طرف موڑ جائے گا۔"

پھر، وہ اپنے دماغ میں ایک "وِرچوئل سینڈ باکس" بناتا ہے اور اگلے منصوبے کو دماغ میں محاکہ کرتا ہے۔ منطقی طور پر بند ہونے اور درست ہونے کے بعد، وہ حقیقی گیم میں پہلا قدم اٹھاتا ہے۔ یہی وجہ ہے کہ اس کی آپریشنل کارکردگی انسانوں سے کہیں زیادہ ہے۔

GPT-6 Astra کی صلاحیتوں کی سرحدوں کو جاننے کے لیے، ریڈ ٹیم پلیٹ فارم PRO‑LONG نے اسے کوڈ سینڈ باکس میں ڈال دیا، جہاں AI خود کسٹم کوڈ لکھنے اور چلانے کی اجازت پاتا ہے۔

نتیجے میں، GPT-6 Astra نے ہر گیم کے لیے "کسٹم" ٹولز تیار کرنا شروع کر دیے۔ مثلاً، ایک ایسے پیچیدہ لیبرنٹ میں جہاں گارڈز گشت کر رہے تھے، GPT-6 Astra نے خود ایک نیویگیشن سسٹم لکھا، پھر لڑائی کے قوانین شامل کیے، گارڈز کی گشت کے راستوں کو سیمولیٹ کیا، اور آخر کار اپنی تیار کردہ ٹول چین کے ذریعے نتائج کا پیش گوئی اور تصدیق کر لیا۔

پچھلے سالوں میں، یہ علامات کی استدلال اور خودکار ٹولز بنانے کی صلاحیت بالکل باہری ہارنس اضافی فریم ورک پر منحصر تھی۔ اضافی ٹولز ماڈل کے لیے تصویر ترجمہ، حالت کا ریکارڈ اور نتائج کی تصدیق کرتے تھے، لیکن اس کے بڑے نقصات تھے: ماڈل اور اضافی ٹولز کے درمیان ڈیٹا کا تبادلہ اعلیٰ تاخیر کا باعث بنتا تھا؛ اضافی ٹولز کی انجینئرنگ صلاحیتیں بڑے ماڈل کے وزن تربیت سے بالکل الگ تھیں؛ اور بالائی کمپوٹنگ ماحول اور باہری اسکرپٹس پر زبردست انحصار کی وجہ سے، اس قسم کی اعلیٰ صلاحیتیں کلائنٹ سائڈ اور ایج ہارڈوئیر پر ڈپلو کرنا مشکل تھا۔

اور اب GPT-6 Astra نے Harness کی بڑی تعداد میں صلاحیتیں اپنے خود کے وزن میں شامل کر لی ہیں۔ جو ٹاپ اسکالر گیری مارکس نے ہمیشہ سمبولک دنیا کے ماڈل کو ترجیح دیا ہے، وہ GPT-6 Astra کو اس راستے پر ایک بڑی کامیابی کہہ رہے ہیں۔

گزشتہ دو سالوں میں، اکیڈمیا اور صنعت دونوں میں اس سمت میں کئی اہم کام سامنے آئے ہیں، ہارورڈ، ایم آئی ٹی سے لے کر گوگل ڈیپ مائنڈ تک، سب نے "سِمبولک ورلڈ مڈل" پر اپنا بہت بڑا بھروسہ کیا ہے۔ AGI کی طرف جانے والے کئی شاخوں کے سامنے، صنعت اب ایک بنیادی ٹیکنالوجی کے اتفاق رائے تک پہنچ رہی ہے۔

اس قدر اعلیٰ اسکور کے ساتھ، AGI یقینی ہے؟

سوال بنانے والا خود ہی پانی بھر دیتا ہے

د цیل نیٹ ورک میں اس سکور کے لیے ہلچل مچی ہوئی تھی، لیکن کئی لوگوں نے OpenAI کے صدر گریگ بروکمن کے الفاظ "AGI آ گیا ہے" کو شیئر کیا، جبکہ ARC Prize فنڈیشن کے صدر گریگ کامرڈٹ نے خود ٹھنڈا پانی بھر دیا۔

وہ سوالات بنانے والوں میں مرکزی شخصیت ہیں، معیار کیسے ڈیزائن کیا جائے اور اسکور کیسے سمجھا جائے، اس میں اس کی سب سے زیادہ آواز ہے۔ جائزہ کے نقطہ نظر سے، وہ سمجھتے ہیں کہ اسکور سچے ہیں، لیکن یہ چیز AGI سے لاکھوں میل دور ہے۔

اب تک، اس نے کئی ٹیمیں دیکھی ہیں جنہوں نے Agent Harness کے ذریعے ARC-AGI-3 پر 90% سے زیادہ حاصل کیا ہے، جیسے超强记忆外挂 والی PRO-LONG، گہری تفصیل کے لیے ماہر Tycho، اور اپنے پروگرامنگ ماحول کو خود بخود ترقی دینے والی Prime Agent۔

ان اعلیٰ اسکور والے مصنوعات کے پاس مشترکہ ٹیکنالوجی کا ریسیپ ہے، جس میں نقصان رہنے والی میموری، پروگرامیٹک تجزیہ، صریح فرضیہ ٹیسٹنگ، مستقل حالت، اور کم لاگت والے اندر کے کمپوٹیشن شامل ہیں۔

ناقصِ یادداشت ذمہ دار یاد رکھنے کے لیے، پروگرامی تجزیہ منطق کے لیے، صریح فرضیہ کی جانچ پڑتال استنباط کے لیے، مستقل حالت بہت سارے تعاملات کے سیاق و سباق کے لیے، اور کم لاگت والے اندری حسابات سستے اندری کمپوٹیشن کے لیے ذمہ دار ہیں، جس سے AI ورچوئل ماحول میں غلط جوابات کا تجربہ کرنے کے بعد صحیح جواب پیدا کر سکتا ہے۔ یہ سب مل کر ایک بے مثال ہیرنس بناتے ہیں جو ماڈل کی اپنی کمیوں کو پورا کرتا ہے۔

GPT-6 Astra نے 100% کا اسکور حاصل کیا، جس میں ایک شاندار Harness استعمال کیا گیا، اور اس نے خصوصی طور پر ڈیزائن کیے گئے "سپلائر ایڈاپٹر بیس" کا استعمال کرتے ہوئے مسلسل مکالمے اور حوالہ کو دباؤ کے ذریعے منطقی سلسلہ بنایا۔ ہر گیم کے ختم ہونے کے بعد 360 امریکی ڈالر کی مہنگی کمپوٹنگ طاقت کی ضرورت پڑتی ہے۔ اگر پورا ٹیسٹ مکمل کیا جائے تو کل کمپوٹنگ بل لگ بھگ 18,000 امریکی ڈالر (تقریباً 135,000 چینی یوان) تک پہنچ جائے گا!

ایک انسان ایک گرافک پہیلی حل کرنے میں صرف کچھ منٹ لے سکتا ہے، اور انسانی دماغ کے 20W میٹابولک پاور کے حساب سے بجلی کا خرچ نصف سینٹ سے کم ہوتا ہے؛ حتیٰ کہ اگر شرکاء کو حقیقی گھنٹہ کی تنخواہ کا اضافہ بھی شامل کر لیا جائے، تو ہر گیم کا خرچ صرف 12.78 امریکی ڈالر ہوتا ہے، جبکہ AI کو 360 امریکی ڈالر خرچ کرنے پڑتے ہیں۔ کیا یہ "پیسے کی طاقت" سے حاصل کردہ کامیابی عام لوگوں کے لیے دستیاب AGI بن سکتی ہے؟

بالکل، GPT-6 Astra نے Harness کی صلاحیتیں تدریجاً اندر کر لی ہیں، اگر یہ ترقی جاری رہی تو ماڈل کے اندر بالقوہ کمپوٹیشنل صلاحیتیں مزید بہتر ہوتی جائیں گی۔ تاہم، کیونکہ اس کا استدلال عمل اب غیر شفاف ہو گیا ہے، ڈویلپرز نہیں جانتے کہ AI واقعی سمجھ گیا ہے یا اس نے زیادہ موثر چال بازی کا طریقہ تلاش کر لیا ہے۔

اوپر کے سوال پر واپسی، GPT-6 Astra کو AGI کہا جا سکتا ہے؟

اس سوال کے جواب میں، گریگ کامرڈٹ نے اپنے لمبے مضمون کے آخر میں ایک فلسفیانہ جواب دیا۔ انسان کیوں "جنرل انٹیلی جنس" کہلائے جاتے ہیں؟ کیونکہ انسان کسی بھی ناپہچھانے والی دنیا میں اپنے آپ کو ڈھال سکتے ہیں، چاہے قدیم بچے کو جدید دور میں چھوڑ دیا جائے، وہ اب بھی میٹرو استعمال کرنا اور فون چلانا سیکھ لے گا۔ یہ انٹیلی جنس ہزاروں سالوں تک جاری رہی اور ٹیکنالوجی کی ترقی کو آگے بڑھائی۔ لیکن اب ٹیکنالوجی کے دنیا میں جو ٹیسٹ دیا جا رہا ہے، وہ صرف AI کے لیے ایک "گرافکس میچنگ امتحان" ہے۔

یہ صرف ثابت کرتا ہے کہ AI سمجھدار ہو رہا ہے، لیکن AGI کے آنے کا کوئی ثبوت نہیں ہے۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔