اگر آپ نام نہ دیکھیں تو آپ یقیناً سوچیں گے کہ یہ ایک اور شاندار ماڈل ہے جسے عام طور پر جاری نہیں کیا جا سکتا، جس نے ایک "ہیک شدہ" کارنامہ پیش کیا ہے:
تحقیق کریں: ایک سانس میں 7 مشہور ریاضی اور کمپیوٹر کے مسائل حل کریں، جس کا 40 صفحات کا ثبوت انتہائی سخت ماشینی جانچ بھی نہیں چھانٹ سکا؛
انجینئرنگ: میں نے صفر سے ایک بہت ہی حقیقی CPU سیمولیٹر لکھا، جس نے نہ صرف سسٹم کو شروع کیا بلکہ 0.71% کی خطأ کے ساتھ کام کیا؛
کوڈ لکھیں: ایگن اور پیرلی ہیش دونوں مقبول اوپن سورس لائبریریز کے مرکزی کوڈ کو بہتر بنایا، جس میں کی گئی تبدیلیاں مستقیم طور پر اپسٹریم مینٹینر نے منظور کر لیں۔
یہ گوگل کے Antigravity ٹیم کی 27 اگست کو جاری کی گئی کارکردگی کی رپورٹ ہے۔

ٹیم ورک کی تکنیکی لمبی رپورٹ میں، گوگل کی اینٹی گریویٹی ٹیم نے ریاضی، سسٹم اور اوپن سورس کے تین اقسام کے نتائج کا اعلان کیا۔
حیران کن بات یہ ہے کہ اس بار بڑے حسابی طاقت والے ماحول کی بجائے، "تیز اور سستا" پر زور دینے والے چھوٹے ماڈل: جیمنی 3.7 فلیش نے بڑا کردار ادا کیا۔

گوگل کے افسران نے خود یہ بھی کہا ہے: یہ فلیش لیول مدل کی طرف سے پہلی بار ڈاکٹری سطح کا ریسرچ نتیجہ ہے۔
سستے ماڈل کیسے اپنی سطح سے اوپر کے مقابلے میں کامیاب ہو سکتے ہیں؟
راز پیرامیٹرز میں نہیں، بلکہ Teamwork نامی ایک متعدد ایجنٹ اورکیشن فریم ورک میں ہے۔
گوگل کا درحقیقت صنعت کو یہ سیگنل دینا چاہتا ہے کہ فلیش اچانک ذکی نہیں ہوا، بلکہ کام کرنے کا طریقہ تبدیل ہو گیا ہے۔
Pro ہدایت کر رہا ہے
Flash کامیابی سے دوبارہ پیدا کیا گیا
اس رپورٹ کا مرکزی کردار کون ہے، گوگل کی طویل تکنیکی مضمون نے بہت سخت حدود طے کیے ہیں:
7 ریاضی اور تھیوریٹیکل کمپیوٹر سائنس کے نتائج، جو شروع میں تمام Gemini 3.1 Pro کے Teamwork کے لمبے ثبوت موڈ میں حاصل کیے گئے۔
لیکن حیرت انگیز بات یہ ہے کہ ان میں سے تین سخت نتائج، جیمنی 3.7 فلیش نے مکمل طور پر دہرائے۔
یہ تینوں چیزیں کبھی بھی تعداد پورا کرنے کے لیے استعمال نہیں ہوتیں: ℓp ذیلی فضا کے تقریبی کورست کی تعمیر، زیادہ سے زیادہ اندرونی حاصل کے لیے ابعاد کی حد، اور ہدمارڈ کوانتائزیشن کے ذریعہ اگلے مستقل عدد کو تقریباً 5.93 گنا کم کرنا۔
ہر ایک، اکادمیک دنیا کا ایک سنجیدہ کھلا مسئلہ ہے۔

باقی چار مسائل 3.1 Pro کے ذمہ ہیں، جن میں اسپارس کونوکس آپٹیمائزیشن کا کنڈیشن نمبر کا نیچے کا حد، پریفکس میٹرکس فیکٹرائزیشن کا تقریبی بہترین نیچے کا حد، کنوتھ کے سائکلز کا مسئلہ، اور آف لائن حالت میں دوبارہ پیش کیا گیا ایرڈوش یونٹ ڈسٹنس مسئلہ شامل ہیں۔
اس کے علاوہ، جس نے گوگل کے اندر کا ریکارڈ توڑ دیا، TCSBench کا 71% سب سے اعلیٰ سکور، 3.7 Flash اور 3.1 Pro کی طاقتور شراکت سے حاصل ہوا، جس نے پچھلی نسل کے 3.6 Flash اور 3.1 Pro کے 67.7% سکور کو براہ راست پیچھے چھوڑ دیا۔
جس میں، ہمیں جو اصل سگنل پر توجہ دینی چاہیے وہ یہ ہے:
اگر آپ اسکیل فریم ورک کو صحیح طریقے سے ترتیب دیں، تو فلیش جیسے ہلکے مודلز بالکل ایسے ہی ہو سکتے ہیں جو فلیگشپ مڈلز کے تجربات کو دوبارہ کر سکیں۔
یہ ہماری “چھوٹے ماڈل کیا کر سکتے ہیں” کے بارے میں سمجھ کے حدود کو تازہ کر دیتا ہے۔
ٹیم ورک نے "چیلنج" کو ایک سخت اصول بنادیا ہے
ٹیم ورک Antigravity ٹیم کے ذریعہ تیار کیا گیا ایک متعدد ایجنٹ اورکیسٹنگ فریم ورک ہے۔
آپ صرف ایک /teamwork-preview ٹائپ کریں، جیمینی پرومپٹ پڑھ لے گا، خود ماڈل منتخب کر لے گا، اور فوراً ایک "AI ماہرین کی ٹیم" تشکیل دے دے گا، جو کئی گھنٹوں یا دنوں تک چلے گی۔
پہلے ذکر کیے گئے ریاضی کے نتائج، تمام لمبے ثبوت (Long Proof) موڈ سے نکلے ہیں۔
اس کا ڈیزائن بہت غیر متوقع ہے: پیرامیٹرز کو جمع نہیں کیا جاتا، بلکہ کئی فلیشز کو ایک ساتھ اکٹھا کیا جاتا ہے تاکہ وہ ایک دوسرے کو "نکتہ چینی کریں، بحث کریں اور کمزوریوں کو نشانہ بنائیں"۔
تو AI یہ لوگ کیسے میٹنگ کرتے ہیں؟ اسے چار مراحل میں تقسیم کیا جا سکتا ہے:
مرحلہ اول: پاگل پن کا "مقابلہ کی حکمت عملی تلاش"۔
سسٹم ایک ساتھ کئی امیدوار منصوبوں کو فروغ دے گا اور ہر منصوبے کو ایک مخصوص "انتقادی م专员" مقرر کرے گا جس کا واحد KPI یہ ہوگا کہ وہ اس منصوبے کو مسترد کر دے۔
د цیل کی بات یہ ہے کہ جس منصوبے کو بے حد تنقید کا نشانہ بنایا جاتا ہے، اسے براہ راست کچرا ڈالنے کی بجائے، تمام مخالفت کے ساتھ عمل میں رکھا جاتا ہے۔
آخر کار، ایک بے راہ راستے میں اکثر ایسی حوصلہ افزا تخلیقی خیالات چھپی ہوتی ہیں جو جان بچا سکتی ہیں۔
دوسرا قدم: تصویر کے مطابق، "درست طریقے سے تحلیل کریں"۔
جب ایک قابل اعتماد حکمت عملی منتخب کر لی جائے، تو سسٹم اسے متعلقہ ذیلی مسائل میں تقسیم کر دیتا ہے اور ایک سخت ٹوپولوجیکل ڈائیگرام بناتا ہے۔ جو چیزیں متوازی طور پر آگے بڑھ سکتی ہیں، وہ آگے بڑھتی ہیں، اور جن کا ترتیب ضروری ہے، وہ ترتیب میں قطار لگا لی جاتی ہیں۔
مرحلہ 3: پاگل پن کا "اندر کا چیمپئن شپ"۔
ہر ذیلی سوال کے اندر ایک نئی حذف شدہ مقابلہ شروع کریں، نوڈ حکمت عملی کو پڑھتے ہوئے ناقدانہ تنقید کو دیکھے، اور مل کر ایک بہتر نسخہ تیار کریں۔
اگر مجموعی طور پر ناکام ہو جائے، تو جمع کردہ مخالفت کے ساتھ دوبارہ چلائیں، جب تک کہ خامی کو پوری طرح بند نہ کر دیا جائے۔
چوتھا مرحلہ: "کراس-ریل لرننگ" جس سے سبق سیکھا جائے۔
ناکام draft کو اصلی حالت میں اگلے دور کے لیے چھوڑ دیں، اور ہر ایک گڑھے کو جس پر ویریفائر نے قدم رکھا ہے، وہ «فندق رجسٹر» میں جمع ہو جائے۔
گذری ہوئی بے نتیجہ راہیں اور ثابت کیے گئے نتائج، تمام کو عملی طور پر شیئرڈ معلومات کے اسٹور میں مزیدار کر دیا جاتا ہے تاکہ تمام افراد کبھی بھی اس کا استعمال کر سکیں۔

Long Proof ماڈ کے ٹورنامنٹ نیٹ ورک: اہل کاری کی حکمت عملیوں کے لیے ہر ایک کے ساتھ ایک فلسیفائر مختص ہوگا، اور رد کردہ راستے مخالفت کے ساتھ عمل میں رہیں گے۔
اس پروسیجر کو مکمل کرنے کے بعد، یہ زیادہ تر ایک سرد اور بے رحم سپر کمپیوٹر نہیں بلکہ ایک انتہائی سخت، جہاں کوئی بھی گندے کام نہیں کر سکتا، اکیڈمک میٹنگ کا نقل ہے۔
یہاں، کسی کا بھی منصوبہ پہلے کئی بار تفصیل سے چیک کیا جاتا ہے، اور صرف وہی سخت ہڈیاں جو نہیں ٹوٹتیں، آسانی سے کامیاب ہوتی ہیں۔
یہ روایتی بہت سے عقلی نظاموں کے سب سے عام غلطی، گروہی ہسٹیریا کو فوراً ٹھیک کر دیتا ہے:
پہلے ایک AI جب غلطی سے رفتار کو بگاڑ دیتا، تو دوسرے AI بے سبب "جواب دینے والے" بن جاتے اور آخرکار غلط بنیاد پر اور زیادہ بلند تعمیر کرتے۔
ٹیم ورک کی ہتھیار، صرف "ایک دوسرے کو تلاش کرنا" کو ایک ایسے سخت نظام میں تبدیل کر دیا گیا جس سے کوئی بھی بچ نہیں سکتا۔
کنوت کے مسئلے کی سچائی
ان سات نتائج کے بارے میں، سب سے زیادہ دھیان کا مرکز اور سب سے زیادہ غلط فہمی کا شکار ہونے والا مسئلہ، ڈونلڈ کنوتھ کے ذریعہ پیش کیا گیا Knuth's Cycles ہے۔
اصل میں، یہ سوال اس سال بہار میں ہی AI کے ذریعہ حل کر لیا گیا تھا۔

ڈونلڈ کنوت، 2023 کا اسٹینفورڈ کرسمس لیکچر۔
اس سال فروری کے آخر میں، کلاڈ اوپس 4.6 نے صرف ایک گھنٹے کے قریب میں عجیب صورتحال کی تعمیر کر دی، جس نے گوڈن کو اپنے مضمون کے آغاز میں دو بار "Shock!" لکھنے پر مجبور کر دیا۔

اس کے بعد، GPT-5.3-Codex اور GPT-5.4 Pro جیسے ماڈلز نے سب سے مشکل زوجی صورتوں کو بھی مکمل کر دیا۔
اپریل کے وسط تک، گارٹنر نے اپنے مضمون کے مُعدّل نسخے میں واضح طور پر تصدیق کر دی کہ مساوی صورتوں کا معاملہ اب بے شک ہو چکا ہے۔
گوگل نے اس بار کیا کیا؟
بس اس کا مطلب یہ ہے کہ گوگل نے جفت صورتوں کے لیے دو نئے، زیادہ ہلکے اور زیادہ سادہ تعمیرات دریافت کیں، اور اس کے ساتھ ہی پہلے لمبے ثبوت کے دو دستاویزات جن کی لمبائی 40 اور 70 صفحات سے زیادہ ہے، شائع کیے۔
اس میں 40 سے زیادہ صفحات پر مشتمل سخت ثبوت کو Lean فارمال ویریفیکیشن سے گزارا گیا، جس میں مشین نے بھی کوئی خطا نہیں نکالی۔
یہ بالکل ایک کافی مضبوط اکادمیک کام ہے، لیکن اس کا اصل مطلب یہ ہے کہ اس نے "زیادہ خوبصورت ثبوت" پیش کیا ہے، نہ کہ حقیقی طور پر صفر سے نئی شروعات کی ہے۔
یہ بیان ٹیم ورک کی حقیقی طاقت کو ظاہر کرتا ہے:
اس نے کسی ایک مڈل کی «انفرادی بہت بڑی ذہانت» کو پورا کرنے کی بجائے، ادارہ جاتی مقابلہ اور منصوبہ بندی کے ذریعے، متعدد ذہانتوں کی بکھری ہوئی، باہمی تائید کرنے والی تعاون کی کمزوری کو بالکل ختم کر دیا اور «گروہی ذہانت» کو آزاد کر دیا۔
تھیورم سے شیل تک
یہ بار تو بالکل Flash نے کیا
ایک ہی تلاش کا نظام، گوگل نے اسے مختلف موڈ میں بدل دیا اور براہ راست سخت انجینئرنگ پر لگ گیا۔
اس بار ٹیکنیکل آرٹیکل میں صاف طور پر لکھا گیا ہے کہ "Gemini 3.7 Flash" کا استعمال کریں۔ ٹیم ورک نے صفر سے ایک سائیکل لیول، آرڈر کے بغیر انجام دینے والے RISC-V CPU سیمولیٹر کا ایجاد کیا ہے۔
آرڈر کے بغیر انجام دینا جدید اعلیٰ کارکردگی والے سی پی یو کا معیاری فیچر ہے اور یہ ایمولیٹر کو سب سے زیادہ کرشر کرنے والا نقطہ ہے۔
ٹیم ورک دو مراحل پر مشتمل ہے: پہلے مائیکرو آرکیٹیکچر فنکشن کو درست یقینی بنائیں، اپنی خود کی ڈس آرڈرڈ پائپ لائن اور ری آرڈر بفر لکھیں، اور xv6 آپریٹنگ سسٹم کو شیل تک شروع کر دیں؛ پھر ہر سائکل کے لیے ٹائمنگ کو مطابق کریں۔

ٹیم ورک کے ذریعہ تعمیر کردہ RISC-V سیمولیٹر کا xv6 کرنل شروع کرنا اور شیل میں داخل ہونا۔
سخت ترین رکاوٹ، جسے گوگل "سائیلینٹ ایکزیکیشن گیپ" کہتا ہے۔
سیمیولیٹر کی مائیکرو آرکیٹیکچر کی حالت کئی سو سائکلز میں خاموشی سے پھسل سکتی ہے، اور جب آرکیٹیکچر لیول پر خطا ظاہر ہوتی ہے تو اس کا بنیادی سبب پہلے ہی نہیں ملا جا سکتا۔
ٹیم ورک کا حل اسٹائپ سیمیولیٹر کو سیکھنے والے ایجینٹس کے چیٹنگ اور نقل کرنے سے بچانے کے لیے انکلوس کرنا، اور پورے عمل کو سکیوئنسلی سینکرونائزڈ سیمیولیشن کے ساتھ جوڑنا ہے، جہاں ہر قدم کا تصدیق کیا جاتا ہے۔
آخر کار، اس سیمولیٹر نے 100 سے زیادہ RISC-V معیاری بنچ مارکس چلائے، اور نئے ٹیسٹ لوڈز پر BOOM ہارڈویئر کے ساتھ اوسط سائکل کی خطاء صرف 0.71% تھی۔

گوگل نے افشا کیا: ٹیم ورک سیمولیٹر اور BOOM ہارڈویئر کے درمیان سائکل الائنمنٹ کا موازنہ، ٹیسٹ لوڈ پر اوسط خطأ 0.71% نہیں دیکھا گیا۔
تاہم یہاں واضح کرنا ضروری ہے کہ یہ سافٹ ویئر لیول کا سیمولیٹر ہے، RTL چپ ڈیزائن نہیں، اور بالکل بھی چپ کا پروڈکشن نہیں۔
اصلی کوڈ کے ساتھ کھلے ذرائع پر عملی عمل
AI سائنسی تحقیق کے دوسرے نصف میں اتارنا اور تصدیق کرنا اہم ہے
گنتی اور سیمولیٹر کے مقابلے میں، آخری قسم کے نتائج سب سے کم نمایاں لگتے ہیں، لیکن ان کا ثبوت سب سے زیادہ مضبوط ہوتا ہے۔
ایگن C++ دنیا میں استعمال ہونے والی ایک بہت ہی مقبول اور بلند کارکردگی والی لینیئر الجبرا لائبریری ہے۔
ٹیم نے ایک منفرد سطر یا منفرد کالم میٹرکس ویکٹر ضرب کے غیر بہترین عمل کو شناخت کیا اور براہ راست ایک SIMD تیز راستہ تیار کیا۔
جبکہ کنکرنس ہیش ٹیبل ParlayHash میں، ٹیم ورک نے Swiss Table کے بہترین خیالات کو شامل کیا، جس سے 64 تھریڈز کی ابتدائی درج کرنے کی رفتار دونوں گنا ہو گئی، ایک تھریڈ کی کل رفتار 1.5 گنا بڑھ گئی، اور ہر عنصر میں 25% کم میموری استعمال ہوئی۔
یہ دو تبدیلیاں صرف ایک خود کے لیے بنائی گئی اور بند دروازوں کے پیچھے ہونے والی خود پسندی کا نتیجہ نہیں ہیں، بلکہ انہیں سخت اوپن سورس کوڈ ریویو کے عمل سے گزر کر باہری انسانی مینٹینر نے اپسٹریم برانچ میں موجودہ کوڈ کے طور پر منظور کیا ہے۔
رننگ سکور سے زیادہ توجہ کا مطلب ایک ریاضی کی تحریر کے آخر میں مصنف کا بیان ہے: ثبوت کو پہلے گوگل کے اندر کے جیمنی انسانی نظام نے تیار کیا، اور پھر مصنفین نے اس کی تصدیق اور ویرایش کی۔
ایجینٹ بے حد نوٹس کے کاغذوں پر پاگل وانگھ تلاش کرتا ہے، جبکہ انسان دستخط کرتا ہے اور آخری تصدیق کرتا ہے۔ یہی اب کے AI تحقیق کی سب سے اصل تقسیم ہے۔
گوگل خود بہت واضح طور پر کہتا ہے: یہ مسائل اصل میں اعلیٰ ماہرین کے لیے کئی ماہ کا کام ہوتے، لیکن ٹیم ورک تجربہ و غلطی کے دوران کو کم کرتا ہے، جبکہ ڈرائیونگ اور آخری دستخط کا اختیار اب بھی انسان کے ہاتھوں میں ہے۔
AI تحقیق کا دوسرا نصف، اب اس بات پر منحصر ہے کہ کس کی AI ٹیم بہتر بنائی گئی ہے، نہ کہ کس کا ماڈل زیادہ پیرامیٹرز کے ساتھ ہے۔
جتنا سستا اور روزمرہ کی چیز کی طرح استعمال کی جانے والی مدل ہو، انسانوں کی قبولیت اور نگرانی اتنا قیمتی ہوتی ہے۔
پہلے، انسان مسائل کو حل کرنے والا تھا۔ اب، انسان مسائل بنانے اور ان کی تصدیق کرنے والا ہے۔
گارٹنر نے کلاڈ کے لیے دستی ثبوت کی تعمیر کی، جب انہیں معلوم ہوا کہ کسی نے لین کے ذریعے اس کی تصدیق کر دی ہے، تو انہوں نے کہا کہ "یہ بہت اچھی بات ہے"، کیونکہ وہ "حالیہ وقت میں غلطیاں کرنے لگے ہیں"۔
88 سالہ ٹیورن ایوارڈ وصول کنندہ کے ثبوت کو بھی ویریفائر سے گزرنا پڑتا ہے، AI کے لکھے گئے ثبوت کو تو بھی استثنا نہیں دیا جا سکتا۔
مسائل کے حل کے لیے مشین زیادہ سے زیادہ کام کرے گی۔ قبولیت کے مرحلے پر، ضرور کوئی انسان موجود ہو۔
حوالہ جات:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
یہ مضمون ویچن گروپ "نیوزی یوان" سے ہے، مصنف: ASI ایلیس، ایڈیٹر: یوان
