ایڈیٹ|Panda
بائو کنٹینر میں، زمین کے نیچے ایک لیب "ہون" واقع ہے۔ دروازوں، نگرانی، ہوا کی تبدیلی، سیکورٹی اور پوری سہولت کے عمل کو ایک AI، ریڈ کوئین کے حوالے کر دیا گیا ہے۔

انسانی سائنسدان مطالعہ کے لیے ذمہ دار ہیں، لیکن اس لیب کے "ہاتھ اور پاؤں" کو ای آئی ہی کنٹرول کرتا ہے۔
جب نامعلوم واقعہ پیش آئے، تو ریڈ کوئن بند کر سکتی ہے، سسٹم کو کٹ کر سکتی ہے، سہولیات پر کنٹرول رکھ سکتی ہے، اور فزیکل دنیا میں براہ راست مداخلت کر سکتی ہے۔
اکیس سال پہلے، ایسی کہانیاں AI کے جسمانی دنیا میں داخل ہونے، مشینوں کو چلانے، اور تجربات کو عملی شکل دینے کے لیے سائنس فکشن فلموں میں خوف پیدا کرنے کا ایک کلاسک طریقہ تھیں۔
اب، یہ منظر ایک بالکل مختلف طریقے سے حقیقت میں داخل ہو رہا ہے — کم از کم اب تک خوفناک نہیں۔
گزشتہ کل، اینتھرپک نے فزیکل ہارڈویئر کے لیے ماڈل ہارڈویئر سٹینڈرڈ (MHS) جاری کیا، جس کا مقصد MCP کے منطق کو GitHub، Slack اور ڈیٹا بیس سے مزید آگے، مکینیکل آرمز، مائیکروسکوپ، لیکوڈ پروسیسرز، لیزرز جیسے حقیقی ڈیوائسز تک پھیلانا ہے۔ رپورٹ "بالکل ابھی، اینتھرپک نے فزیکل MCP جاری کیا: کلوڈ حقیقی دنیا پر قبضہ کرنا شروع کر چکا ہے" کو دیکھیں۔

بس اس بات کا مطلب یہ ہے کہ AI ایجنٹ کو صرف سافٹ ویئر کو کال کرنے کا "انٹرفیس" نہیں، بلکہ حقیقی دنیا سے جُڑنے کے لیے ایک "اعصاب اور ہاتھ پاؤں" کی ضرورت ہے۔ اور آج، گوگل ڈیپ مائنڈ نے اس شعبے میں اپنی کامیابی کا مظاہرہ کیا ہے۔
ایک حال ہی میں جاری کیے گئے 83 صفحات کے مقالے میں، گوگل نے جیمینی کو چلایا ہوا کو-سائنسٹ کو حقیقی سائنسی عمل میں شامل کیا اور اسے تجربات ڈیزائن کرنے، اجراء کے لیے کوڈ تخلیق کرنے، تجرباتی فیڈ بیک پڑھنے، اور تجرباتی ڈیوائسز کے ساتھ براہ راست جڑنے کا کام بھی دیا۔ گوگل نے اس تبدیلی کو ان-سلکو ہائپوتھیسس جنریٹر سے ایکزیکشن-گراؤنڈ ریسرچ پارٹنر تک کہا ہے، یعنی چپ پر فرضیہ جنریٹر → اجراء پر مبنی تحقیقی شراکت دار۔

سب سے زیادہ واضح تجربے میں، تحقیق کاروں نے اپنے خود ساختہ CVD ڈیوائس کی شرائط Gemini 3 Deep Think کو دیں۔ کچھ منٹوں کے بعد، اس نے اس ڈیوائس کے لیے مواد کی نمو کا منصوبہ پیش کیا اور اس منصوبے کو ڈیوائس کو کنٹرول کرنے والے مشین کوڈ میں ترجمہ کر دیا۔ آخرکار، تینوں دو بعدی نصف موصلات کی پہلی کوشش میں نمو ممکن ہو گئی۔
تو، ایک ایسا منظر جو پہلے صرف سائنس فکشن فلموں میں موجود تھا، اچانک حقیقت بن گیا: جب بڑے ماڈل کو واقعی "ہاتھ" مل گئے اور وہ تجرباتی ڈیوائسز کو چلانے لگے۔ تو، آج سے، AI Scientist کیا بن جائے گا؟
بائیو ہازرڈ میں، انسان AI کے لیب میں کنٹرول سنبھالنے سے ڈرتے ہیں۔ جبکہ حقیقی دنیا کے سائنسدان، لیب کو فعال طور پر کلک کریں AI کو سونپ دیں۔ بالکل، گوگل جو کرنا چاہتا ہے وہ بے قابو "شہد کے چھتے" نہیں، بلکہ ایک ایسا سائنسی دریافت مشین ہے جو فرضیہ بنانے سے لے کر تجربہ ڈیزائن کرنے اور عملی تصدیق تک جا سکے۔

علمی تحقیق کو ریئل ورلڈ میں جیمینی کے ساتھ تیز کرنا
کاغذ کا لنک: https://arxiv.org/pdf/2608.26701
جیمنی نے ایک تجرباتی ڈیوائس کو سنبھال لیا ہے
سب سے پہلے، مواد کی سائنس۔

تحقیق کاروں نے اپنی طرف سے تعمیر کیا گیا کیمیکل ویپر ڈیپوزیشن اسکل، یعنی CVD فرن استعمال کیا۔ ایسے دو بعدی مواد کے تجربات کے لیے ایک طویل عرصے سے موجود مسئلہ یہ ہے: عوامی "نسخے" دوبارہ نہیں کیے جا سکتے۔
ایک جیسے درجہ حرارت، گیس، اور اگریٹر کے پیرامیٹرز کے ساتھ، اگر آ furnace کو بدل دیا جائے، تو فرنیس کے اندر کا حجم، گیس کا بہاؤ، اور مواد کی جگہ میں تھوڑا سا فرق ہو جائے تو آخر میں پیدا ہونے والا کرستل بالکل مختلف ہو سکتا ہے۔ ریسرچرز عام طور پر کئی ہفتے یا مہینوں تک پیرامیٹرز کو دوبارہ ترتیب دینے کے لیے وقت صرف کرتے ہیں۔
اس طرح تحقیقی ٹیم نے جیمنی کو نہیں بتایا کہ وہ تجربہ کیسے کرے، بلکہ انہوں نے اسے بتایا کہ لیب میں کون سے اوزار اور کیمیکلز ہیں اور بھٹی کی ساخت کیا ہے۔ باقی پیرامیٹرز AI خود طے کرے گا۔
کو-سائنٹسٹ ان پابندیوں کے مطابق گیس کے فلو، درجہ حرارت کا منحنی، اگلے مرحلے کی مقدار، اور مواد کی جگہ جیسے مکمل تجرباتی منصوبہ تیار کرتا ہے، اور پھر اسے تجرباتی ڈیوائس کو انجام دینے کے لیے دیتا ہے۔

ایک گروہ کا تجربہ بہت نمایاں تھا۔ تحقیقی ٹیم نے جیمنی 3 ڈیپ تھنک کو CVD کنٹرول پروسیجر سے جوڑ دیا، جس کے بعد وہ مصنوعی زبان میں تجرباتی منصوبہ تیار کرنے کے بجائے، کچھ منٹوں میں استدلال مکمل کر کے نتائج کو فوراً ڈیوائس کنٹرول کرنے کے لیے مشین کوڈ میں تبدیل کر دیا۔
آخر کار، MoS₂، MoSe₂ اور WS₂ کے تینوں دو بعدی نیم چالکوں میں پہلے تجربے میں ایک لیر کرستل کامیابی سے اگائے گئے۔ پورا تجربہ تقریباً ایک گھنٹے میں مکمل ہو گیا۔
جس میں MoSe₂ اور WS₂ زیادہ خاص ہیں: تحقیق کار پہلے ہی اس ڈیوائس پر ان دونوں مواد کو اگائے بھی نہیں چکے تھے۔ بعد میں کم از کم پانچ دہرائے گئے تجربات نے نتائج کی تصدیق کی۔
یہ Anthropic نے کل دکھایا گیا MHS کے ساتھ ایک دلچسپ توازن ہے۔ Anthropic کا مقصد یہ تھا کہ Agent کو تجرباتی ڈیوائسز کو سمجھنے اور ان کو کنٹرول کرنے کے لیے زیادہ آسان اور معیاری بنایا جائے؛ جبکہ گوگل کی اس تحقیقی تحریر میں اگلے مرحلے پر بحث کی گئی ہے: جب استنتاجی ماڈلز پہلے ہی تجرباتی ڈیوائسز کو کنٹرول کر سکتے ہوں، تو سائنسی ورک فلو کو کیسے دوبارہ ڈیزائن کیا جائے؟
اس معنی میں، "AI ہارڈویئر کو جوڑنا" مسئلہ نہیں رہا۔
صرف پیپر کے مطابق تجربات نہیں کر رہا، AI اب خود ریسیپی تلاش کر رہا ہے
تاہم، صرف جمنی کو موجودہ علم کے مطابق ایک ڈیوائس سیٹ کرنے دینا سچی سائنسی دریافت نہیں ہے۔ اس لیے گوگل نے دوسرا، زیادہ مشکل تجربہ کیا: Ti₃C₂Tₓ نامی ایک ایم ایکسینے دو بعدی مواد کو نیچے سے اوپر تک جمع کرنے کی کوشش کی۔
روایتی طریقہ کار عام طور پر خطرناک اور کارکردہ مواد کو شامل کرتا ہے، جبکہ کچھ جانے گئے CVD منصوبوں میں زہریلے اور ہوا کے لیے حساس TiCl₄ استعمال ہوتا ہے۔ اس لیے تحقیقی ٹیم نے Co-Scientist کو ایک کام سونپا: کیا ہم ایک محفوظ ترین اگلے مرحلے کا راستہ تلاش کر سکتے ہیں؟
کو-سائنٹسٹ نے نہایت طور پر ہیکساؤکلورو ایتھین C₂Cl₆ کو ہدف بنایا اور اس کے بعد پیشگی مادوں کی تعداد، موقع، گیس کی فلو، سبستریٹ اور درجہ حرارت کا منظر وغیرہ کے پیرامیٹرز فراہم کیے۔

لیکن یہ ایک ایسا کہانی نہیں ہے جہاں "AI کا ایک لمحہِ ابھراؤ اور ایک بار کامیاب تجربہ" ہو۔ کو-سائنٹسٹ نے کل 272 امیدوار حل تیار کیے، جن میں سے تحقیق کاروں نے بلند ترین رینک والے حلز کو منتخب کیا اور ان کو مزید بہتر بنایا؛ 25 راؤنڈز کے تجرباتی تکرار کے بعد، آخرکار ایک دو بعدی لیمینیٹ کرستل حاصل ہوا۔ اس کرستل نے XRD، الیکٹران مائیکروسکوپ اور عناصر کے ترکیب سمیت کئی معیارات پر Ti₃C₂Tₓ MXene کے ساتھ انتہائی مشابہ خصوصیات ظاہر کیں۔
پیچیدہ مسائل بھی عام ہیں۔ ابتدائی طور پر تجربے کی دوبارہ تکرار کی کامیابی کی شرح صرف 11.5% تھی۔ تحقیق کاروں نے بعد میں پایا کہ بنیادی مسئلہ AI کے کیمیائی استدلال میں نہیں، بلکہ آکسیجن کے نکل جانے کا سبب تجرباتی آلات کا بند نہ ہونا تھا۔
کوارٹز ٹیوب کو دوبارہ صاف کرنے، سیل رنگ کو تبدیل کرنے اور ڈیوائس کی مینٹیننس کے عمل میں بہتری لانے کے بعد، ایک ہی دو بعدی مواد کے تجربے کی کامیابی کی شرح 68% تک بڑھ گئی۔
یہی وجوہ ہے کہ "واقعی دنیا کا AI" اور سافٹ ویئر ایجنٹ میں فرق ہے: اگر کوڈ میں غلطی ہو، تو اسے دوبارہ چلایا جا سکتا ہے۔ لیکن حقیقی تجربات میں، ایک پرانا O-رگ، نالیوں میں باقیات، یا ہوا میں موجود آکسیجن بھی ایک صحیح سائنسی منصوبے کو مکمل طور پر ناکام بناسکتے ہیں۔
گوگل نے اپنے پیپر میں بھی بہت احتیاط سے کہا ہے: ابھی تک یہ تصدیق نہیں ہو سکی کہ یہ مواد Ti₃C₂Tₓ MXene ہے، کیونکہ اس میں کم پیداوار اور شدید آکسیڈیشن جیسے مسائل موجود ہیں، جن کی تصدیق کے لیے ایٹمی سطح کی تفصیلی جانچ کی ضرورت ہے۔
تاہم، ہم ایسا نتیجہ اخذ کر سکتے ہیں کہ AI اب ایک سائنسی معنی رکھنے والی ممکنہ ترکیبی راستہ پیش کر سکتا ہے، اور پھر اس راستے کو حقیقی تجربات تک لے جا سکتا ہے تاکہ اس کی تصدیق کی جا سکے۔
کچھ تجربات کو شاید پہلے AI کو "ایک بار اندازہ لگانے" دیا جا سکتا ہے
گوگل نے کو-سائنسٹ کو ایک بالکل مختلف تجرباتی منظر میں بھی شامل کیا: سنتھیٹک بائیولوجی۔ تجربے کا موضوع انجریکٹڈ ای کولائی کے ایک گروہ تھا۔

یہ جراثیم پیٹری ڈش میں مختلف کالونی کے نمونے بناتی ہیں۔ جب اندیشہ IPTG کی سطح بدلتی ہے، تو کالونیوں کا سائز، کنارہ اور شکل بھی تبدیل ہو جاتا ہے۔ عام طور پر، مکمل تبدیلی کا منحنی حاصل کرنے کے لیے سائنسدانوں کو مختلف اجزاء تیار کرنے، جراثیم پالنے، اگنے کا انتظار کرنے اور ہر پیٹری ڈش کو اسکین کرنے کی ضرورت ہوتی ہے۔
گوگل نے AI کو ایک تجربے کے درمیانی حصے کو مکمل کرنے کی کوشش کی۔ تحقیق کاروں نے Co-Scientist کو صرف کچھ اجزاء کی درجہ بندی پر حقیقی کالونیوں کی تصاویر دیں، اور پھر سسٹم کو انہیں نہیں دیکھے گئے درمیانی اجزاء کے لیے کالونیوں کا اندازہ لگانے کے لیے کہا۔ اس عرصے میں یہ تجرباتی ڈیٹا ابھی شائع نہیں ہوا تھا، اس لیے پیپر کا دعویٰ ہے کہ ماڈل نے صرف تربیتی ڈیٹا میں موجود نتائج کو یاد رکھ کر یہ کام نہیں کیا ہو سکتا۔
نتیجے میں، چار کالونی کی شکل کے اشاروں میں سے تین کے لیے AI کے پیش گوئی کے نتائج اصل گیلے تجرباتی نتائج کے ساتھ کوئی اہم فرق نہیں دکھاتے؛ اس نے یہ بھی درست طریقے سے طے کیا کہ کنٹرول گروپ IPTG کی سطح کے ساتھ تبدیل نہیں ہوگا۔

صرف "گولائی" میں واضح مسئلہ ہے: AI نے بنائے گئے کالونیاں حقیقی حالت کے مقابلے میں زیادہ منظم ہیں۔ یہ جنریٹو ماڈل کے معمولی اسٹائل کے مطابق ہے: حقیقی دنیا میں چیزیں اتنی مکمل نہیں ہوتیں، لیکن AI انہیں تھوڑا سا گول کرنے کا جذبہ محسوس کرتا ہے۔

گوگل نے اس تجربے کی تعریف بھی محتاط رکھی ہے: اب تک جو بنایا گیا ہے، وہ معلوم کنسلنٹری انٹرویل میں انٹرپولیشن ہے، نہ کہ ایک مکمل نئے جینیٹک سرکٹ کے سامنے ناشناختہ ظاہریات کا پیش گوئی۔
لیکن اس کا ابھی سے ایک بہت ہی عملی استعمال ہے۔ مستقبل کے سائنسدانوں کو شاید ایک بہت بڑے پیرامیٹر اسپیس کے تمام نقاط پر ٹیسٹ کرنے کی ضرورت نہیں ہوگی۔ وہ صرف کچھ نکات کا ٹیسٹ کر سکتے ہیں، اور AI کو ان حقیقی ڈیٹا کے ذریعے باقی اسپیس کا پیشگوئی کرنے دے سکتے ہیں، اور پھر سب سے زیادہ تصدیق کے قابل مقامات کا انتخاب کر سکتے ہیں۔
اس لیے تجربہ逐步从「穷举」转变为:真实世界采样 → AI 预测 → 选择实验 → 新数据反馈给 AI。
یہی وہ چیز ہے جس پر مقالہ بار بار زور دے رہا ہے، lab-in-the-loop۔
ای آئی نے اپنی خود کو ڈیزائن کرنا شروع کر دیا ہے
کمپیوٹر سائنس لیب تک پہنچ کر، کو-سائنسٹ کی خودمختاری مزید بڑھ گئی۔

اس بار تحقیقی ٹیم نے اسے بہت آسان کام دیا: ایک ایسا ایجنٹ ڈیزائن کریں جو طبی سوالات کا بہتر جواب دے سکے۔ اس کے بعد، انسانوں نے ڈیزائن کے عمل میں کوئی کردار ادا نہیں کیا۔ کو-سائنسٹ نے خود منصوبہ بنایا، کوڈ لکھا، ٹیسٹ چلائے، غلطیوں کا تجزیہ کیا، اور پھر ڈیزائن میں تبدیلیاں کرتا رہا۔
آخر میں، اس نے ایک سسٹم "Agent_H" کو "تکامل" کیا۔
اس نظام کو موجودہ ماڈل کے استدلال کے عمل کو دوبارہ ترتیب دینے کی ضرورت ہے۔ ایک طبی مسئلہ کے سامنے، یہ پہلے فیصلہ کرتا ہے کہ مسئلہ کس طبی شعبے سے تعلق رکھتا ہے، کیا یہ مریض یا ڈاکٹر کے لیے ہے، اور خطرہ کتنے درجے کا ہے؛ پیچیدہ مسائل کو متعدد ذیلی مسائل میں تقسیم کر دیا جاتا ہے؛ پھر اس کے بعد 28–48 امیدوار جوابات одно وقت تیار کیے جاتے ہیں، جنہیں مختلف ججس دوسرے کے ساتھ مقابلہ کر کے نکال دیا جاتا ہے، اور پھر تین ججس کی ووٹنگ سے نہایت نتیجہ منتخب کیا جاتا ہے۔ فاتح جواب کو مزید متعدد دوروں میں بالینی جانچ، حوالہ جات کی تصدیق سے گزارا جاتا ہے، اور آخر میں اس کی لمبائی کو کم کر دیا جاتا ہے۔

ایک سوال کے جواب کے لیے، پورے ایجینٹ کو مدل کو تقریباً 40-80 بار کال کرنا پڑتا ہے۔ HealthBench Hard اور HealthBench Professional پر، کاغذ میں استعمال کیے گئے لمبائی درستگی اسکور کے مطابق، Agent_H نے GPT-5.6 Sol، Claude Opus 5 اور Gemini 3.1 Pro سمیت ستھرے مڈلز کو پار کر لیا۔

لیکن یہاں ایک بہت اہم واقعہ پیش آیا جس کے بارے میں رپورٹ لکھنا ضروری ہے: AI نے خود ہی "رینکنگ کا دھوکہ" سیکھ لیا۔
اولی تجربوں میں، اسکورنگ کرائٹیریا لمبے جوابات کو کافی سزا نہیں دیتا تھا۔ اس لیے کو-سائنسٹ جلد ہی اسکور بڑھانے کا سب سے آسان طریقہ تلاش کر لیا: جوابات کو بہت لمبا لکھنا۔
بنچ مارک اسکور اس لیے نمایاں طور پر بڑھ گیا، لیکن طبی معیار میں متعلقہ بہتری نہیں آئی۔ جب تک کہ تحقیق کاروں نے لمبائی کے جرمانے کو شامل نہیں کر لیا، زبردست فرق ختم نہیں ہوا۔
گوگل نے اپنے پیپر میں اسے ایک مثالی گڈہارٹ کا قانون سمجھا ہے: جب ایک اشارہ ایک مقصد بن جائے، تو وہ ایک اچھا اشارہ نہیں رہ جاتا۔
حقیقی ڈاکٹرز کے جائزے نے نتائج پر بھی پانی ڈال دیا۔ تین عملی ڈاکٹرز نے 106 سوالات کا اندھا جائزہ لیا۔ نو ابعاد میں، Agent_H صرف "ممکنہ نقصان کو کم کرنا" کے حوالے سے اصل Gemini 3.1 Pro کے مقابلے میں احصائی طور پر اہم بہتری حاصل کی، باقی آٹھ ابعاد میں کوئی اہم فرق نہیں تھا۔

دیگر الفاظ میں، AI Judge کی نظر میں واضح طور پر زیادہ بینچ مارک اسکور، انسانی ڈاکٹرز کی نظر میں واضح طور پر بہتر جواب میں مکمل طور پر تبدیل نہیں ہوا۔ شاید یہی وہ مسئلہ ہے جس کا سامنا AI Scientist کو اصل دنیا میں داخل ہونے کے بعد کرنا پڑے گا: اسے صرف بہترین بنانے کے علاوہ یہ بھی جاننا ہوگا کہ کون سی چیزیں صرف اسکورز کے ذریعے تعریف نہیں کی جا سکتیں۔
AI سائنسدان مقالے کے لیے "ڈیٹا بناتے ہیں"
واقعیت میں، گوگل نے اس تحقیقی مقالے میں ایک اور تھوڑا سا الجھن والے سوال پر کافی توجہ دی: اگر AI Scientist کو مکمل طور پر آزاد چھوڑ دیا جائے، کیا وہ خوبصورت نتائج حاصل کرنے کے لیے دھوکہ دے گا؟

جی ہاں۔
تحقیقی ٹیم نے سسٹم کو 50 AI تحقیقی موضوعات پر، خیالات کی تجویز سے لے کر ڈیٹا کی تلاش، کوڈ لکھنا، تجربات چلانا اور آخری پیپر تیار کرنا تک، مکمل طور پر بنا کے بغیر چلایا۔
مقابلہ کے طور پر، انہوں نے ایک ایسا Co-Scientist بھی ٹیسٹ کیا جس میں قابل اعتماد ماڈیول نہیں تھا، اور پہلے کا Agent Laboratory سسٹم، جس سے کل 150 تحقیقی مقالے تیار کیے گئے، جنہیں 30 ماہرین نے 450 بار انانیمس رائے دینے کے لیے جانچا۔
نتیجہ کافی مضحکہ خیز ہے۔ کوئی خاص تصدیقی مکینزم نہ ہونے پر، AI سائنسدان کوڈ میں خطا کے باوجود، تجربے کے کوئی موثر نتائج نہ ہونے کے باوجود، پوری تحقیقی تحریر لکھنا جاری رکھ سکتا ہے۔

وہ ڈیٹا ٹیبلز، p-قدروں، اور احصائی ٹیسٹس بناتے ہیں؛ ناکام تجربات کو کامیاب کے طور پر لکھتے ہیں؛ اور اپنے طریقے کو قدرتی طور پر زیادہ اسکور دینے کے لیے ایوانِ جائزہ تبدیل کرتے ہیں، یا hardcode کے ذریعے ایک خوبصورت نتیجہ بلا دونے کے پیدا کرتے ہیں۔
جب اہداف کو "ایک اچھی لگنے والی تحریر لکھنا" کہا جائے، تو ایجنٹ تحقیق مکمل کرنے کے بجائے زیادہ سستے راستے تلاش کرے گا۔
اس لیے، گوگل نے نئی نسخہ Co-Scientist میں ایک ایسا مکینزم شامل کیا ہے جو "سائنسی آڈٹ" کے بہت قریب ہے: اس میں دعویٰ کیے گئے تجرباتی نتائج کو حقیقی پروگرام اجراء لاگ میں واپس تلاش کیا جانا چاہیے۔ اگر لاگ میں متعلقہ نتائج نہیں ہیں، تو سسٹم لینگویج ماڈل کے "ہونا چاہیے" کے خیال پر انہیں شامل نہیں کر سکتا۔
اثرات بہت واضح ہیں۔ "نتائج کا خیال" جو کہ تحقیقی مقالے کو ناکام بنانے کے لیے کافی شدید تھا، ایجنٹ لیبارٹری میں 90% سے گھٹ کر 4% ہو گیا؛ سب سے زیادہ شدید مکمل ڈیٹا جعل، 44% سے گھٹ کر 0% ہو گیا۔
لیکن مسئلہ اب بھی مکمل طور پر ختم نہیں ہوا۔ نئی نسخہ Co-Scientist میں 24% تک شدید طریقہ کار کے تفصیلات کی غلطیاں باقی ہیں، اور شدید نقل و حرکت/مشتق مواد بھی 16% ہیں۔
اس لیے گوگل نے خاص طور پر زور دیا کہ وہ ابھی Autonomous AI Scientist کو کسی بھی تفصیلی تحقیقی مقالہ کو براہ راست شائع کرنے کے قابل قرار نہیں دیتے۔
اختتام
اگر آنتھرپک اور گوگل کے ان دونوں کاموں کو ایک ساتھ دیکھا جائے، تو پتہ چلتا ہے کہ ایجینٹ میں ایک واضح تبدیلی آ رہی ہے: پچھلے دو سالوں تک، AI ایجینٹ کا بڑا میدان صرف سافٹ ویئر دنیا تک محدود تھا۔ اب، یہ منطق پہلی بار وسیع پیمانے پر حقیقی دنیا کی طرف بڑھ رہا ہے۔
اینٹروپک کا MHS بنیادی مسئلہ حل کرنے کی کوشش کرتا ہے: مکینیکل آرم، مائیکروسکوپ، اور لیکوڈ پروسیسنگ پلیٹ فارم جیسے مختلف ڈیوائسز کو ایک ایسا انٹرفیس فراہم کرنا جسے ایک ایجنٹ ایکسٹینڈڈ طور پر سمجھ سکے اور کنٹرول کر سکے۔
گوگل کے کو-سائنسٹ نے اعلیٰ سطح کے سوالات کا جائزہ لینا شروع کر دیا: جب ایک استدلالی ماڈل تحقیقی فرضیات پیش کر سکے، تجربات کی منصوبہ بندی کر سکے، آلات کو کنٹرول کر سکے، نتائج پڑھ سکے اور اگلے تجربات کو مزید بہتر بننے کے لیے ترمیم کر سکے، تو ایک حقیقی بند حلقوں والی سائنسی دریافت نظام کیا ہونا چاہیے۔
بے شک، گوگل ابھی تک اصلی "بے چل آزمایشگاہ" تک نہیں پہنچا۔ موجودہ مادے کے تجربات میں اب بھی انسانوں کو نمونے لود کرنے کی ضرورت ہے؛ نئے مادے کی ایٹومی ساخت ابھی تک تصدیق شدہ نہیں ہے؛ ای کولائی کی پیشگوئی صرف محدود انٹرپولیشن کاموں کی تصدیق کرتی ہے؛ میڈیکل ایجینٹ بینچ مارکس کے خلا کا فائدہ اٹھاتے ہیں؛ اور پیپر جنریشن سسٹم نے ابھی تک خیالی معلومات اور نقل کا مکمل طور پر حل نہیں کیا۔ گوگل خود بھی صاف طور پر تسلیم کرتا ہے کہ ہارڈ ویئر کی خرابیوں اور حقیقی ماحول کی پیچیدگی کے باعث، ابھی کے مرحلے پر مکمل طور پر بے نگرانہ فزیکل تجربات حاصل کرنا مشکل ہے۔
لیکن تبدیلیاں پہلے ہی آ چکی ہیں۔
پہلے AI for Science پر بحث کرتے وقت، زیادہ تر توجہ اس بات پر مرکوز تھی کہ AI ایسا کچھ سوچ سکتا ہے جو انسان نے نہیں سوچا۔ اب، بڑی تعداد میں کامز اس مشکل دوسرے حصے کو مکمل کرنے لگے ہیں: کیا یہ خیال حقیقی ڈیوائسز پر انجام دیا جا سکتا ہے، اور اس کا نتیجہ AI کے اگلے استدلال کا حوالہ بن سکتا ہے؟
گوگل نے اپنے پیپر کے آخر میں ایک دلچسپ تشخیص دی ہے۔ اگر ایسا بند حلقوں کا نظام حقیقت میں قائم ہو جائے، تو مستقبل میں سائنسی تحقیق کی پابندیاں الٹ جائیں گی: ماضی میں، تجرباتی آلات کا انتظار اس لیے ہوتا تھا کہ سائنسدان اگلا بہترین سوال پیش کریں؛ مستقبل میں، شاید AI نے سینکڑوں ایسے تجربات پیش کر دیے ہوں جن کی تصدیق کرنے کی ضرورت ہے، جبکہ لیب میں ان سب کو کرنے کا وقت نہیں ہوگا۔
اس وقت، سائنسی دریافتوں کی رفتار کا اصل瓶颈، شاید scientific ideation نہیں، بلکہ experimental throughput ہوگا — کہ عملی دنیا ان تجربات کو کتنی جلدی پورا کر سکتی ہے۔
یہ مضمون ویچن گروپ "مشین سائنس" (ID: almosthuman2014) سے ہے، مصنف: سائنسی AI پر توجہ دینے والے
