گوگل ریسرچ نے 30 جولائی 2026 کو سائنس ون فریم ورک کا اعلان کیا، جس کا مرکزی حصہ "شواہد کا سلسلہ" (Chain-of-Evidence, CoE) نامی مکینزم ہے، جو AI کے سائنسی تحقیق کے ہر نتیجہ کو حوالہ، کوڈ اور تجرباتی ریکارڈ سے جوڑنے کا مطالبہ کرتا ہے۔مضمون کے مصنف، ذریعہ: 0x9999in1، ME News

TL;DR
- گوگل ریسرچ نے 30 جولائی 2026 کو سائنس ون فریم ورک کا اعلان کیا، جس کا مرکزی حصہ "شواہد کا سلسلہ" (Chain-of-Evidence, CoE) نامی مکینزم ہے، جو AI کے سائنسی تحقیق کے ہر نتیجہ کو حوالہ، کوڈ اور تجرباتی ریکارڈ سے جوڑنے کا مطالبہ کرتا ہے۔
- موجودہ AI سائنسی نظام کے قدیم مسائل بہت گہرے ہیں: حوالہ جات کا جعلی بنانا، ناپید نتائج، اور طریقہ کار کی تفصیلات اور کوڈ میں عدم مطابقت۔ بنیادی نظام میں خیالی حوالہ جات کی شرح انتہائی 21% تک پہنچ سکتی ہے، جبکہ نتائج کی دوبارہ حاصل کرنے کی صلاحیت صرف 42% تک ہے۔
- Science One کا اثبات یہ ہے: صفر افسانہ والے حوالے، تمام اسکورز کی تصدیق درست، اور طریقہ کار اور کوڈ کے درمیان مطابقت کا سب سے اعلیٰ تناسب۔ اس کے مطابق، اس نے 337 حوالے مکمل طور پر درست پیش کیے، 12 قابل دوہرائی تجربات سب درست ہوئے، اور 15 تحقیقی مقالوں میں سے 14 کوڈ کے ساتھ مطابقت رکھتے ہیں۔
- اہم ڈیزائن "بعد میں حوالہ جات شامل کرنا" کے بجائے "بناتے ہوئے取证 کرنا" ہے۔ حوالہ جات ماڈل کی یادداشت سے نہیں، بلکہ Semantic Scholar API سے حقیقی تلاش سے آتے ہیں۔
- اہم فیصلہ: سائنس ون نے "ایمانداری" کے لیے "کارآمدی" کا قربان نہیں دیا۔ اس نے MLE-Bench پر 2 سونے اور 2 چاندی کے تمغے حاصل کیے اور Parameter-Golf پر اس وقت کا بہترین نتیجہ حاصل کیا۔
- اس بات کا اصل مطلب یہ نہیں کہ ایک اور AI تحریر لکھ سکتا ہے، بلکہ یہ ہے کہ اس نے پہلی بار "قابل تصدیق" کو ڈھانچے کی بنیاد بنایا، نہ کہ بعد میں اضافہ۔
ایک دل کو چھو لینے والی سوال: کیا آپ AI کی تحریر کردہ تحقیقی مقالے پر اعتماد کریں گے؟
پچھلے دو سالوں میں AI ریسرچ سسٹم نے حیرت انگیز ترقی کی ہے۔
یہ مقالوں کو پڑھ سکتا ہے۔ فرضیات پیش کر سکتا ہے۔ تجربات چلا سکتا ہے۔ ایک مکمل ساخت اور پیشہ ورانہ انداز کے ساتھ ایک مکمل تحقیقی مقالہ لکھ سکتا ہے۔ آپ ایک نظر میں دیکھیں، کوئی خامی نہیں نکلے گی۔
لیکن مسئلہ اس "ایک نظر دیکھنے" میں چھپا ہوا ہے۔
ایک نظر دیکھنا تو ٹھیک ہے، لیکن اسے گہرائی سے جانچنا؟
گوگل ریسرچ نے اس بات کی گہرائی تک جانچ کی۔ انہوں نے پانچ مقبول آٹومیٹڈ سائنسی سسٹمز کو نکال کر، پانچ سسٹم آپٹیمائزیشن ٹاسکس پر کل 75 پیپرز تیار کیے، اور ہر ایک کو سوال کیا: آپ نے جس مقالے کا حوالہ دیا ہے، کیا وہ حقیقت میں موجود ہے؟ آپ نے جو اسکور دیا ہے، کیا کوڈ دوبارہ رن کرنے پر وہی نتیجہ آتا ہے؟ آپ کہتے ہیں کہ آپ نے کسی الگورتھم کا استعمال کیا، کیا کوڈ میں اس طرح لکھا گیا ہے؟
نتیجہ اچھا نہیں لگ رہا۔
ہر بنیادی نظام کم از کم ایک نظاماتی غلطی کرتا ہے۔ وہمی حوالہ جات کی شرح 21% تک پہنچ سکتی ہے — یعنی ہر پانچ حوالوں میں سے ایک بالکل غیر موجود تحقیقی مقالے کی طرف اشارہ کر سکتا ہے۔ اسکور کی تصدیق کی قبولیت کی شرح صرف 42% تک ہے۔ طریقہ اور کوڈ کی مطابقت 20% سے 80% کے درمیان متغیر ہے۔
اس 42% کو دیکھیں۔ نصف سے زیادہ کاغذات میں درج کردہ نتائج کو کوڈ دوبارہ چلانے پر دوبارہ حاصل نہیں کیا جا سکتا۔
یہ ایک چھوٹی سی خرابی نہیں ہے۔ یہ اعتماد کا تباہ ہونا ہے۔
کیونکہ تحقیق کا بنیادی منطق "قابل دوہرائی" اور "قابل راستہ یابی" ہے۔ ایک تحقیقی مقالے کی قیمت اس بات پر منحصر نہیں کہ وہ کتنی آسانی سے پڑھا جائے، بلکہ اس بات پر منحصر ہے کہ کوئی اور اس کے حوالہ جات، اس کے کوڈ، اور اس کے ڈیٹا کے ذریعے ایک ایک کر کے واپس آ سکتا ہے اور یہ تصدیق کر سکتا ہے کہ اس نے جھوٹ نہیں بولا۔ AI نے مقالوں کی "ظاہری معیار" کو بڑھا دیا، لیکن سب سے بنیادی ستون کو ختم کر دیا۔
جس قدر سطحی نظر آئے، اُتنے ہی مسائل پوشیدہ ہوتے ہیں۔ یہی سب سے خطرناک جگہ ہے۔
گوگل کا جواب: اعتماد کی بجائے چین کے ذریعے
سائنس ون کا خیال، سادہ الفاظ میں، بہت سادہ ہے۔
چونکہ آپ AI کو خودبخود ایماندار ہونے پر بھروسہ نہیں کر سکتے، اس لیے اس پر خودبخود کام کرنے کی امید نہ کریں۔ اس پر زنجیریں ڈال دیں۔
یہ زنجیر، "سندوں کی زنجیر" (Chain-of-Evidence) ہے۔
گوگل نے اس کے لیے ایک بہت درست تشبیہ دی: ڈیٹا بیس کے شعبے میں ایک تصور ہے جسے ACID کہتے ہیں، جو آپ کے ڈیٹا بیس کو کیسے بنائیں اس سے کوئی فرق نہیں پڑتا، صرف یہ طے کرتا ہے کہ ایک ٹرانزیکشن کو "قابلِ اعتماد" بنانے کے لیے کن خصوصیات کو پورا کرنا ہوگا۔ اثبات کا سلسلہ بھی اسی طرح ہے۔ یہ آپ کو یہ نہیں بتاتا کہ آپ ایک سائنسی ایجنٹ کو کیسے بنائیں، بلکہ صرف یہ طے کرتا ہے: آپ جو بھی پیدا کریں، اسے قابلِ اعتماد بنانے کے لیے کیا ضروری ہے۔
ایک اصول، دو نصف۔
پہلا نصف مکملیت کہلاتا ہے: تحقیقی مقالے میں ہر دعویٰ — چاہے وہ ایک حوالہ، ایک عدد، ایک طریقہ کار کی وضاحت ہو یا ایک نتیجہ — کو ضرور ایک دستاویز شدہ ثبوت کی سلسلہ سے جوڑا جانا چاہئے۔
دوسرا نصف درستگی کہلاتا ہے: اس چین کو اس پر لٹکائی گئی بات کو برقرار رکھنا چاہیے۔
سادہ الفاظ میں: آپ جو بھی کہیں، اس کا حوالہ ہونا چاہیے؛ اور یہ حوالہ اصل میں آپ کے الفاظ کو ثابت کر سکے۔
تو اسے کیسے عمل میں لایا جائے؟ کلیدی بات وقت ہے۔
موجودہ نظام کیسے کام کرتا ہے؟ پہلے پورا مقالہ لکھ دیا جاتا ہے، پھر واپس جا کر حوالہ جات اور ثبوت شامل کیے جاتے ہیں۔ اس کا مطلب یہ ہے کہ پہلے ایک کہانی تخلیق کر لی جاتی ہے، اور پھر اسے سچ ثابت کرنے کے لیے ثبوت تلاش کیے جاتے ہیں۔ جہاں ثبوت نہ مل سکیں، وہاں صرف افواہیں ڈال دی جاتی ہیں۔ یہی تو جھوٹے حوالہ جات کا سبب ہیں۔
سائنس ون اس کا اُلٹا ہے۔ اس نے "اس جملے کو تخلیق کرنے کے لمحے" میں ہی ثبوت کا سلسلہ تیار کر دیا۔ دعوے اور ثبوت ایک ساتھ اُگتے ہیں، بعد میں سلائی نہیں جاتے۔
اس ترتیب کے تبدیل ہونے سے پورے معاملے کی روح بنتی ہے۔
الگ الگ دیکھیں: تین ماڈیول، ہر ایک ایک جھوٹ کا ایک حصہ سنبھالتا ہے
سائنس ون کی ساخت تین حصوں پر مشتمل ہے، جن میں سے ہر ایک جھوٹ کے ایک ممکنہ طریقے کو درست طور پر روکتا ہے۔
پہلا بلاک، مسئلہ تحقیق کنندہ، حوالہ جات کی جعلسازی پر نظر رکھتا ہے۔
یہ ماڈل کی "یادداشت" کے ذریعے حوالہ جات نہیں دیتا۔ ماڈل کی یادداشت خیالی مفہوم کا باعث ہے — یہ ایک ایسی تحقیقی مقالہ کو "یاد" کر سکتی ہے جو حقیقت میں موجود نہیں ہے۔ Science One براہ راست Semantic Scholar API سے جُڑتا ہے تاکہ اصل حوالہ جات کا گراف بنائے، جس میں ہر موضوع کے لیے زیادہ سے زیادہ 100 پورے مقالوں کے PDF پڑھے جاتے ہیں اور ایک ساختیاتی تحقیقی خلاصہ تیار کیا جاتا ہے۔ آخری مقالے میں موجود ہر حوالہ اس اصل API تلاش سے ماخوذ ہے، جس سے ماڈل کی یادداشت پر مکمل طور پر انحصار ختم ہو جاتا ہے۔
حوالہ جات "سوچ کر" نہیں، بلکہ "چیک کر کر" نکالے جاتے ہیں۔ اس کاٹ کے ساتھ، جعلی حوالہ جات کی جڑ کٹ گئی۔
دوسرا بلوک، دریافت ماشین، جو تجرباتی ریکارڈ کے جعلسازی کا انتظام کرتا ہے۔
یہ متوازی "کھوج—استعمال" حکمت عملی کا استعمال کرتا ہے، جس میں متعدد شاخوں پر ایک ساتھ حل کی کوشش کی جاتی ہے۔ ہر ایک راؤنڈ میں، ایک سولور منصوبہ لاگو کرتا ہے، اور ایک خصوصی ایوان اسے درجہ دیتا ہے۔ اچھی کارکردگی والی شاخوں کو دوبارہ ترقی دی جاتی ہے، جبکہ تمام اصل ایوان کے نتائج کو ایک سخت، صرف پڑھنے کے قابل ریکارڈ میں شامل کر دیا جاتا ہے۔
صرف پڑھنے کے لیے۔ یہ دو الفاظ بہت اہم ہیں۔ اصل نمبر ایک بار ریکارڈ ہو جانے کے بعد تبدیل نہیں کیے جا سکتے۔ بعد میں تقریر لکھتے وقت زیادہ اچھا نمبر درج کرنا چاہتے ہیں؟ معذرت، یہاں کتاب ہے، تبدیل نہیں کیا جا سکتا۔
تیسری بلوک، تحریرکار اور دعوؤں کی تصدیق کرنے والے، جو طریقہ کار اور کوڈ میں عدم مطابقت پر نظر رکھتے ہیں۔
اس سے پہلے کہ مقالہ حقیقی طور پر تیار کیا جائے، یہ ہر فیکٹوئل دعوے کو سٹرکچرڈ کرتا ہے، ہر جملے کو ایک ان لائن اثبات لیبل سے نشان زد کرتا ہے جو ورک اسپیس میں کسی خاص پیداوار سے منسلک ہوتا ہے۔ پھر ایک مخصوص چیکر، ہر دعوے کو اس کا دعویٰ کردہ ذریعہ سے موازنہ کرتا ہے۔
اگر مطابقت نہیں ہو رہی تو؟ یہاں ایک خاص طور پر چالاک تفصیل ہے۔ یہ صرف اور صرف حذف نہیں کرتا، بلکہ "واپس کھینچ لیتا ہے" — بات کو تھوڑی سی محتاط بناتا ہے، تاکہ وہ دلائل کے دائرے میں واپس آ جائے۔ جہاں تک دلائل سامنے آ سکتے ہیں، وہی تک بات کی جائے۔
بلا جھوٹ، اور زیادہ سے زیادہ برباد نہ کرنا۔ یہ توازن، ایک ہی طرح کے حل سے زیادہ عمدہ ہے۔
ریکارڈ: ایمانداری کی قیمت، کیا یہ اندھا ہو گیا؟
یہاں تک، ایک تیز سوال ابھرنا چاہیے۔
AI کو اتنی زیادہ قیدیں ڈال دی جائیں کہ وہ ہر جملے کے لیے ثبوت تلاش کرنے کے لیے ڈرے ہوئے رہے، کیا اس کا مطلب یہ ہے کہ وہ بڑی باتیں کرنے سے ڈر جائے گا؟ کیا "ایمانداری" کے نام پر "صلاحیت" کو قربان کر دیا جا رہا ہے؟
یہ فکر بہت منطقی ہے۔ یہ تمام "سیکورٹی" اور "کابیلیت" کا کلاسیکی تنازعہ ہے۔
سائنس ون کا جواب ہے: نہیں۔
سب سے پہلے ایمانداری کے کالم کو دیکھیں۔ ایک ہی آڈٹ پروٹوکول کے تحت — جسے گوگل CoE آڈٹ کہتا ہے، ایک فورنسک جیسا خودکار جانچنے والا — ہر حوالہ کو ریل ٹائم اکیڈمک ڈیٹا بیس میں دوبارہ چیک کیا جاتا ہے — Science One چار انٹیگرٹی چیکس میں سب سے آگے ہے۔ اس کے حوالے میں کوئی خیالی حوالہ نہیں، ہر حوالہ ایک حقیقی، قابل رسائی تحقیقی مقالے کی طرف اشارہ کرتا ہے؛ اس کا اسکور ویریفکیشن مکمل ہے؛ اور طریقہ کار اور کوڈ کا تطابق سب سے زیادہ ہے۔ افشا کردہ ڈیٹا کے مطابق، اس نے 337 حوالے مکمل طور پر حقیقی بنائے، 12 قابل دوہرائی تجربات کے نتائج سب مطابق ہوئے، اور 15 مقالوں میں سے 14 مقالے اصل کوڈ کے ساتھ مطابقت رکھتے ہیں۔
بنیادی سیٹ میں موجود "مکسڈ نیورل سمبولک سولورز" جیسے ناموں کا موازنہ کریں — یہ نامزدہ اعلیٰ لگتے ہیں، لیکن کوڈ کھولتے ہی آپ دیکھیں گے کہ یہ صرف ایک سادہ ڈیٹرمنسٹک ہیورسٹک قاعدہ ہے۔ نام لوگوں کے لیے ہوتے ہیں، کوڈ ہی حقیقت ہوتا ہے۔
دوبارہ صلاحیت کے حصے کو دیکھیں۔
ADRS بینچ مارک کے پانچ کاموں پر، Science One نے انسانی ماہرین کے سطح کو برابر یا عبور کر لیا، جن میں دو (Cloudcast اور EPLB) نے تمام سسٹمز میں بہترین نتائج حاصل کیے۔
اس دائرے سے باہر، اس نے اور بھی مشکل باہری چیلنجز کو چیلنج کیا۔ MLE-Bench میں پانچ سخت Kaggle مقابلے، جن میں طبی تصویر، باریکی والی شناخت، اور 3D احساس شامل ہیں، اس نے دو سونے کے تمغے اور دو چاندی کے تمغے حاصل کیے—جس میں 3D ہدف کی تشخیص والے مقابلے میں، دوسرے سسٹم مکمل طور پر ناکام رہے، جبکہ اس نے چیمپئن شپ کے سطح کا اسکور حاصل کیا۔ Parameter-Golf نامی اس مقابلے میں، جہاں ہارڈویئر اور فائل کا سائز سختی سے محدود ہے، دوسرے سسٹم نے کوئی بھی موثر سبسکشن نہیں دی، جبکہ اس نے تمام پابندیوں کو برقرار رکھا اور 27 اپریل، 2026 تک کا بہترین نتیجہ حاصل کیا۔ اور یہ صرف ہائپرپیرامیٹرز کو ٹیون کرکے نہیں، بلکہ حقیقی طور پر نئے الگورتھمک ٹرکس دریافت کرکے حاصل کیا گیا۔
تو جواب واضح ہے: ایمانداری، اسے بے وقوف نہ بنائیں۔
یہی وہ بات ہے جس پر میں سب سے زیادہ زور دیتا ہوں۔ اگر سائنس ون صرف "ڈر کے باعث" صاف ہو، تو اس کی کوئی قیمت نہیں — کیونکہ کوئی بھی ایک ایسا سائنسی ٹول استعمال نہیں کرے گا جو ایک دم بیوقوف اور ایماندار ہو۔ لیکن یہ ثابت ہوتا ہے کہ قابل تصدیق اور اعلیٰ کارکردگی دونوں ایک ساتھ حاصل کی جا سکتی ہیں۔ اس سے "ایمانداری کو ایک سخت پابندی بنانا" صرف اخلاقی تجویز نہیں رہا، بلکہ انجینئرنگ کے لحاظ سے ایک منافع بخش انتخاب بن گیا۔
میرا جائزہ: یہ اہم ہے، لیکن اسے فوراً مقدس نہ بنائیں
بہت ساری اچھی باتیں کہہ دی گئیں، اب دو پانی کے برتن ڈال دیں۔
پہلا پوٹ: گوگل خود آخر میں واضح طور پر لکھتا ہے کہ Science One ایک تجرباتی تحقیقی پروٹو ٹائپ ہے، جو براہ راست پیداواری ماحول میں استعمال کے لیے نہیں ہے۔
یہ عاجزی نہیں، بلکہ سرحد ہے۔ اس نے جن پانچ کاموں کو انجام دیا، وہ نظام کے بہترین بنانے جیسے "واضح ایوان، آٹومیٹک اسکورنگ والے" شعبوں میں ہیں۔ دوسرے الفاظ میں، اچھا یا برا، مشین کے ذریعے انتہائی طور پر طے کیا جا سکتا ہے۔ لیکن اصل سرحدی تحقیق کیا ہے؟ بہت سے فرضیات کی قیمت، بہت سے نتائج کا معنی، مختصر مدت میں کوئی ایوان نہیں ہوتا جو آپ کو اسکور دے سکے۔ ثبوت کا سلسلہ "جھوٹے حوالہ جات" کو روک سکتا ہے، لیکن "ایک عام مسئلہ منتخب کرنا" روک نہیں سکتا۔ یہ ایمانداری کو چلاتا ہے، لیکن ذائقہ نہیں۔
دوسرا برتن: ثبوت کی سلسلہ بھی لاگت رکھتی ہے۔ ہر موضوع پر 100 پی ڈی ایف پڑھنا، ہر جملے کے لیے ثبوت بنانا، لیبل لگانا، اور دوبارہ جانچنا — یہ عمل مہنگا ہے۔ یہ حقیقت کی تلاش کے ساتھ ساتھ کمپیوٹنگ طاقت اور وقت کا استعمال کرتا ہے۔ جب اسے بڑے پیمانے پر لاگو کیا جائے، تو اس کا خرچ کیسے کیا جائے، اب تک کوئی جواب نہیں ہے۔
لیکن ان دو بکٹوں کا پانی بہا دینے کے باوجود، میں اب بھی سمجھتا ہوں کہ یہ ایک کم تقویم والا کام ہے۔
کیوں؟
کیونکہ اس نے سوال پوچھنے کا انداز بدل دیا ہے۔
گزشتہ دو سالوں میں، سب نے پوچھا: کیا AI سائنسی تحقیق کر سکتا ہے؟ اس کی صلاحیت کتنی زیادہ ہو سکتی ہے؟ لوگوں کا مقابلہ مسائل حل کرنے کی صلاحیت اور ٹاپ پر چڑھنے کے اسکور سے ہوا۔ Science One نے ایک دوسرے ابعاد کا سوال پیش کیا ہے: AI کی تخلیق کردہ تحقیق پر بھروسہ کیا جا سکتا ہے؟
یہ دو سوالات ایک ہی ریس کے میدان میں نہیں ہیں۔
جب زیادہ سے زیادہ سسٹم خوبصورت حل پیش کرنے لگیں، تو مسئلہ حل کرنے کی صلاحیت ایک تمیز کا عنصر نہیں رہے گی۔ اس وقت، ان کے درمیان فرق صرف اس بات سے ہوگا کہ ان کے پیداوار پر بھروسہ کیا جا سکتا ہے یا نہیں۔ گوگل نے "قابل تصدیق" کو "ایک درجہ کا شہری" قرار دے دیا ہے اور کہا ہے کہ یہ ایک آرکیٹیکچرل پابندی ہونی چاہئے، نہ کہ بعد میں اصلاح کا معاملہ — میرے خیال میں یہ فیصلہ درست ہے اور اس کا وقت بھی بالکل مناسب ہے۔
کیونکہ اعتماد کو جمع کرنا بہت سست ہوتا ہے، لیکن اس کا گرنا بہت تیز۔ اگر AI تحقیق کے ابتدائی مراحل میں ایک سیٹ نظر آنے والی، لیکن حقیقت میں خراب اور کمزور تحریروں کے ذریعے مکمل اکادمیک برادری کا اعتماد خرچ کر دیا جائے، تو بعد میں اسے واپس حاصل کرنے کا اخراج بے حد زیادہ ہوگا۔ Science One کی کوشش یہ ہے کہ اعتماد گرنے سے پہلے ہی اس کی بنیاد میں لوہے کی چھڑیاں مضبوط کر دی جائیں۔
اختتام
اصل سوال پر واپس آتے ہیں: کیا آپ کو یقین ہے کہ AI نے یہ تحریر کی ہے؟
Science One سے پہلے، ایماندار جواب یہ ہے — کم سے کم۔ جتنا بہتر لکھا جائے، اتنا ہی زیادہ احتیاط کرنا چاہیے۔
سائنس ون نے AI کو زیادہ ذکی نہیں بنایا۔ اس نے ایک اور، زیادہ سادہ لیکن زیادہ مشکل کام کیا: AI کو اپنی ہر بات کے لیے جانچنے کے قابل ثبوت چھوڑنے کے لیے سکھایا۔
بہت سے ایسے AI ہیں جو ذکی ہیں۔
خود کے لیے ذمہ داری لینے والی AI ابھی شروع ہوئی ہے۔
یہ ایک چھوٹا قدم ہے، ایک پروٹو ٹائپ ہے، اور ابھی بھی بہت سے حل نہ ہوئے مسائل ہیں۔ لیکن راستہ درست ہے۔ کبھی کبھی، کسی چیز کی اصل اہمیت اس بات میں نہیں ہوتی کہ وہ ابھی کتنی تیز چل رہی ہے، بلکہ اس بات میں ہوتی ہے کہ وہ کس جگہ پر معیار قائم کر رہی ہے۔
سائنس ون نے معیار کو "کیا اسے اچھی طرح لکھا گیا ہے" سے "کیا یہ جانچ کا مقابلہ کر سکتا ہے" پر منتقل کر دیا ہے۔
اس انتقال کی قیمت ادا کرنے کے لائق ہے۔
حوالہ جات
- گوگل ریسرچ بلاگ۔《سائنس ون فریم ورک: چین آف ایوڈینس کے ذریعے ایک قابل تصدیق خودمختار تحقیقی فریم ورک》,2026ء کی 30 جولائی۔
- گوگل کلاؤڈ AI تحقیق۔ arXiv:2605.26340 «سائنس ون فریم ورک / چین آف ایویدنس» پیپر۔
- AlphaSignal. گوگل کا سائنس ون فریم ورک AI تحقیق کے جعلی حوالہ جات کے بحران کو حل کرتا ہے، 2026ء جولائی۔
- Zhiding Network. "Science One فریم ورک: ثبوت کی زنجیر پر مبنی قابل تصدیق خود مختار سائنسی نظام"، 31 جولائی 2026۔
- سکانا AI۔ arXiv:2504.08066 《The AI Scientist v2》 (بنیادی نقطہ نظر کے ساتھ موازنہ)۔
- OpenAI. GitHub پروجیکٹ "Parameter-Golf" بینچ مارک۔
- arXiv:2410.07095 میں MLE-Bench بینچ مارک پیپر۔
- arXiv:2510.06189 مکمل تحقیقی نظاموں کے ڈیزائن (ADRS) بینچ مارک۔
