مصنف: Robonaissance
ترجمہ: شن چاؤ ٹیک فلو
شین چاؤ کا خلاصہ: گو، شطرنج، پروٹین طیارہ سازی — ان مسائل جن میں انسانی جذبات اور تخلیقی صلاحیت کی ضرورت ہوتی ہے، کیوں ایک کے بعد ایک AI نے ان پر قبضہ کر لیا؟ یہ مضمون ایک نظرانداز کیے جانے والے قانون کو ظاہر کرتا ہے: AI کی انسانوں سے آگے نکلنے کا فیصلہ نہ تو مسئلے کی پیچیدگی سے ہوتا ہے، بلکہ کامیابی کو اسکور دینے کی صلاحیت سے ہوتا ہے۔ جب کسی شعبے میں اسکورنگ معیار قائم ہو جاتا ہے، تو وہ اپنے خاتمے کے لیے گنتی شروع کر دیتا ہے۔
جس کے لیے مشین ہم کی جگہ نہیں لے سکتی، وہ واحد کام — جو کہ "Whatever You Ask For" سیریز سے چننا گیا ہے۔
One ten-thousandth
10 مارچ 2016 کو، سیول میں ایک ہوٹل میں، ایک مشین نے ایک ایسا چال چل دیا جسے کمرے میں موجود تمام لوگ نہیں سمجھ سکے، جبکہ اس کا مقابلہ کرنے والا وقت پر موجود نہیں تھا۔
لی شیشی سگریٹ پینے کے لیے باہر نکل گئے۔ وہ اس وقت 33 سال کے تھے، جنہوں نے 18 عالمی چیمپئن شپس جیتی تھیں اور انہیں اپنی نسل کے سب سے بہترین گو کھلاڑی کے طور پر جانا جاتا تھا۔ انہوں نے پچھلے دن پہلے میچ میں شکست کھائی تھی، اور دوسرے میچ کے لیے داخل ہوتے وقت ان کی ابتدائی خود اعتمادی کم ہو چکی تھی، اور وہ زیادہ س осторожні تھے۔ جب وہ باہر تھے، تو AlphaGo نے 37ویں حرکت کا انتخاب کیا، اور DeepMind کے ریسرچر ہوانگ شیجیے نے مشین کی طرف سے خاموشی سے گو کا پتہ تختہ پر رکھ دیا۔
کھیل کا پیسہ پانچویں لائن پر گرا۔
کوئی بھی جو گو کھیل نہیں جانتا، اس کے لیے اس کا کوئی مطلب نہیں۔ جو جانتا ہے، اس کے لیے یہ تقریباً بے وقوفی ہے۔ شروعات اور درمیانی مرحلے میں، کنارے سے اتنی دور کا موقع کم کارآمد سمجھا جاتا ہے، نہ تو یہ زمین حاصل کرتا ہے اور نہ ہی علاقہ برقرار رکھتا ہے، جس سے آپ خود بخود اپنے حریف کو پوائنٹس دے رہے ہوتے ہیں۔ یہ وہی طریقہ ہے جسے استاد طلباء کو درست کرتا ہے۔ سولوشن سیٹ پر، ٹاپ پیشہ ورانہ گو کھلاڑی مائیکل ریڈمنڈ نے لائیو میچ کے دوران شروع میں سمجھا کہ بورڈ سگنل میں خرابی ہے۔ اس نے ایک پتھر اٹھایا اور پھر واپس رکھ دیا۔
لی شیشی واپس بیٹھ گئے اور لگ بھگ 12 سے 15 منٹ تک کھیل کے تختے کو دیکھتے رہے۔ پانچ ماہ پہلے الجافو کے خلاف شکست کھانے والے یورپی چیمپئن فان ہوی موجودہ مکان میں مشاہدہ کر رہے تھے۔ لمبے عرصے تک دیکھنے کے بعد ان کا جائزہ تھا: "یہ انسانی حرکت نہیں ہے۔ میں نے کبھی کسی کو اس طرح نہیں کھیلتے دیکھا۔"
وہ صحیح ہے، اور اس کی درستگی قابلِ قیاس ہے۔ DeepMind کے سسٹم کے اندر ایک تخمینہ مکانیزم ہے جو بڑی تعداد میں انسانی گیمز سے سیکھ کر کسی بھی پوزیشن میں انسان کے کسی خاص موو کو کھیلنے کی احتمال کا تخمینہ لگاتا ہے۔ 37ویں موو کے لیے، یہ تخمینہ تقریباً ایک دس ہزار میں ایک ہے۔
مکینیک نے ابھی اتر دیا، اور یہ چال پورے میچ جیت گئی۔
اس کہانی کا ایک آرام دہ تفسیر یہ ہے کہ مشین نے انسانی ماہرین کو سیکھنے کے لیے بہت محنت کی اور آخرکار ان میں سب سے بڑھ کر پہنچ گئی۔ یہ تفسیر غلط ہے، اور ایک منٹ کا ایک لاکھواں حصہ اس کی غلطی کی وضاحت کرتا ہے۔ انسانی حرکات کی نقل کرنے والا کوئی نظام اس کی حد تک ہی محدود ہوتا ہے، جو انسانی حرکات ہی ہیں۔ سیول میں جو واقعہ پیش آیا، وہ یہ تھا کہ ایک نظام اس حد سے آزاد ہو گیا، کیونکہ اسے دیا گیا مقصد انسانی ماہرین کی تائید حاصل کرنا نہیں، بلکہ جیتنا تھا۔
یہ فرق تعریف سے زیادہ مفید سمت دیتا ہے۔ اگر آپ جاننا چاہتے ہیں کہ کون سی انسانی سرگرمیاں صرف صلاحیت کے لحاظ سے ہار چکی ہیں اور اگلی کون سی ہے، تو آپ کو یہ نہیں پوچھنا چاہئے کہ یہ سرگرمی کتنی مشکل ہے، کتنی تخلیقی ہے، یا کتنی تجرباتی ہے۔ سوال اس سے زیادہ بے روح ہے۔
سوال یہ ہے کہ کامیابی کو نمبر دیا جا سکتا ہے یا نہیں۔
ایک پلیٹ کے بعد دوسری پلیٹ
شطرنج 19 سال پہلے ہی ہار چکا تھا، اور وہ بالکل مختلف طریقے سے ہارا تھا۔
1997 میں ڈیپ بلو نے کیسپروو کو شکست دی، اور اس کی ساخت بنیادی طور پر ایک بڑا انسانی اظہار تھا۔ اس کا ایوان فنکشن — جو ایک پوزیشن کو دیکھ کر اس کی بہتری کا ایک نمبر دیتا ہے — کو گرینڈ ماسٹر مشیر کی مدد سے جمع کیا اور ٹیون کیا گیا تھا۔ انسانی شطرنج کا علم مشکل سے انسانی کھلاڑیوں سے نکالا گیا اور مشین میں درج کر دیا گیا۔ مشین نے صرف تلاش کی صلاحیت بڑھائی: زیادہ قدم آگے تیزی سے دیکھنا، بے تھک، اور توجہ کے کم ہونے سے قطعہ نہ گنواۓ۔
یہ ایک حقیقی کامیابی ہے، اور اسے ایک کامیابی کے طور پر گننا چاہیے۔ لیکن اس کی شکل پر توجہ دیں۔ گہرے نیلے رنگ کا شطرنج کے بارے میں سمجھ انسانی سمجھ ہے۔ اس کا فائدہ رفتار ہے۔ اگر آپ اس سے پوچھیں کہ وہ اس موقع کا جائزہ کیوں ایسے لے رہا ہے، تو جواب آخر کار اس شخص تک پہنچے گا جس نے اسے یہ کرنے کو کہا تھا۔
20 سال بعد، DeepMind نے ایک سسٹم جس کا نام AlphaZero تھا، جو شکل میں بدل گیا۔
الفا زیرو کو شطرنج کے قوانین دیے گئے۔ اسے شروعاتی کتب دی گئیں — جن پر ہر سنجیدہ پروگرام انحصار کرتا ہے۔ اسے انتہائی آخری مراحل کی جدولیں نہیں دی گئیں۔ اسے کوئی انسانی گیم نہیں دیا گیا۔ اس نے خود سے خود کھیلا، تصادفی حرکات سے شروع کیا، اور اس نے اپنے آپ کو اس بات کے مطابق ڈھال لیا کہ کون سی حرکت جیت کی طرف لے جاتی ہے۔
تقریباً چار گھنٹوں کے بعد، ڈیپ مائنڈ نے اپنا ریٹنگ اس وقت کے سب سے طاقتور روایتی پروگرام Stockfish 8 سے زیادہ ہونے کا اندازہ لگایا۔ تقریباً نو گھنٹوں کے بعد، اس نے Stockfish کے ساتھ محدود وقت کے تحت ایک سو پارٹیز کھیلیں، جن میں 28 جیتیں، کوئی شکست نہیں، اور باقی 72 برابری کے نتائج آئے۔ تحقیقی مقالہ میں بتایا گیا کہ 24 گھنٹوں کے اندر، اس نے شطرنج، شوگو اور گو میں انسانی سطح سے اعلیٰ کارکردگی حاصل کر لی۔
جب ان اعداد کو حوالہ دیا جاتا ہے تو اکثر دوسری طرف کی تفصیل کو نظرانداز کر دیا جاتا ہے، جبکہ وہ بھی اہم ہے۔ خود کے خلاف کھیل کی گیمیں پانچ ہزار پہلی نسل کے ٹینسر پروسیسنگ یونٹس پر تیار کی گئیں، جبکہ اس نیٹ ورک کو تربیت دینے کے لیے اسی طرح چھتالیس دوسری نسل کے یونٹس استعمال ہوئے، جو سب مل کر متوازی طور پر چل رہے تھے۔ چار گھنٹے کا گھڑی کا وقت، چار گھنٹے کی حسابی کارکردگی ہے — اس قدر کا حسابی وسائل کوئی ذاتی فرد، یا حتیٰ کہ کچھ ادارے بھی جمع نہیں کر سکتے۔ یہ کامیابی اس بات کی نہیں ہے کہ شطرنج سیکھنا آسان ہے۔ یہ کامیابی اس بات کی ہے کہ جب آپ کے پاس اتنی زبردست حسابی طاقت ہو، تو انسانی علم آپ کے لیے ضروری نہیں رہتا۔
کاسپاروف کے پاس اس نتیجے کو اپنے خلاف ایک حملہ سمجھنے کا کوئی بھی زندہ شخص سے زیادہ وجہ تھا، لیکن اس نے سائنس میں ایک جائزہ لکھا جو بہت بڑھ چڑھ کر تھا۔ اس کا مشاہدہ یہ تھا کہ AlphaZero وہ ایسی تھکاوٹ، احتیاط، اور ڈرا کی طرف راغب شطرنج نہیں کھیلتا جو ہر کوئی ایک مثالی مشین کے لیے تصور کرتا ہے۔ یہ حرکت کو طاقت سے زیادہ ترجیح دیتا ہے، اور اس کے لیے جو حالتیں خطرناک لگتی ہیں، وہ قربانی دے دیتا ہے۔ اس نے نوٹ کیا کہ روایتی پروگرام ان پروگرامرز کے ترجیحات اور جانبداریوں کو حامل ہوتے ہیں۔ AlphaZero خود اپنے آپ کو لکھ رہا ہے۔ اس نے نتیجہ نکالا کہ اس کا انداز اس لیے پروگرامرز کے ذائقے سے زیادہ حقیقی چیز کو ظاہر کرتا ہے، اور اس نے مشاہدہ کیا کہ یہ فی ثانیہ دنیا کے بہترین روایتی انجن سے بہت کم حالتیں چیک کرتا ہے، پھر بھی جیتتا ہے۔
یہ آخری تفصیل کو یاد رکھنا چاہیے۔ روایتی انجن فی کثیر امکانات کو تلاش کرتا ہے، لیکن ہار گیا۔ AlphaZero کا فائدہ زیادہ محنت سے نہیں، بلکہ یہ جاننے میں ہے کہ کہاں دیکھنا ہے، اور یہ علم لاکھوں خود کے ساتھ کھیلے گئے میچوں اور اس قاعدے سے ترتیب دیا گیا ہے کہ کون جیتا ہے، اور اس سے زیادہ کچھ نہیں۔
شطرنج کے نتائج وہاں تک زیادہ عجیب ہیں جہاں تک انہیں سمجھنے کا اہل ہے۔ شطرنج ایک جاپانی بورڈ گیم ہے جس میں کھائے گئے پیسے اس فرد کے پاس واپس آ جاتے ہیں جس نے انہیں کھایا، جس سے یہ گیم کھیل کی تبدیلی کو شطرنج سے زیادہ بناتا ہے، اور اس میں بادشاہ کو محفوظ رکھنے کے بارے میں کئی سو سالہ نظریات بھی ہیں۔ طاقتور کھلاڑیوں نے مشین کے مقابلے دیکھنے کے بعد رپورٹ کیا کہ شروعات معلوم نظریات کی خلاف ورزی کرتی ہے، اور بادشاہ وہاں جا کھڑا ہوتا ہے جہاں ہر کتاب کہتی ہے کہ وہ کونے میں چھپنا چاہئے۔ ان مقابلوں کو تربیت یافتہ آنکھوں کے لیے تقریباً غیر قابل فہم ہے، لیکن وہ جیتتے ہیں۔
دو نظاموں کو ایک دوسرے کے ساتھ رکھیں، جس کا نمونہ انتہائی بےچین کرنے والا واضح ہے۔ گہرا نیلا انسانی علم اور مشین کی رفتار کا مجموعہ ہے۔ AlphaZero مشین کی رفتار اور فتح کی تعریف کا مجموعہ ہے، جس میں انسانی علم کو جان بوجھ کر ختم کر دیا گیا ہے۔ انسانی علم کو ختم کیے گئے ورژن کو بہتر ثابت کیا گیا ہے۔
یہ سب اس بات کا مطلب نہیں کہ 2016 کی مشین مکمل طور پر بے عیب تھی، اسی سیول مقابلے میں ثبوت موجود تھا۔
چوتھی جیت، تین سیٹ پیچھے، عزت کے لیے لڑتے ہوئے، لی سی شی نے شطرنج کے مرکز میں ایلفاگو کے دو ٹکڑوں کے درمیان ایک پتھر رکھ دیا۔ اسے بعد میں خدا کا ایک حرکت کہا گیا۔ ایلفاگو نے خود انسانوں کے اس حرکت کو کرنے کی احتمال کا اندازہ لگایا، جو تقریباً ایک دہائی میں ایک تھا، جو حیرت انگیز طور پر متوازن تھا۔ سسٹم نے اس کا جواب نہیں دے سکا۔ اگلے کچھ حرکتوں میں اس نے اپنی جیت کے احتمال کا اندازہ خراب کر دیا، اس کا کھیل بگڑ گیا، اور وہ یہ میچ ہار گیا۔
تو 2016ء کے مارچ میں، مشین پر ایک خلیل تھا، اور ایک انسان دنیا بھر کی نگاہوں کے سامنے، سب سے زیادہ دباؤ کے تحت اسے تلاش کر لیا۔ اس کا واضح طور پر ذکر کرنا ضروری ہے، اسے چپ چاپ نہیں گزرنا چاہیے۔ اس کے علاوہ یہ بھی قابل ذکر ہے کہ بعد میں کیا ہوا: اس قسم کے خلیل لگاتار بند ہوتے گئے، اور اس نظام کے جانشین نے اب ایسے مقابلے میں ہار نہیں مانی، اور ٹاپ انجنز نے سنجیدہ مقامات پر طویل عرصے سے انسانوں کو ایک بھی شطرنج کا میچ نہیں جیتا۔ 2016ء کا نتیجہ ایک تبدیلی کا ایک لمحہ تھا، مستقل طاقت کا توازن نہیں۔
ان شطرنج کے بورڈ سے لے کر دیگر تمام چیزوں تک، جو منتقل ہوتا ہے وہ فتح نہیں بلکہ عمل ہے۔ شطرنج اور گو کو سب سے پہلے گرنے کا انتظار ہے، کیونکہ اس کا سبب حیران کن طور پر سادہ ہے۔ کھیل میں، کامیابی کو قوانین کے ذریعے مکمل طور پر درست طریقے سے تعریف کیا جاتا ہے۔ آپ جیتتے ہیں یا نہیں جیتتے، اسکورنگ مفت، فوری اور بے نقاب ہوتا ہے۔ ایک نظام ایک ویک اینڈ میں اپنے آپ سے چار کروڑ کھیل کھیل سکتا ہے اور چار کروڑ واضح اور بے نقاب فیصلے حاصل کر سکتا ہے۔
یہ اگلے دیکھنے کی جگہ کی طرف اشارہ کرتا ہے۔ آسان کاموں کی نہیں، بلکہ خود کا اسکور بورڈ رکھنے والے کاموں کی طرف۔
پچاس سالہ مسئلہ
پروٹین ایمینو ایسڈ کے زنجیر ہوتے ہیں، جو تیار ہوتے ہی ایک پیچیدہ تین بعدی شکل میں جھک جاتے ہیں۔ شکل یہ طے کرتی ہے کہ پروٹین کیا کرتا ہے۔ ترتیب شکل طے کرتی ہے۔ تقریباً 1970 کی دہائی کے آغاز سے، پہلے سے دوسرے کا استنباط کرنا زندگی کا ایک کھلا مسئلہ رہا ہے، اور اس طرح کھلا رہا ہے جس نے تمام حملوں کا مقابلہ کیا: پہلے اصولوں کے مطابق فزکل سیمولیشن، ترقیاتی تعلقات کا احصائی تجزیہ، اور دہائیوں کی تجرباتی ساختی سمجھ—سب کچھ ناکام رہا۔
1994ء میں، جان مولٹ کی قیادت میں ایک تحقیقی ٹیم نے اس حقیقت پر کچھ کیا: تمام لوگوں نے ترقی کا دعویٰ کیا تھا، لیکن کوئی بھی اس کی تصدیق نہیں کر سکا۔
انہوں نے ایک ٹیسٹ کا انعقاد کیا۔ اس کے بعد ہر دو سال بعد، کیمسٹری کی پیشگوئی کا اہم جائزہ (CASP) تجرباتی طور پر طے پانے والی پروٹین سٹرکچرز، کبھی کبھی ان کا تعین ابھی جاری ہونے پر، اور ان کے سیکوئنسز کو دنیا بھر میں شائع کرتا ہے۔ کوئی بھی ٹیم پیشگوئی جمع کرواسکتی ہے۔ کسی کو جواب تک رسائی نہیں ہوتی، کیونکہ کچھ ہدف کے جوابات ابھی موجود نہیں ہوتے۔ جب تجرباتی سٹرکچر آ جاتا ہے، تو پیشگوئیوں کا موازنہ کرکے انہیں اسکور دیا جاتا ہے۔
درجہ بندی عالمی فاصلہ ٹیسٹ نامی ایک میٹرک کے ذریعہ کی جاتی ہے، جو 0 سے 100 تک ہوتا ہے، جسے لگभग اس بات کا فیصد سمجھا جا سکتا ہے کہ زنجیر کا نتیجہ کتنا قریب اصل موقع کے ہے۔ مولٹ نے کہا تھا کہ لگ بھگ 90 درجہ غیر رسمی طور پر لیب میں طے شدہ ساخت کے برابر سمجھا جاتا ہے۔ تجزیہ کے زیادہ تر تاریخی دور میں، بہترین پیش گوئیاں لگ بھگ 60 درجے کے گرد رہیں۔
2020 کے CASP14 پر، 427 گروپ کے نام سے رجسٹرڈ ایک شرکاء نے تمام ہدفोں پر میڈین سکور 92.4 حاصل کیا۔ سب سے مشکل شرط — جہاں کوئی مفید ساختی تعلق دستیاب نہیں تھا — پر میڈین سکور 87.0 تھا۔ اوسط خطأ تقریباً 1.6 اینگسٹروم تھا، جو تقریباً ایک ایٹم کی چوڑائی کے برابر ہے۔
مولٹ نے مقابلے کے آغاز سے ہی صدر کا عہدہ سنبھالا تھا، اور وہ گرافکس دکھانے سے پہلے مقابلے کی تاریخ کا جائزہ لیا۔ گرافکس نے ایک ہی تصویر میں پوری کہانی کو ظاہر کیا۔ بیس سال کی لائن 60 کے قریب پھسل رہی تھی، پھر ایک لائن اس جگہ پر کھڑی ہو گئی جہاں کوئی اور لائن کبھی نہیں پہنچی۔
گروپ 427 AlphaFold2 ہے۔ مولٹ نے اعلان کیا کہ ایک منفرد پروٹین زنجیر کے لیے مسئلہ حل ہو چکا ہے۔
مقید کریں کہ وہاں ہونا چاہیے، ہر ایماندار بیان میں۔ ایک منفرد زنجیر پروٹین سائنس کا پورا مسئلہ نہیں ہے۔ پروٹینز کیسے کمپلیکس میں اکٹھے ہوتے ہیں، کیسے حرکت کرتے ہیں، اور زندہ سیلز میں کیسے پیش آتے ہیں، یہ سب اب بھی کھلے ہیں۔ بند بڑا چیلنج ایک خاص، درست طور پر بیان کیا گیا چیلنج ہے۔
اور اسی درستگی ہے جو اس کہانی کو یہاں پیش کرنے کا مقصد ہے۔ اس کی ساخت کے پیشگوئی کو گرنے کا سبب اس کا آسان ہونا نہیں تھا، کیونکہ آدھے صدی کی ناکامیاں اس کے برعکس ثابت کرتی ہیں۔ اسے گرانے والا یہ تھا کہ 1994 میں اس شعبے نے خود اپنا اسکور بورڈ بنالیا۔
CASP کو ایک سائنس کے بجائے ایک انجینئرنگ کے طور پر دیکھنا کیا فراہم کرتا ہے؟ یہ کسی بھی پیشگوئی کے لیے ایک واضح اور بے نقاب کامیابی کا معیار فراہم کرتا ہے جو کچھ سیکنڈوں میں حساب لگایا جا سکتا ہے۔ یہ ایک ایسا بنیادی حقیقت فراہم کرتا ہے جس میں دھوکہ دینا ناممکن ہے، کیونکہ جواب دوسروں نے اپنے لیب میں فزیکل طور پر تعین کیا ہے۔ یہ مسلسل نئے مسائل کا ایک مقررہ شیڈول پر پیدا ہونے والا اไหลہ فراہم کرتا ہے۔ اور یہ تین دہائیوں کا تجزیہ شدہ تاریخی اقدامات کا ریکارڈ فراہم کرتا ہے، یعنی اس شعبے میں کیا بہتر اور کیا بدتر ہے، اس کا درجہ بندی شدہ ریکارڈ۔
جو شعبہ ان سب چیزوں کو کرتا ہے، وہ اپنے مسائل کے لیے بے خبری سے خودکار حملوں کی تیاری کر رہا ہے۔ اسکور بورڈ پیش شرط ہے۔ باقی سب کچھ انجینئرنگ اور کمپوٹیشن ہے، اور دونوں ہر سال بہت لمبے عرصے تک سستے ہوتے جا رہے ہیں۔
یہ ایک بےچین کن آسانی سے فروخت کیا جا رہا ہے۔ جہاں کوئی شعبہ ایک معیاری اتفاق حاصل کرتا ہے، وہاں ایک نشانہ جاری کر دیا جاتا ہے۔ ماشینی ترجمہ کے لیے ا评分基准 ہے۔ بولی کی شناخت کے لیے ا评分基准 ہے۔ تصویر کی طبقہ بندی کے لیے ایک ایسا مجموعہ ہے جس میں ایک ملین تصویریں نشان زد ہیں اور ایک سالانہ مقابلہ، جسے دیکھنے والا ہر کوئی جانتا ہے کہ کہانی کس طرح ختم ہوتی ہے۔ قانون یہ نہیں کہ مشکل چیزیں پہلے گر جاتی ہیں، یا آسان چیزیں پہلے گر جاتی ہیں۔ قانون یہ ہے کہ جو چیز ناپی جاتی ہے، وہ پہلے گر جاتی ہے۔
یہ تمام ابھی تک ناپے نہیں گئی چیزوں کے لیے واضح سوالات اٹھاتا ہے۔
جو چیز کو اسکور نہیں دیا جا سکتا، اسے اسکور دیں
آخری دفاع وہ چیزیں ہونی چاہئیں جن کا امتیاز نہیں کیا جا سکتا۔
写作 ایک معیاری مثال ہے۔ کوئی بھی پروگرام ایک پیراگراف لے کر اسے ایک نمبر دے کر یہ نہیں کہہ سکتا کہ یہ کتنا اچھا ہے۔ دو ماہر ادیب ایک دوسرے سے متفق نہیں ہوتے۔ ایک ہی ادیب مختلف دنوں میں خود سے متفق نہیں ہوتا۔ زبان کی معیاریت ماحول، شائقین، مقصد اور ذائقے سے جڑی ہوئی ہے، جنہیں کسی بھی پیمانے میں نہیں ڈالا جا سکتا۔ اگر مشین کو اسکور کارڈ کی ضرورت ہے، جبکہ زبان کا کوئی اسکور کارڈ نہیں ہے، تو زبان محفوظ ہے۔
یہ استدلال درست ہے۔ اس کے ساتھ جو ہوا، وہ اس کل تفصیل کا سب سے اہم سبب ہے۔
اس شعبے میں اچھے تحریر کے لیے کوئی عینی معیار نہیں ملا۔ اب تک ایسا کچھ نہیں ہے۔ اس نے صرف دستیاب واحد مواد، یعنی انسانی ججمنٹ، کا استعمال کرتے ہوئے ایک اسکور تیار کیا ہے۔
اس طریقہ کار کی تاریخ زیادہ تر لوگوں کے خیال سے زیادہ پرانی ہے۔ 2008 میں، ناکس اور اسٹون نے ایک نظام TAMER کا تصور پیش کیا جس میں انسان انتہائی ذہین کرداروں کے رویے کا مشاہدہ کرتے تھے اور ان کا جائزہ لیتے تھے، جس کا استعمال اس ماڈل کو تربیت دینے کے لیے کیا جاتا تھا جو یہ پیش گوئی کرتا تھا کہ انسان کیا کہے گا۔ پھر تربیت کا سگنل ماڈل کی طرف سے، نہ کہ انسان کی طرف سے، فراہم کیا جاتا تھا۔ 2017 میں، کرستینو اور ان کے ساتھیوں نے ایک تحقیق شائع کی جسے زیادہ تر لوگ موجودہ عمل کے ب без سیدھے ماخذ کے طور پر دیکھتے ہیں، جس میں انہوں نے اس خیال کو اٹاری گیمز کے انتہائی ذہین کرداروں پر لاگو کیا۔ 2019 میں، زگلر اور ان کے ساتھیوں نے اسے زبانی ماڈلز پر لاگو کیا، اور آج استعمال ہونے والے زیادہ تر اصطلاحات اس تحقیق میں طے ہوئیں۔ 2022 میں، اوئنگ اور ان کے ساتھیوں نے ہدایات پر عمل درآمد کرنے والے ٹاسکز پر صنعتی سطح پر اس طریقہ کار کو دکھایا، اور اس کے فوراً بعد، زمین پر زیادہ تر لوگوں نے بغیر جانے کے ان نتائج سے واقفیت حاصل کر لی۔
اس کا بنیادی عمل خاص طور پر سمجھنا چاہیے، کیونکہ یہ نام کے مقابلے میں کافی زیادہ سادہ ہے۔
ایک شخص دو متن کے سامنے بیٹھا ہے، جو دونوں ایک ہی پرامپٹ کے لیے ماڈل کے ذریعہ تخلیق کیے گئے ہیں۔ کام ان دونوں کو اسکور دینا نہیں ہے۔ اسکور دینا انسانوں کے لیے بہت خراب کام ہے، کیونکہ ایک کا ساتھ دوسروں کا پانچ ہوتا ہے، اور ایک ہی شخص ایک دن کے اندر بھی مستقل نہیں ہوتا۔ کام صرف یہ ہے کہ بتائیں کہ کون سا بہتر ہے۔ یہ ایک ایسا فیصلہ ہے جو انسان قابل اعتماد طریقے سے لے سکتے ہیں، اور اس طرح کے تعداد میں تقابلات کو ایک مسلسل سکیل میں تبدیل کرنے کے ریاضیاتی طریقے، جن کا استعمال کرنے والے شعبے سے بھی پرانے ہیں، 1952ء میں بریڈلے اور ٹیری کے جوڑاں تقابل کے کام سے ماخوذ ہیں۔
اس قسم کے فیصلوں کو کرنے کی صورتحال پر غور کریں، کیونکہ ان کا آخرکار اثر پڑتا ہے۔ یہ شخص ہر گھنٹے میں کئی بار ایسے فیصلے کرتا ہے، اور اسے ادائیگی کی جاتی ہے تاکہ وہ ایک لکھی ہوئی ہدایت نامہ کے مطابق یہ طے کرے کہ صارفین کو کون سا جواب بہتر لگتا ہے۔ کچھ جوڑے تقریباً مکمل طور پر ایک جیسے ہوتے ہیں۔ کچھ میں ایسے موضوعات شامل ہوتے ہیں جن کے بارے میں اس شخص کو کوئی معلومات نہیں ہوتی، اور اس صورت میں، زیادہ پختہ اور بہتر تنظیم شدہ جواب عام طور پر منتخب کر لیا جاتا ہے، چاہے وہ زیادہ درست ہو یا نہ ہو۔ یہ ان لوگوں پر تنقید نہیں ہے۔ یہ صرف اس بات کا تصور ہے کہ اس قسم کی صورتحال میں کوئی بھی شخص کیا کرے گا، اور نتیجے میں بننے والے فیصلے خ сыروں کے طور پر استعمال ہوتے ہیں۔
ان اختیارات کو کافی مقدار میں جمع کر لیں، اور آپ دوسرے ماڈل کو ٹرین کر سکتے ہیں جس کا کام یہ تخمینہ لگانا ہے کہ انسان دو متنوں میں سے کون سا زیادہ پسند کریں گا۔ یہ دوسرا ماڈل ایک عدد پیدا کرتا ہے۔ اور ایک عدد ہی وہ واحد چیز تھی جو تکرار سے کم تھی۔
یہاں جو بنایا جا رہا ہے، اسے دھیان سے دیکھیں، کیونکہ اسے آسانی سے نظرانداز کیا جا سکتا ہے۔ بہترین اسکور واقعات کے بارے میں نہیں ہے، بلکہ ہمارے ماڈل کے بارے میں ہے۔ یہ ایک خاص گروہ کے فیصلوں کا مختصر، سیکھا ہوا نقل ہے، جنہیں ایک خاص وقت پر مقرر کیا گیا تھا، ایک خاص ہدایت کے تحت کام کیا تھا، اور دوسرے تمام لوگوں کی طرح دوپہر کو تھک گئے تھے۔ CASP پیشگوئیوں کو لیب میں طے پائی گئی فزیکل حقیقت کے مطابق اسکور دیتا ہے، جبکہ یہ سسٹم انسانوں کے قبول کردہ احصائی تصویر کے مطابق متن کو اسکور دیتا ہے۔
یہ تصویر مفید ہے۔ لیکن یہ ضرور ایک تقریب ہے، اور اس میں جو چیز کی تصویر بنائی گئی ہے اس کے درمیان فرق ہے، جن کو کوئی مکمل طور پر نہیں سمجھ پایا۔ ہمارے ترجیحات کے ماڈل میں جو چیزیں ہماری حقیقی ترجیحات کو نہیں پکڑ پائیں، وہ مقصد میں شامل نہیں ہوتیں، اس لیے ان کا بہتر بنانا نہیں ہوتا، اور اس لیے وہ کسی بھی صورتحال کا شکار ہوتی ہیں—اور طاقتور آپٹمائزر کے پاس اس مقدار کو محفوظ رکھنے کا کوئی وجہ نہیں۔
یہ تعمیر کے بارے میں ایک حقیقت ہے، جسے یہاں بیان کیا گیا ہے اور جس میں نتائج کے بارے میں کوئی دعویٰ نہیں کیا گیا۔ موجودہ نقطہ نظر زیادہ تنگ اور زیادہ مشکل ہے جسے مسترد کیا جا سکے۔ درجہ بندی نہیں کی جا سکنے والی اشیاء کی قسمیں ظاہری طور پر سے کم ہوتی ہیں۔ اگر کوئی شعبہ پیمائش کا مقابلہ کرتا ہے، تو انسانی ترجیحات سے ایک پیمائش تعمیر کی جا سکتی ہے اور آگے بڑھا جا سکتا ہے۔ یہ دفاع صرف تب تک کام کرتا ہے جب تک کسی نے اسکور بنانے کا خیال نہیں کیا ہوتا۔
اگلے کیا گرے گا
یہ ایک عملی سوال اور ایک قابل استعمال جواب چھوڑ دیتا ہے۔
اپنی پسندیدہ سرگرمی کو منتخب کریں: ایک نوکری، ایک ہنر، ایک پیشہ، یا وہ کام جس پر آپ نے سالوں تک کام کیا ہے۔ تین سوالات پوچھیں۔
سب سے پہلے، کیا کامیابی اور ناکامی کو قابل اعتماد طریقے سے الگ کیا جا سکتا ہے؟ مکمل طور پر نہیں، اور نہ ہی ہر کوئی، لیکن اتنا مسلسل کہ صلاحیت رکھنے والے جج زیادہ تر وقت ایک دوسرے کے ساتھ متفق ہوں۔ گیم اس ٹیسٹ کو آسانی سے پاس کرتا ہے۔ پروٹین سٹرکچر پریڈکشن اس ٹیسٹ کو پاس کرتا ہے کیونکہ لیب میں آخرکار جواب ملتا ہے۔ لکھائی مطلق معنوں میں نہیں پاس کرتی، لیکن نسبتی معنوں میں پاس کرتی ہے کیونکہ لوگ عام طور پر دو کوششوں میں سے کون سی بہتر ہے، بتا سکتے ہیں۔
دوم، کیا اس قسم کا فیصلہ کم لاگت پر بڑے پیمانے پر لیا جا سکتا ہے؟ یہ سوال امکان نہیں، بلکہ وقت کا معاملہ ہے۔ ایک مفت اور فوری فیصلہ، جیسے کہ کھیل میں، کا مطلب ہے کہ سسٹم خود ملاینوں تربیتی ڈیٹا کا جنریٹ کر سکتا ہے۔ ایک ایسا فیصلہ جس کے لیے لیب کی ضرورت ہو، وہ سست ہے لیکن اب بھی ممکن ہے، جس میں تین دہائیوں کے اسکورنگ کے تجربات کا آرکائیو موجود ہے۔ ایک ایسا فیصلہ جس کے لیے ادائیگی شدہ انسانوں کو متن پڑھنا پڑے، وہ بہت مہنگا ہے، جس کی وجہ سے ان انسانوں کو سائکل سے نکالنے اور ان کی نقل کرنے والے ماڈلز کو تربیت دینے پر اتنی زور دار کوشش کی گئی ہے۔
تیسری بات، یہ فیصلہ نہیں کہ کون سا شعبہ کب گرے گا، بلکہ اس کے بعد کیا ہوگا: کیا یہ اسکور واقعی آپ کے لیے وہ چیز ہے جو آپ چاہتے ہیں؟ گیم کا اسکور آپ کے لیے وہ چیز ہے جو آپ چاہتے ہیں، کیونکہ گیم میں، جیتنا خود تعریف کے مطابق پورا معنی ہے۔ تجرباتی طور پر پیمانے پر ناپے گئے پروٹین کے سٹرکچر بہت قریب ہیں آپ کے لیے وہ چیز جو آپ چاہتے ہیں۔ ایک لیبلر کی ترجیحات سے سیکھا گیا ماڈل آپ کے لیے وہ چیز نہیں ہے جو آپ چاہتے ہیں۔ یہ آپ کے لیے وہ چیز کا تصویرہ ہے، اور تصویرہ اور چہرے کے درمیان فرق موجود ہے۔
اپنے کام کا جائزہ لینے کے لیے اپنے آپ کو ان تین سوالات سے گزاریں۔ زیادہ تر لوگ پہلا جواب جلد اور پریشان کن ترین پاتے ہیں۔ ہم جسے مہارت کہتے ہیں، وہ کم از کم نسبی معنوں میں، ایک صلاحیت مند شخص کے ساتھ دو بار کوشش کرتے وقت درجہ بندی کی جا سکتی ہے۔ دوسرا سوال اصل عدم یقین کا مقام ہے، کیونکہ لاگت اور سائز متغیر ہدف ہیں، اور وہ بہت طویل عرصے سے ایک ہی سمت میں منتقل ہو رہے ہیں۔ تیسرا سوال تقریباً کوئی نہیں پوچھتا، اور یہ یہ طے کرتا ہے کہ آپ کے شعبے کی دوسری طرف کیا شکل ہے۔
کچھ عام باتوں پر اس مشق کو آہستہ آہستہ کرنا قابلِ توجہ ہے۔ مثلاً ریڈیولوجی کا معاملہ۔ کیا کامیابی اور ناکامی کو الگ کیا جا سکتا ہے؟ ہاں، اور بہت درست طریقے سے، کیونکہ تشخیص آخرکار مریض کی حالت سے تصدیق یا رد عمل کیا جائے گا۔ کیا جائزہ کم لاگت پر بڑے پیمانے پر حاصل کیا جا سکتا ہے؟ تقریباً ہاں، کیونکہ ہسپتالوں نے دہائیوں تک تصاویر اور تصدیق شدہ نتائج کے شکل میں جائزہ کے نمونے جمع کر رکھے ہیں۔ کیا یہ اس جائزہ کو آپ چاہتے ہیں؟ یہاں جواب پیچیدہ ہو جاتا ہے، کیونکہ جائزہ دیا جا رہا ہے ریکارڈ شدہ تشخیص کے ساتھ اتفاق کا، جبکہ آپ چاہتے ہیں کہ مریض کی حالت اچھی ہو، اور دونوں چیزیں زیادہ تر وقت ایک جیسی ہوتی ہیں، لیکن سب سے اہم حالات میں الگ ہو جاتی ہیں۔
اب ایک ایسا چیز اپنائیں جو زیادہ محفوظ لگتی ہے۔ انتظام کو لیجیے۔ پہلا سوال پہلے ہی مشکل ہے، کیونکہ صلاحیت والے لوگوں کے درمیان کسی دیے گئے انتظامیہ کے بارے میں رائے میں فرق ہوتا ہے، اور یہ اختلافات جلد حل نہیں ہوتے۔ دوسرا سوال اور زیادہ مشکل ہے، کیونکہ انتظامی فیصلوں کے نتائج سالوں بعد ظاہر ہوتے ہیں، اور وہ تمام دوسرے واقعات کے ساتھ الجھے ہوتے ہیں۔ تیسرا سب سے مشکل ہے، کیونکہ کوئی بھی اچھا انتظام کا متبادل اندازہ، چاہے وہ رُکاوٹ کی شرح ہو، یا مصروفیت کا اسکور ہو، یا فرد کی پیداوار، واضح طور پر خود چیز نہیں ہوتا۔ اس تشخیص کے مطابق، انتظام اس لئے محفوظ نہیں کہ وہ گہرا ہے۔ یہ ناپا نہیں جاتا، جو ایک مختلف، کم پسندیدہ تحفظ ہے۔
مشینیں اب ترقی کے محور پر قبضہ کر چکی ہیں۔ کافی کمپوٹیشن کے ساتھ، کسی بھی واضح طور پر تعین کردہ مقصد پر اچھے حرکات تلاش کرنا مقابلہ نہیں رہا، اور نتائج اکثر ہمارے سے صرف زیادہ طاقتور ہی نہیں، بلکہ زیادہ عجیب بھی ہوتے ہیں، جو ہماری روایتی تعلیمات ہمیں دیکھنے سے روکتی ہیں۔ یہ پیشگوئی نہیں ہے۔ یہ شطرنج، گو، شوگی، پروٹین ساخت اور جتنے بھی ایسے معاملات تھے جن پر صرف انسان ہی کام کر سکتے تھے، ان کا تفصیلی تصور ہے۔
باقی مقصد خود ہے۔ کسی نے فیصلہ کیا کہ اسکور کیا ہوگا۔ اوپر کے ہر مثال میں، وہ فیصلہ ایک دوپہر لے لیا، اور ہر عجیب نتیجہ اس سے نکلا، اس کے ساتھ وفادار رہا، اور اس کے غائب ہونے والے کسی بھی چیز کے لیے بے پرواہ رہا۔
تو آخری سوال غور کرنے کے قابل ہے۔ آپ کے کام میں کیا اب تک نمبر ہیں؟ اگر ہیں، تو انہیں کس نے لکھا ہے، اور وہ جب لکھ رہے تھے تو کیا آپ کو یاد کر رہے تھے؟
یہ "Whatever You Ask For" سیریز کا دوسرا حصہ ہے، جس میں مشین کو آخرکار ہم سے کیا ضرورت ہے اور ہم نے کتنا برا کام کیا، اس پر بات ہو رہی ہے۔
