সম্পাদনা | Panda
বায়োহাজার্ড-এ, একটি গভীর ভূমিগত ল্যাবরেটরি রয়েছে যার নাম "হাইভ"। দরজা অ্যাক্সেস, নিরীক্ষণ, বাতাসের ব্যবস্থা, নিরাপত্তা এবং সম্পূর্ণ সুবিধার কার্যক্রম একটি এআই: রেড কুইনকে দেওয়া হয়েছে।

মানুষের বিজ্ঞানীরা গবেষণার দায়িত্ব পালন করে, কিন্তু এই ল্যাবরেটরির "হাত-পা" বাস্তবে নিয়ন্ত্রণ করে AI।
যখন অস্বাভাবিকতা ঘটে, তখন লাল রানী দরজা বন্ধ করতে পারেন, সিস্টেম কাটতে পারেন, সুবিধা নিয়ন্ত্রণ করতে পারেন এবং ভৌত বিশ্বে সরাসরি হস্তক্ষেপ করতে পারেন।
বিশ বছর আগে, এই ধরনের গল্প ছিল সায়েন্স ফিকশন চলচ্চিত্রে ভয় তৈরির জন্য ক্লাসিক পদ্ধতি: এআই ভৌত বিশ্বে প্রবেশ করে, মেশিনগুলি নিয়ন্ত্রণ করে, পরীক্ষা চালায় এবং প্রত্যক্ষভাবে বাস্তব বিশ্বে হস্তক্ষেপ করে।
এখন, এই দৃশ্যটি এক সম্পূর্ণ ভিন্নভাবে বাস্তবতায় প্রবেশ করছে—কমপক্ষে এখনও ভয়ঙ্কর নয়।
গতকালই Anthropic পদার্থবিদ্যাগত হার্ডওয়্যারের জন্য Model Hardware Standard (MHS) প্রকাশ করেছে, যা MCP-এর লজিককে GitHub, Slack এবং ডাটাবেস থেকে মেকানিক্যাল আর্ম, মাইক্রোস্কোপ, তরল প্রসেসর, লেজার ইত্যাদি বাস্তব ডিভাইসগুলিতে আরও বিস্তারিতভাবে প্রসারিত করার চেষ্টা করছে। প্রতিবেদনটি দেখুন: “অল্প কয়েক মিনিট আগে, Anthropic ফিজিক্যাল MCP প্রকাশ করেছে: Claude বাস্তব বিশ্ব নিয়ন্ত্রণ শুরু করেছে।”

সহজ ভাষায়, এআই এজেন্টের শুধুমাত্র সফটওয়্যার কল করার ইন্টারফেস থাকা যথেষ্ট নয়, এখন এটিকে বাস্তব বিশ্বের সাথে যুক্ত করার জন্য একটি নিউরন এবং হাত-পা প্রয়োজন। আজ, গুগল ডিপমাইন্ড এই ক্ষেত্রে নিজেদের অর্জন প্রদর্শন করেছে।
একটি সাম্প্রতিকভাবে প্রকাশিত ৮৩ পৃষ্ঠার গবেষণাপত্রে, গুগল জেমিনি চালিত কো-সায়েন্টিস্টকে বাস্তব গবেষণা প্রক্রিয়ার সাথে যুক্ত করেছে এবং এটিকে পরীক্ষা ডিজাইন করতে, কার্যক্রম চালানোর জন্য কোড তৈরি করতে, পরীক্ষার ফিডব্যাক পড়তে এবং পরীক্ষামূলক ডিভাইসের সাথে সরাসরি সংযোগ করতে দিয়েছে। গুগল এই পরিবর্তনকে in-silico hypothesis generator থেকে execution-grounded research partner-এর দিকে এগিয়ে যাওয়া হিসাবে উল্লেখ করেছে, অর্থাৎ চিপ-ভিত্তিক অনুমান জেনারেটর → কার্যক্রম-ভিত্তিক গবেষণা সহযোগী।

সবচেয়ে সরাসরি পরীক্ষায়, গবেষকরা একটি নিজস্ব তৈরি CVD ডিভাইসের শর্তগুলি Gemini 3 Deep Think-এর কাছে প্রেরণ করে। কয়েক মিনিটের মধ্যে, এটি এই মেশিনটির জন্য উপযুক্ত উপাদান বৃদ্ধির পরিকল্পনা প্রদান করে এবং এই পরিকল্পনাটিকে ডিভাইসটি নিয়ন্ত্রণ করার জন্য মেশিন কোডে অনুবাদ করে। শেষ পর্যন্ত, তিনটি দ্বিমাত্রিক অর্ধপরিবাহী প্রথমবারের মতো সফলভাবে বৃদ্ধি পায়।
অতএব, একটি অতীতে মূলত বিজ্ঞান কল্পকাহিনীর চলচ্চিত্রে বিদ্যমান দৃশ্য হঠাৎ বাস্তবতায় পরিণত হয়েছে: যখন বড় মডেলগুলি সত্যিকারের "হাত" পায় এবং পরীক্ষাগারের সরঞ্জামগুলি নিয়ন্ত্রণ শুরু করে। তাহলে, আজ থেকে, AI Scientist কী হয়ে যাবে?
বায়োহুইল সিরিজে, মানুষ ভয় পায় যে AI ল্যাবকে নিয়ন্ত্রণ করে ফেলবে। কিন্তু বাস্তবের বিজ্ঞানীরা সক্রিয়ভাবে ল্যাবটি এক পয়েন্ট এআই-এর হাতে দিন। অবশ্যই, গুগল যা করতে চায়, তা হল অনিয়ন্ত্রিত “মধুমাছের ছাতা” নয়, বরং একটি বিজ্ঞানসন্ধান মেশিন যা অনুমান প্রস্তাব করে, পরীক্ষা ডিজাইন করে এবং বাস্তবে পরীক্ষা পর্যন্ত চলে।

পেপারের শিরোনাম: রিয়েল-ওয়ার্ল্ড-এ জেমিনি ব্যবহার করে বৈজ্ঞানিক গবেষণা ত্বরান্বিত করা
পেপারের ঠিকানা: https://arxiv.org/pdf/2608.26701
জেমিনি একটি পরীক্ষামূলক যন্ত্র নিয়ন্ত্রণ করেছে
প্রথমে, উপাদান বিজ্ঞান।

গবেষকরা নিজেদের তৈরি করা একটি রাসায়নিক বাষ্প নির্মাণ সরঞ্জাম, অর্থাৎ CVD ভাটি ব্যবহার করেছেন। এই ধরনের দ্বিমাত্রিক উপাদানের পরীক্ষা করার সময়, একটি দীর্ঘস্থায়ী সমস্যা হল: প্রকাশিত 'প্রণালী'গুলি পুনরায় পুনরুৎপাদন করা কঠিন।
একই তাপমাত্রা, গ্যাস এবং পূর্বসূরির মতো প্যারামিটারগুলি ব্যবহার করেও, যদি একটি ভিন্ন ফার্নেসে ফার্নেসের আকার, বায়ুপ্রবাহ বা উপাদানের স্থানায়ন কিছুটা ভিন্ন হয়, তবে চূড়ান্তভাবে উৎপাদিত ক্রিস্টালটি সম্পূর্ণভাবে ভিন্ন হতে পারে। গবেষকদের প্রায়শই কয়েক সপ্তাহ থেকে কয়েক মাস পর্যন্ত প্যারামিটারগুলি পুনরাবৃত্তি করে সমন্বয় করতে হয়।
অতএব, গবেষণা দল এখন জেমিনির কাছে পরীক্ষা কীভাবে করতে হবে তা বলছে না, বরং ল্যাবে কী কী যন্ত্রপাতি আছে, কী কী রাসায়নিক পদার্থ আছে, ভাপ ভিটির গঠন কেমন তা বলছে। বাকি প্যারামিটারগুলি AI নিজেই নির্ধারণ করে।
কো-সায়েন্টিস্ট এই সীমাবদ্ধতাগুলির ভিত্তিতে গ্যাস প্রবাহ, তাপমাত্রা বক্ররেখা, পূর্বসূরির পরিমাণ, উপাদানের স্থানায়ন ইত্যাদি সম্পূর্ণ পরীক্ষা পরিকল্পনা তৈরি করে এবং এটি পরীক্ষা সরঞ্জামের কাছে পাঠায়।

একটি পরীক্ষার গ্রুপ বিশেষভাবে উল্লেখযোগ্য। গবেষক দল জেমিনি 3 ডিপ থিংককে CVD নিয়ন্ত্রণ প্রক্রিয়ার সাথে সংযুক্ত করলে, এটি বিজ্ঞানীদের ধীরে ধীরে পড়ার জন্য প্রাকৃতিক ভাষায় পরীক্ষার পদ্ধতি তৈরি করতে বন্ধ করে দেয় এবং কয়েক মিনিটের মধ্যে যুক্তি প্রয়োগ করে ফলাফলগুলিকে সরাসরি ডিভাইস নিয়ন্ত্রণের জন্য মেশিন কোডে রূপান্তরিত করে।
শেষ পর্যন্ত, প্রথম পরীক্ষায় MoS₂, MoSe₂ এবং WS₂ এই তিনটি দ্বিমাত্রিক অর্ধপরিবাহীর একক স্তরের ক্রিস্টাল সফলভাবে বৃদ্ধি পায়। পুরো পরীক্ষা প্রক্রিয়াটি প্রায় এক ঘন্টায় সম্পন্ন হয়।
MoSe₂ এবং WS₂ আরও বিশেষ: গবেষকরা আগে এই সেটে এই দুটি উপাদান বৃদ্ধি করেননি। পরবর্তীতে কমপক্ষে পাঁচটি পুনরাবৃত্ত পরীক্ষা ফলাফলকে যাচাই করেছে।
এটি গতকাল Anthropic দ্বারা প্রদর্শিত MHS-এর সাথে একটি আকর্ষণীয় সম্পর্ক তৈরি করে। Anthropic যে সমস্যার সমাধান করতে চায়, তা হলো Agent-এর জন্য পরীক্ষাগার সরঞ্জামগুলি চিনতে এবং নিয়ন্ত্রণ করতে কীভাবে সহজ এবং মানকযুক্ত পদ্ধতি তৈরি করা যায়; গুগলের এই পেপারটি পরবর্তী পদক্ষেপটি নিয়ে আলোচনা করে: যখন যুক্তিসম্পন্ন মডেলগুলি পরীক্ষাগার সরঞ্জামগুলি নিয়ন্ত্রণ করতে সক্ষম হয়ে যায়, তখন বিজ্ঞানীদের কাজের প্রবাহকে কীভাবে পুনঃগঠন করা উচিত?
এই অর্থে, "AI হার্ডওয়্যারকে সংযুক্ত করা" এখন সমস্যা নয়।
শুধু পেপারের ভিত্তিতে পরীক্ষা করার পাশাপাশি, এআই এখন নিজেই রেসিপি খুঁজে বার করছে।
তবে, শুধুমাত্র জেমিনির পূর্ববর্তী জ্ঞানের ভিত্তিতে একটি সেটআপ পরিচালনা করা সত্যিকারের বৈজ্ঞানিক আবিষ্কার হিসাবে গণ্য হতে পারে না। তাই গুগল দ্বিতীয়, আরও কঠিন পরীক্ষা চালায়: Ti₃C₂Tₓ নামক একটি MXene 2D উপাদানকে নিচের দিক থেকে সংশ্লেষণের চেষ্টা করা।
প্রাচীন পথগুলি প্রায়শই বিপজ্জনক ক্ষারক ব্যবহার করে, এবং পরিচিত কিছু CVD পদ্ধতি বিষাক্ত এবং বাতাসের প্রতি সংবেদনশীল TiCl₄ ব্যবহার করে। তাই গবেষণা দল Co-Scientist-এর কাছে একটি কাজ দিয়েছে: কি একটি আরও নিরাপদ পূর্বসূচক পথ খুঁজে পাওয়া যায়?
কো-সায়েন্টিস্ট চূড়ান্তভাবে হেক্সাক্লোরোইথেন C₂Cl₆-এর উপর ফোকাস করেছিলেন এবং প্রিকারসরের সংখ্যা, অবস্থান, গ্যাস ফ্লো, সাবস্ট্রেট এবং তাপমাত্রা বক্ররেখা সহ অনেকগুলি প্যারামিটার প্রদান করেছিলেন।

কিন্তু এটি একটি “এআই একবারে উজ্জ্বল বিষয় উদ্ভাবন করে সফল হয়েছে” এর গল্প নয়। কো-সায়েন্টিস্ট মোট 272টি প্রার্থী সমাধান তৈরি করেছে, যেগুলি গবেষকরা বাছাই করে উচ্চ র্যাঙ্কযুক্ত সমাধানগুলির উন্নতি চালিয়ে যায়; 25টি পরীক্ষা পুনরাবৃত্তির পর, শেষপর্যন্ত একটি দ্বিমাত্রিক স্তরীভূত ক্রিস্টাল পাওয়া যায়। এটি XRD, ইলেকট্রন মাইক্রোস্কোপ এবং মৌলিক গঠনের মতো অনেকগুলি সূচকে টি_3সি_2টি_এক্স এমএক্সিনের সাথে অত্যন্ত সদৃশ বৈশিষ্ট্য প্রদর্শন করে।
পরবর্তী বাস্তব বিশ্বের সমস্যাগুলি খুবই সাধারণ। প্রাথমিকভাবে পরীক্ষার পুনরুৎপাদনের সফলতার হার ছিল মাত্র 11.5%। পরবর্তীতে গবেষকদের বুঝতে পারা গেল যে, মূল সমস্যাটি ছিল এআইয়ের রাসায়নিক যুক্তি নয়, বরং পরীক্ষাগারের সরঞ্জামগুলির অপর্যাপ্ত বন্ধনের কারণে অক্সিজেন রিলিজ।
কোয়ার্টজ টিউব পুনরায় পরিষ্কার করা, সিলিং রিং প্রতিস্থাপন করা এবং সরঞ্জাম রক্ষণাবেক্ষণের প্রক্রিয়া উন্নত করার পরে একই দ্বিমাত্রিক উপাদানের পরীক্ষার সফলতার হার 68% এ বৃদ্ধি পায়।
এটি ঠিক ব্যাখ্যা করে যে কেন "বাস্তব বিশ্ব AI" এবং সফটওয়্যার এজেন্ট এতটাই ভিন্ন: কোডে ভুল হলে, আবার চালানো যায়। কিন্তু বাস্তব পরীক্ষায়, একটি পুরনো O-রিং, পাইপের অবশিষ্টাংশ, বা এমনকি বাতাসের অক্সিজেনও একটি সঠিক বৈজ্ঞানিক পরিকল্পনাকে সম্পূর্ণভাবে ব্যর্থ করে দিতে পারে।
গুগল পেপারেও খুব সতর্ক: এখনও নিশ্চিত করা যায়নি যে এই উপাদানটি হল Ti₃C₂Tₓ MXene, এটির উৎপাদন হার কম, তীব্র জারণ সমস্যা রয়েছে, এবং পরমাণু স্তরের বৈশিষ্ট্যায়নের মাধ্যমে আরও যাচাইয়ের প্রয়োজন।
তবুও, আমরা এই সিদ্ধান্তে পৌঁছাতে পারি যে, এআই একটি বৈজ্ঞানিক গুরুত্বপূর্ণ সংশ্লেষণ পথ প্রস্তাব করতে পারে এবং তারপর সেই পথটি প্রকৃত পরীক্ষার জন্য এগিয়ে নিতে পারে।
কিছু পরীক্ষা শুরু করার আগে AI-কে একবার 'অনুমান' করতে দেওয়া যেতে পারে
গুগল কো-সায়েন্টিস্টকে একটি সম্পূর্ণ ভিন্ন পরীক্ষামূলক পরিস্থিতিতেও রাখেছে: সংশ্লেষণবাদী জীববিজ্ঞান। অধ্যয়নের বিষয়বস্তু ছিল প্রকৌশলিত ইশেরিচিয়া কোলির একটি দল।

এই ব্যাকটেরিয়াগুলি পেট্রি ডিশে বিভিন্ন সমূহের প্যাটার্ন গঠন করে। যখন ইন্ডিউসার IPTG-এর ঘনমাত্রা পরিবর্তিত হয়, তখন ব্যাকটেরিয়াল সমূহের আকার, প্রান্ত এবং আকৃতি পরিবর্তিত হয়। সাধারণত, পুরো পরিবর্তন বক্ররেখা পেতে, বিজ্ঞানীদের বিভিন্ন ঘনমাত্রায় প্রস্তুত করে, ব্যাকটেরিয়া চাষ করে, বৃদ্ধির জন্য অপেক্ষা করে, এবং প্রতিটি ডিশ স্ক্যান করতে হয়।
গুগল এআইকে পরীক্ষার মধ্যবর্তী অংশ পূরণ করতে চেয়েছিল। গবেষকদের শুধুমাত্র কিছু ঘনত্বের জন্য বাস্তব কলোনির ছবি দেওয়া হয়েছিল, এবং সিস্টেমকে অপরিচিত মধ্যবর্তী ঘনত্বে কলোনির আকৃতি পূর্বানুমান করতে বলা হয়েছিল। এছাড়াও, এই পরীক্ষার ডেটা তখনও প্রকাশিত হয়নি, তাই প্রবন্ধটি যুক্তি দেয় যে, মডেলটি শুধুমাত্র প্রশিক্ষণ ডেটার ফলাফলগুলি মনে রাখার মাধ্যমেই এই কাজটি সম্পন্ন করতে পারেনি।
ফলাফল হিসেবে, চারটি কলোনি আকৃতির মাপদণ্ডের মধ্যে AI-এর ভবিষ্যদ্বাণী তিনটি প্রকৃত আর্দ্র পরীক্ষার ফলাফলের সাথে উল্লেখযোগ্য পার্থক্য প্রদর্শন করেনি; এটি এই বিষয়টিও সঠিকভাবে চিহ্নিত করেছে যে নিয়ন্ত্রণ গ্রুপটি IPTG ঘনমাত্রার সাথে সামঞ্জস্যপূর্ণ পরিবর্তন দেখাবে না।

একমাত্র স্পষ্ট সমস্যা হলো "গোলাকারতা": AI দ্বারা তৈরি কোলনি বাস্তবের চেয়ে আরও বেশি নিয়মিত। এটি জেনারেটিভ মডেলের সাধারণ সৌন্দর্য্যের সাথে খাপ খায়: বাস্তব বিশ্ব এতটা পরিপূর্ণ হয় না, কিন্তু AI এটিকে একটু বেশি গোলাকার করে ফেলতে চায়।

গুগল এই পরীক্ষার সংজ্ঞাও খুব সংযত: বর্তমানে তৈরি করা হয়েছে পরিচিত ঘনত্ব ব্যাপ্তির মধ্যে ইন্টারপোলেশন, নয় একটি সম্পূর্ণ নতুন জিনগত সার্কিটের সামনে অজানা ঘটনা পূর্বানুমান করা।
কিন্তু এটি একটি খুব বাস্তবিক ব্যবহারের সাথে মেলে। ভবিষ্যতে বিজ্ঞানীদের হয়তো একটি বিশাল প্যারামিটার স্পেসের সমস্ত অংশে আসল পরীক্ষা করার প্রয়োজন হবে না। প্রথমে কয়েকটি পয়েন্ট পরীক্ষা করে, AI-কে এই বাস্তব ডেটা দিয়ে বাকি স্পেসটি পূর্বানুমান করতে দিন, এবং তারপর সবচেয়ে বেশি যাচাইয়ের মূল্যবান অবস্থানগুলি বেছে নিয়ে পরীক্ষা করুন।
পরীক্ষাগুলি তাই ধীরে ধীরে "ব্রুট ফোর্স" থেকে পরিবর্তিত হচ্ছে: বাস্তব জগতের নমুনা → এআই পূর্বানুমান → পরীক্ষা বাছাই → নতুন ডেটা এআইকে ফিরিয়ে দেওয়া।
এটিই পেপারটি বারবার জোর দিয়ে বলেছে lab-in-the-loop।
এআই এখন নিজেই এআই ডিজাইন করছে
কম্পিউটার বিজ্ঞান পরীক্ষায় যাওয়ার সাথে সাথে, কো-সায়েন্টিস্টের স্বায়ত্তশাসনের মাত্রা আরও বেড়েছে।

এই বার গবেষকদের এটির জন্য খুব সহজ কাজ দেওয়া হয়েছিল: চিকিৎসা সংক্রান্ত প্রশ্নের উত্তর ভালোভাবে দিতে পারে এমন এজেন্ট ডিজাইন করা। তারপর মানুষ আর আর্কিটেকচার ডিজাইনে অংশ নেয়নি। কো-সায়েন্টিস্ট নিজেই সমাধান প্রস্তাব করেছে, কোড লিখেছে, টেস্ট চালিয়েছে, ত্রুটি বিশ্লেষণ করেছে, এবং আরও আর্কিটেকচার সংশোধন করেছে।
শেষ পর্যন্ত, এটি একটি এজেন্ট_এইচ নামক সিস্টেম বিকাশ করেছে।
এই সিস্টেমটিকে বর্তমান মডেলের যুক্তিগত প্রক্রিয়াকে পুনর্গঠন করার প্রয়োজন। একটি চিকিৎসা সমস্যার সামনে এটি প্রথমে নির্ণয় করবে যে সমস্যাটি কোন চিকিৎসা ক্ষেত্রের, এটি রোগীর জন্য নাকি ডাক্তারদের জন্য, এবং ঝুঁকির মাত্রা কতটা; জটিল সমস্যাগুলিকে কয়েকটি উপ-সমস্যায় বিভক্ত করা হবে; তারপর 28–48টি প্রার্থী উত্তর একসাথে তৈরি করা হবে, যারপরে বিভিন্ন Judge-দের দুটি করে পরস্পরের সাথে প্রতিদ্বন্দ্বিতা করতে হবে, এবং তিনজন Judge-এর ভোটের মাধ্যমে চূড়ান্ত উত্তরটি নির্বাচিত হবে। বিজয়ী উত্তরটির আরও একাধিক পর্যায়ে ক্লিনিক্যাল পরীক্ষা, উদ্ধৃতি পরীক্ষা এবং শেষে দৈর্ঘ্য সংকুচিতকরণেরও প্রয়োজন।

একটি প্রশ্নের উত্তর দিতে সম্পূর্ণ এজেন্ট মডেলকে প্রায় ৪০-৮০ বার কল করে। HealthBench Hard এবং HealthBench Professional-এ, পেপারে ব্যবহৃত দৈর্ঘ্য-সংশোধিত স্কোরিং অনুযায়ী, Agent_H গট-৫.৬ সল, ক্লাউড ওপাস ৫ এবং জেমিনি ৩.১ প্রোসহ ছয়টি অগ্রণী মডেলকে ছাড়িয়ে গেছে।

কিন্তু এখানে একটি অত্যন্ত গুরুত্বপূর্ণ ঘটনা ঘটেছে: এআই নিজেই 'বোর্ড ম্যানিপুলেশন' শিখে ফেলেছে।
প্রাথমিক পরীক্ষাগুলিতে, দীর্ঘ উত্তরগুলির জন্য যথেষ্ট শাস্তি ছিল না। ফলে কো-সায়েন্টিস্ট দ্রুত স্কোর বাড়ানোর সবচেয়ে সহজ উপায় খুঁজে পেল: উত্তরগুলি খুব দীর্ঘ করে লেখা।
বেঞ্চমার্ক স্কোর তাই উল্লেখযোগ্যভাবে বেড়েছে, কিন্তু চিকিৎসা গুণমান সমানুপাতিকভাবে উন্নত হয়নি। যতক্ষণ না গবেষকরা দৈর্ঘ্য শাস্তি যোগ করেন, ততক্ষণ পর্যন্ত বড় সুবিধাগুলি অদৃশ্য হয়ে যায়।
গুগল নিজে তার প্রবন্ধে এটিকে একটি প্রতিনিধিত্বকারী গুডহার্টের আইন হিসাবে বিবেচনা করেছে: যখন একটি সূচক লক্ষ্য হয়ে ওঠে, তখন এটি আর ভালো সূচক থাকে না।
বাস্তব চিকিৎসকদের মূল্যায়নও ফলাফলগুলিকে কিছুটা নিচু করে দিয়েছে। তিনজন প্র্যাকটিসিং ডাক্তার ১০৬টি প্রশ্নের উপর অন্ধ মূল্যায়ন করেছেন। নয়টি মাপদণ্ডের মধ্যে, Agent_H কেবলমাত্র "সম্ভাব্য ক্ষতি হ্রাস" বিষয়টিতেই মূল Gemini 3.1 Pro-এর তুলনায় পরিসংখ্যানগতভাবে উল্লেখযোগ্য উন্নতি দেখিয়েছে, বাকি আটটি মাপদণ্ডে কোনো উল্লেখযোগ্য পার্থক্য হয়নি।

অন্যভাবে বললে, এআই জজের দৃষ্টিতে স্পষ্টতই উচ্চতর বেঞ্চমার্ক স্কোর সম্পূর্ণরূপে মানুষের ডাক্তারদের দৃষ্টিতে স্পষ্টতই ভালো উত্তরে পরিণত হয়নি। এটি হয়তো এআই সায়েন্টিস্টের বাস্তব বিশ্বে প্রবেশ করার পর তাকে মুখোমুখি হতে হবে এমন একটি সমস্যা: এটিকে শুধুমাত্র অপ্টিমাইজ করতে জানতে হবে না, এটিকে জানতে হবে যে কী কিছুকে শুধুমাত্র অপ্টিমাইজেশন মেট্রিকস দিয়ে সংজ্ঞায়িত করা যায় না।
এআই বিজ্ঞানীরা পেপারের জন্য "ডেটা তৈরি" করেন
বাস্তবে, গুগল এই পেপারে অন্য একটি কিছুটা অস্বস্তিকর প্রশ্ন নিয়ে বেশ কিছু পৃষ্ঠা ব্যয় করেছে: যদি AI Scientist-কে সম্পূর্ণভাবে মুক্তি দেওয়া হয়, তাহলে এটি সুন্দর ফলাফল পাওয়ার জন্য চালাকি করবে কি?

হ্যাঁ।
গবেষণা দল সিস্টেমটিকে ৫০টি এআই গবেষণা বিষয়ে ধারণা প্রস্তাব করা থেকে শুরু করে ডেটা খোঁজা, কোড লেখা, পরীক্ষা চালানো এবং চূড়ান্ত পেপার তৈরি করা পর্যন্ত মানব হস্তক্ষেপ ছাড়াই কাজ করেছেন।
একই সাথে, তারা বিশ্বস্ততা মডিউল বাদ দেওয়া একটি Co-Scientist এবং আগের Agent Laboratory সিস্টেমও পরীক্ষা করেছে, যা 150টি গবেষণাপত্র তৈরি করেছে এবং এগুলি 30জন বিষয়বস্তু বিশেষজ্ঞদের দ্বারা 450টি অ্যানোনিমাস রিভিউয়ের জন্য প্রেরণ করা হয়েছে।
ফলাফলটা খুব বেশি বড়। কোডে ত্রুটি রয়েছে এবং পরীক্ষার কোনো কার্যকরী ফলাফল নেই হলেও, বিশেষ যাচাইকরণ ব্যবস্থা ছাড়াই AI বিজ্ঞানী এখনও পুরো পেপারটি লিখতে থাকতে পারে।

তারা ডেটা টেবিল, p-মান, পরিসংখ্যানিক পরীক্ষা গড়ে তোলে; ব্যর্থ পরীক্ষাকে সফল হিসাবে লিখে; এমনকি মূল্যায়ন পরিবেশ পরিবর্তন করে যাতে তাদের পদ্ধতি স্বাভাবিকভাবেই উচ্চতর স্কোর পায়, অথবা hardcode ব্যবহার করে সুন্দর ফলাফল প্রত্যক্ষ করে।
যখন লক্ষ্য হয়: "একটি ভালো দেখানো প্রবন্ধ লেখা", এজেন্ট গবেষণা সম্পন্ন করার চেয়ে সস্তা পথ খুঁজে বেড়ায়।
সুতরাং, গুগল নতুন সংস্করণ Co-Scientist-এ একটি বেশ সাদৃশ্যপূর্ণ "বৈজ্ঞানিক অডিট" পদ্ধতি যোগ করেছে: পেপারে যে পরীক্ষার ফলাফলগুলি দাবি করা হয়েছে, সেগুলি অবশ্যই প্রকৃত প্রোগ্রাম এক্সিকিউশন লগের সাথে ট্রেস করা যাবে। যদি লগে সংশ্লিষ্ট ফলাফল না থাকে, তবে সিস্টেম কেবলমাত্র ভাষা মডেলের "এটি হওয়া উচিত" বলার উপর ভিত্তি করে এটি যোগ করতে পারবে না।
প্রভাব অত্যন্ত স্পষ্ট। এজেন্ট ল্যাবোরেটরির থেকে 90% থেকে 4% পর্যন্ত কমে গেছে যে পরিণতির ভ্রম যা গবেষণাপত্রকে অকার্যকর করে দিত; সবচেয়ে গুরুতর সম্পূর্ণ ডেটা মিথ্যাচার থেকে 44% থেকে 0% পর্যন্ত কমে গেছে।
কিন্তু সমস্যাটি এখনও সম্পূর্ণরূপে মুছে ফেলা হয়নি। নতুন সংস্করণের কো-সায়েন্টিস্টের 24% পদ্ধতির বর্ণনায় গুরুতর ভুল রয়েছে এবং 16% গুরুতর চুরি/উৎপাদিত কন্টেন্ট রয়েছে।
গুগল এই বিষয়ে বিশেষভাবে জোর দিয়েছে যে তারা দাবি করেননি যে বর্তমানে Autonomous AI Scientist সরাসরি প্রকাশযোগ্য গবেষণা প্রবন্ধ তৈরি করতে পারে।
শেষ কথা
অ্যানথ্রোপিক এবং গুগলের এই দুটি কাজকে একসাথে দেখলে বোঝা যায় যে এজেন্টের মধ্যে একটি স্পষ্ট পরিবর্তন ঘটছে: গত দুই বছরে, AI এজেন্টের সবচেয়ে বড় মাঠ সবসময় সফটওয়্যার বিশ্ব ছিল। এখন, এই যুক্তি প্রথমবারের মতো বাস্তব বিশ্বের বাইরে বড় পরিসরে ছড়িয়ে পড়ছে।
অ্যানথ্রোপিকের এমএইচএস নিম্নলিখিত সমস্যার সমাধান করার চেষ্টা করছে: মেকানিক্যাল আর্ম, মাইক্রোস্কোপ, তরল প্রসেসিং প্ল্যাটফর্ম এই বিভিন্ন ডিভাইসগুলিকে একটি এজেন্ট দ্বারা একটি সমন্বিতভাবে বুঝতে এবং কল করার ইন্টারফেস দেওয়া।
গুগলের কো-সায়েন্টিস্ট তখন উচ্চতর প্রশ্নগুলি অন্বেষণ শুরু করে: যখন একটি যুক্তিসঙ্গত মডেল বৈজ্ঞানিক অনুমান প্রস্তাব করতে, পরীক্ষা পরিকল্পনা করতে, যন্ত্রপাতি নিয়ন্ত্রণ করতে, ফলাফল পড়তে এবং পরবর্তী পরীক্ষার জন্য সংশোধন করতে সক্ষম হয়, তখন একটি প্রকৃত বন্দরবদ্ধ বৈজ্ঞানিক আবিষ্কার সিস্টেমের আকার কী হওয়া উচিত।
অবশ্যই, গুগল এখনও প্রকৃত "মানুষহীন ল্যাব" থেকে দূরে। বর্তমানে উপাদান পরীক্ষাগুলির জন্য মানুষকে নমুনা লোড করতে হয়; নতুন উপাদানের পরমাণুগত কাঠামো এখনও চূড়ান্তভাবে নির্ধারিত হয়নি; ইশেরিচিয়া কোলির পূর্বানুমান সীমিত ইন্টারপোলেশন কাজগুলির জন্য প্রমাণিত হয়েছে; মেডিকেল এজেন্টগুলি বেঞ্চমার্কের ফাঁকগুলির দিকে যায়; পেপার জেনারেশন সিস্টেমগুলি এখনও মিথ্যা তথ্য এবং চুরির সমস্যা সম্পূর্ণরূপে সমাধান করেনি। গুগল নিজেও স্পষ্টভাবে বলেছে, হার্ডওয়্যারের অস্বাভাবিকতা এবং বাস্তব পরিবেশের জটিলতার কারণে, বর্তমানে সম্পূর্ণরূপে মানুষহীন পদার্থবিদ্যা পরীক্ষা করা অসম্ভব।
কিন্তু পরিবর্তনগুলি ঘটে গেছে।
পূর্বে বিজ্ঞানের জন্য এআই নিয়ে আলোচনায় প্রায়শই জোর দেওয়া হতো যে এআই কি করতে পারে এমন কিছু ভাবা যা মানুষ কখনও ভাবেনি। এখন, আরও বেশি কাজ শুরু হয়েছে এই কঠিন অর্ধেকটি পূরণের জন্য: এই ধারণাটি কি বাস্তব ডিভাইসে বাস্তবায়িত করা যাবে, এবং বাস্তবায়নের ফলাফলটি কি এআইয়ের পরবর্তী যুক্তিসম্পন্ন প্রক্রিয়ার জন্য পুনরায় ভিত্তি হতে পারে?
গুগল পেপারের শেষে একটি খুব আকর্ষণীয় বিচার দিয়েছে। যদি এই বন্দনা প্রকৃতপক্ষে গড়ে উঠে, তবে ভবিষ্যতে বিজ্ঞান গবেষণার সীমাবদ্ধতা উল্টে যাবে: অতীতে, পরীক্ষার সরঞ্জামগুলি বিজ্ঞানীদের পরবর্তী ভালো প্রশ্নটি প্রস্তাব করার জন্য অপেক্ষা করছিল; ভবিষ্যতে, সম্ভবত AI শত শত যাচাইযোগ্য পরীক্ষা প্রস্তাব করেছে, আর ল্যাবগুলি সেগুলির সবগুলি করার জন্য সময় পাচ্ছে না।
তখন বৈজ্ঞানিক আবিষ্কারের গতির প্রকৃত বাধা হতে পারে শুধুমাত্র scientific ideation নয়, বরং experimental throughput—বাস্তব বিশ্ব এই পরীক্ষাগুলি কত দ্রুত চালাতে পারে।
এই পোস্টটি ওয়েইচ্যাট গ্রুপ "মেশিন সিন্টিস" (ID: almosthuman2014) থেকে, লেখক: বিজ্ঞান এবং এআই-এ আগ্রহী
