গুগল এআই গবেষণা প্রতারণা প্রতিরোধে সায়েন্স ওয়ান ফ্রেমওয়ার্ক চালু করেছে

iconMetaEra
শেয়ার
AI summary iconসারাংশ
২০২৬ সালের ৩০ জুলাই, মেটাEra-এর উপর ভিত্তি করে গুগল সায়েন্স ওয়ান ফ্রেমওয়ার্ক চালু করে, যা এআই গবেষণা প্রতারণার সমাধানের জন্য তৈরি করা হয়েছে। এই ফ্রেমওয়ার্কটি চেইন-অফ-ইভিডেন্স (CoE) ব্যবহার করে প্রতিটি উপসংহারকে যাচাইযোগ্য উৎস, কোড এবং পরীক্ষার সাথে সংযুক্ত করে। এটি শূন্য কল্পিত উদ্ধৃতি এবং সম্পূর্ণভাবে পুনরুৎপাদনযোগ্য ফলাফল অর্জন করেছে। বিষয়বস্তু তৈরির সময় রিয়েল-টাইম প্রমাণ সংগ্রহ একীভূত করা হয়েছে। সিস্টেমটি MLE-Bench এবং Parameter-Golf-এ ভালো স্কোর অর্জন করেছে। গুগল বলছে, সায়েন্স ওয়ান হলো একটি পরীক্ষামূলক প্রোটোটাইপ, এখনও উৎপাদনের জন্য উপযুক্ত নয়। এই এআই + ক্রিপ্টো সংবাদ আপডেটটি গবেষণা সম্পর্কিত সততা-এর ওয়েব-ভিত্তিক সংবাদের উপর জোর দিচ্ছে।
গুগল রিসার্চ ২০২৬ সালের ৩০ জুলাই সায়েন্স ওয়ান ফ্রেমওয়ার্ক প্রকাশ করে, যার কেন্দ্রে একটি "সাক্ষ্য শৃঙ্খল" (Chain-of-Evidence, CoE) মেকানিজম রয়েছে, যা AI-এর প্রতিটি সিদ্ধান্তকে উৎস, কোড এবং পরীক্ষার রেকর্ডের সাথে বাঁধে।

লেখক, উৎস: 0x9999in1, ME News



TL;DR

  • গুগল রিসার্চ ২০২৬ সালের ৩০ জুলাই সায়েন্স ওয়ান ফ্রেমওয়ার্ক প্রকাশ করে, যার কেন্দ্রে একটি "সাক্ষ্য শৃঙ্খল" (Chain-of-Evidence, CoE) মেকানিজম রয়েছে, যা AI-এর প্রতিটি সিদ্ধান্তকে উৎস, কোড এবং পরীক্ষার রেকর্ডের সাথে বাঁধে।
  • বর্তমান এআই গবেষণা সিস্টেমের পুরনো সমস্যাগুলি খুব গভীর: উদ্ধৃতি গড়ে তোলা, পুনরাবৃত্তি করা যায় না এমন স্কোর, পদ্ধতির বর্ণনা এবং কোডের মধ্যে অসামঞ্জস্য। বেসলাইন সিস্টেমের কল্পিত উদ্ধৃতির হার পর্যন্ত 21% এবং স্কোরের পুনরাবৃত্তির হার মাত্র 42%।
  • Science One-এর ফলাফল হল: শূন্য মিথ্যা উদ্ধৃতি, সমস্ত স্কোর যাচাইকৃত, এবং পদ্ধতি ও কোডের সামঞ্জস্যতা সর্বোচ্চ। প্রকাশিত হয়েছে যে এটি তৈরি করা 337টি উদ্ধৃতি সম্পূর্ণরূপে বাস্তব, 12টি পুনরাবৃত্তযোগ্য পরীক্ষা সম্পূর্ণভাবে মিলে গেছে, এবং 15টি গবেষণাপত্রের মধ্যে 14টি কোডের সাথে সামঞ্জস্যপূর্ণ।
  • মূল ডিজাইন হল "লেখার সময় সন্ধান করা", এবং "লেখার পরে রেফারেন্স যোগ করা" নয়। রেফারেন্সগুলি মডেলের মেমোরি থেকে আসে না, বরং Semantic Scholar API থেকে বাস্তব অনুসন্ধান করে আসে।
  • গুরুত্বপূর্ণ বিচার: Science One "সৎ" হওয়ার জন্য "ক্ষমতা" বিসর্জন দেয়নি। এটি MLE-Bench-এ 2 স্বর্ণ এবং 2 রৌপ্য জিতেছে এবং Parameter-Golf-এ সময়ের সেরা ফলাফল অর্জন করেছে।
  • এই ঘটনার প্রকৃত অর্থ শুধু একটি এআই যে পেপার লিখতে পারে তার মধ্যে নয়, বরং এটি প্রথমবারের মতো "যাচাইযোগ্য"কে আর্কিটেকচারের ভিত্তি হিসেবে গ্রহণ করেছে, যা আগে শুধু পরবর্তী সংশোধন ছিল।

একটি কষ্টদায়ক প্রশ্ন দিয়ে শুরু করি: এআই দ্বারা লেখা পেপার, আপনি বিশ্বাস করতে পারেন?

দুই বছর ধরে এআই গবেষণা সিস্টেমের অগ্রগতি ভয়ঙ্কর।

এটি গবেষণাপত্র পড়তে পারে। অনুমান তৈরি করতে পারে। পরীক্ষা চালাতে পারে। একটি সম্পূর্ণ কাঠামোবদ্ধ, পেশাদার ভাষায় লেখা গবেষণাপত্র শুরু থেকে শেষ পর্যন্ত লিখতে পারে। আপনি একবার দেখলেই কোনো ত্রুটি খুঁজে পাবেন না।

কিন্তু সমস্যাটি এই "এক নজরে দেখা" এর মধ্যেই লুকিয়ে আছে।

এক নজরে কোনো সমস্যা নেই, কিন্তু গভীরভাবে খোঁজাখুঁজি করলে কেমন?

গুগল রিসার্চ এই বিষয়টি গভীরভাবে পরীক্ষা করেছে। তারা পাঁচটি প্রধান স্বায়ত্তশাসিত গবেষণা সিস্টেমকে নিয়ে, পাঁচটি সিস্টেম অপ্টিমাইজেশন টাস্কে মোট ৭৫টি পেপার তৈরি করেছে, এবং প্রতিটি পেপারের জন্য প্রশ্ন করেছে: আপনি যে গবেষণাপত্রটি উদ্ধৃত করেছেন, তা কি প্রকৃতপক্ষে বিদ্যমান? আপনি যে স্কোরটি প্রকাশ করেছেন, কোডটি পুনরায় রান করলেও কি সেই স্কোরটি মিলবে? আপনি যে অ্যালগরিদমটি ব্যবহার করার দাবি করছেন, কোডে কি সত্যিই এভাবে লেখা হয়েছে?

ফলাফল খারাপ দেখাচ্ছে।

প্রতিটি বেসলাইন সিস্টেমে কমপক্ষে একটি সিস্টেমগত ত্রুটি রয়েছে। হ্যালুসিনেশন রেফারেন্স হার পর্যন্ত 21%—অর্থাৎ, প্রতি পাঁচটি রেফারেন্সের মধ্যে একটি সম্ভবত একটি বিদ্যমান না থাকা পেপারের দিকে ইঙ্গিত করে। স্কোর ভেরিফিকেশনের পাস রেট শুধুমাত্র 42%। পদ্ধতি এবং কোডের সামঞ্জস্যতা 20% থেকে 80% এর মধ্যে ভ্রমণ করে।

এই 42% টা ভাবুন। অর্ধেকের বেশি পেপারে প্রকাশিত ফলাফলগুলি কোড পুনরায় চালিয়ে পুনরায় উত্পাদন করা যায় না।

এটি একটি ছোট বাগ নয়। এটি বিশ্বাসের পতন।

বিজ্ঞান গবেষণার ক্ষেত্রে, মূল যুক্তি হল "পুনরাবৃত্তিযোগ্যতা" এবং "অনুসরণযোগ্যতা"। একটি গবেষণা পত্রের মূল্য এটি পড়তে কতটা সহজ তার উপর নির্ভর করে না, বরং এটি নির্ভর করে অন্যরা কি এর রেফারেন্স, কোড এবং ডেটা অনুসরণ করে ধাপে ধাপে ফিরে আসতে পারে এবং এটি মিথ্যা বলছে না তা নিশ্চিত করতে পারে। AI গবেষণা পত্রের "পৃষ্ঠস্তরীয় গুণমান"কে সর্বোচ্চে নিয়ে গেছে, কিন্তু সবচেয়ে মৌলিক স্তম্ভটিকে সরিয়ে ফেলেছে।

যত বেশি প্রতিষ্ঠিত দেখায়, সমস্যাগুলি তত বেশি লুকিয়ে থাকে। এটাই সবচেয়ে বিপজ্জনক জায়গা।

গুগলের উত্তর: বিশ্বাসের উপর নয়, চেইনের উপর

সায়েন্স ওয়ানের ধারণা, সহজ কথায়, খুব সাধারণ।

যেহেতু আপনি এআইকে নিজ থেকে সৎ হতে বিশ্বাস করতে পারেন না, তাই এটিকে নিজ থেকে কাজ করার আশা করবেন না। এটিকে শৃঙ্খলে বাঁধুন।

এই চেইনটি হল "সাক্ষ্য চেইন" (Chain-of-Evidence)।

গুগল এটির জন্য একটি অত্যন্ত সঠিক উপমা দিয়েছে: ডেটাবেস ক্ষেত্রে এসিড নামে একটি ধারণা আছে, যা আপনার ডেটাবেস কীভাবে তৈরি করা হয়েছে তা বিবেচনা করে না, শুধু একটি লেনদেনকে "বিশ্বস্ত" হতে হলে কী কী বৈশিষ্ট্য পূরণ করতে হবে তা নির্ধারণ করে। প্রমাণ শৃঙ্খলাও ঠিক একইভাবে। এটি আপনাকে কীভাবে একটি বৈজ্ঞানিক এজেন্ট তৈরি করতে হবে তা নির্দিষ্ট করে না, শুধু এটি বলে: আপনি যা উৎপাদন করছেন, তা বিশ্বস্ততা অর্জনের জন্য কী কী শর্ত পূরণ করতে হবে।

একটি নীতি, দুটি অংশ।

প্রথম অর্ধেক হল সম্পূর্ণতা: পেপারের প্রতিটি বিবৃতি—যে কোনও উদ্ধৃতি, সংখ্যা, পদ্ধতির বর্ণনা বা উপসংহার—সবকিছুর জন্য একটি নথিভুক্ত প্রমাণের শৃঙ্খল থাকতে হবে।

দ্বিতীয় অর্ধেক সঠিকতা: এই চেইনটি বাস্তবিকভাবে এটির সাথে যুক্ত বাক্যটি বহন করতে পারতে হবে।

সহজ ভাষায় বললে: তুমি যা বলছ, তার জন্য একটা উৎস দিতে হবে; আর সেই উৎসটা আসলেই তোমার বক্তব্যকে প্রমাণ করতে পারবে।

কিভাবে বাস্তবায়ন করবেন? কীভাবে সময়সীমা নির্ধারণ করবেন।

বর্তমান সিস্টেমটি কীভাবে কাজ করে? প্রথমে একটি দীর্ঘ পেপার লেখা হয়, তারপর পিছনে ফিরে রেফারেন্স এবং প্রমাণ যোগ করা হয়। এটি মনে হয় যেন একটি গল্প আগে গড়ে তোলা হয়, তারপর সেটি প্রমাণ করার জন্য প্রমাণ খোঁজা হয়। যেখানে প্রমাণ মেলে না, সেখানে শুধুমাত্র গড়ে তোলা হয়। এইভাবেই মিথ্যা রেফারেন্সগুলির উৎপত্তি।

সায়েন্স ওয়ান বিপরীতে। এটি "এই বাক্যটি তৈরি করার মুহূর্তে" একসাথে প্রমাণ শৃঙ্খল তৈরি করে। দাবি এবং প্রমাণ একসাথে বেড়ে ওঠে, পরে সেলাই করা হয় না।

এই ক্রমের পরিবর্তনই পুরো বিষয়টির আত্মা।

একটি করে দেখুন: তিনটি মডিউল, প্রতিটি একটি মিথ্যে নিয়ন্ত্রণ করে

সায়েন্স ওয়ানের আর্কিটেকচার তিনটি অংশে বিভক্ত, যার প্রতিটি একটি নির্দিষ্ট প্রতারণার সম্ভাবনাকে সঠিকভাবে বাধা দেয়।

প্রথম ব্লক, সমস্যা তদন্তকারী, উদ্ধৃতি প্রতারণার দায়িত্ব নেয়।

এটি মডেলের "স্মৃতি" এর উপর নির্ভর করে উদ্ধৃতি প্রদান করে না। মডেলের স্মৃতি হলো কল্পনার জন্মস্থান—এটি এমন একটি পেপারকে "মনে রাখে" যা বাস্তবে বিদ্যমান নয়। Science One সরাসরি Semantic Scholar API-এর সাথে যুক্ত হয়ে একটি বাস্তব উদ্ধৃতি গ্রাফ তৈরি করে, প্রতিটি বিষয়ের জন্য সর্বোচ্চ 100টি পূর্ণাঙ্গ PDF পড়ে একটি সংগঠিত গবেষণা সারসংক্ষেপ তৈরি করে। চূড়ান্ত পেপারের প্রতিটি উদ্ধৃতি এই বাস্তব API অনুসন্ধানের ফলাফল, যা মডেলের স্মৃতির উপর নির্ভরতা সম্পূর্ণভাবে কেটে ফেলে।

উদ্ধৃতি হয় না "ভাবা" হয়, বরং "খোঁজা" হয়। এই ছুরি দিয়ে মিথ্যা উদ্ধৃতির মূল কাটা গেল।

দ্বিতীয় ব্লক, এনজিন খুঁজে পাওয়া, যা পরীক্ষার রেকর্ড প্রতারণার দায়িত্ব বহন করে।

এটি একাধিক শাখায় একসাথে সমাধান পরীক্ষা করতে সমান্তরাল "অন্বেষণ—উপযোগ" কৌশল ব্যবহার করে। প্রতিটি রাউন্ডে, একজন সলভার সমাধানটি বাস্তবায়ন করে, এবং একটি বিশেষায়িত মূল্যায়নকারী স্কোর দেয়। ভালো পারফরম্যান্স দেখানো শাখাগুলি পুনরাবৃত্তভাবে উন্নত করা হয়, এবং সমস্ত মূল মূল্যায়ন আউটপুটকে একটি কঠোর, শুধুমাত্র-পড়ারযোগ্য রেকর্ডে অন্তর্ভুক্ত করা হয়।

পড়ার জন্য মাত্র। এই দুটি শব্দ খুব গুরুত্বপূর্ণ। মূল স্কোর একবার রেকর্ড করে দেওয়া হলে, তা পরিবর্তন করা যাবে না। পরে থিসিস লিখতে গিয়ে একটি ভালো স্কোর দাবি করতে চাইছেন? দুঃখিত, বইটি এখানে, পরিবর্তন করা যাবে না।

তৃতীয় বিভাগ, পেপার লেখক এবং বিবৃতি যাচাইকারী, যিনি পদ্ধতি এবং কোডের মধ্যে অসামঞ্জস্যতা নিয়ন্ত্রণ করেন।

প্রকৃত পেপারটি রেন্ডার করার আগে, এটি প্রতিটি তথ্যগত দাবিকে স্ট্রাকচারাইজ করে, প্রতিটি বাক্যের সাথে একটি ইনলাইন সাক্ষ্য লেবেল যুক্ত করে এবং এটিকে কাজের কাজের কোনো নির্দিষ্ট আউটপুটের সাথে বাঁধে। তারপর একজন বিশেষজ্ঞ যাচাইকারী প্রতিটি দাবিকে এর দাবি করা উৎসের সাথে তুলনা করেন।

যদি মিলে না তবে কী করবেন? এখানে একটি বিশেষভাবে প্রাজ্ঞতাপূর্ণ বিষয় আছে। এটি সহজেই মুছে ফেলা নয়, বরং "পিছনে টানা" — কথাগুলোকে সাবধানে বলা, যাতে এটি প্রমাণের দ্বারা সমর্থিত পরিসরেই ফিরে আসে। প্রমাণ যতটা সমর্থন করে, ততটাই কথা বলুন।

ফুঁপানো নয়, কিন্তু বেশি ব্যয়ও করা হয় না। এই সঠিক ভারসাম্যটি একটি একক সমাধানের চেয়ে উন্নত।

গ্রেড শীট: সততার মূল্য, কি বোকা হয়ে যাচ্ছেন?

এখানে একটি তীক্ষ্ণ প্রশ্ন উঠতে পারে।

এতগুলো শৃঙ্খল দিয়ে এআইকে বাঁধলে, এটি প্রতিটি বাক্যের জন্য প্রমাণ খুঁজে ভয় পায়, কি এটি আর সাহসীভাবে অন্বেষণ করতে পারবে না? কি "সততা"-এর জন্য "দক্ষতা"-কে বিসর্জন দেওয়া হচ্ছে?

এই উদ্বেগ খুবই যুক্তিসঙ্গত। এটি সমস্ত "নিরাপত্তা" এবং "ক্ষমতা"-এর ক্লাসিক বিরোধ।

সায়েন্স ওয়ানের উত্তর হল: না।

সর্বপ্রথম সততা কলামটি দেখুন। একই অডিট প্রোটোকলের অধীনে—যা Google কে বলে CoE Audit, একটি ফরেনসিকের মতো অটোমেটেড রিভিউয়ার—প্রতিটি উদ্ধৃতি বাস্তবসময়ের শিক্ষাগত ডাটাবেসের সাথে পুনরায় যাচাই করা হয়—Science One চারটি পূর্ণতা চেকের সবগুলোতেই শীর্ষে। এর উদ্ধৃতিগুলোতে কোনো মিথ্যা নেই, প্রতিটি উদ্ধৃতি একটি বাস্তব, অনুসন্ধানযোগ্য গবেষণাপত্রের দিকে নির্দেশ করে; স্কোর যাচাইকরণ পারফেক্ট; পদ্ধতি এবং কোডের সামঞ্জস্যতা সর্বোচ্চ। প্রকাশিত ডেটা অনুযায়ী, এটি 337টি উদ্ধৃতির সবগুলোই বাস্তব, 12টি পুনরাবৃত্তযোগ্য পরীক্ষার ফলাফলগুলোও সম্পূর্ণভাবে মিলছে, 15টি গবেষণাপত্রের 14টিতেই বাস্তব কোডের সাথে সামঞ্জস্যপূর্ণ।

বেসলাইনের সেই সব “হাইব্রিড নিউরাল-সিমবলিক সলভার” ইত্যাদি ভয়ঙ্কর নামগুলোর সাথে তুলনা করুন—শোনাচ্ছে অসাধারণ, কিন্তু কোড খুলে দেখলে দেখা যায় এটা শুধু একটি সাধারণ নির্ধারণমূলক হিউরিস্টিক নিয়ম। নামটা মানুষের জন্য, কোডই সত্য।

ক্ষমতা বিভাগটি আবার দেখুন।

ADRS বেঞ্চমার্কের পাঁচটি টাস্কে, Science One মানুষের বিশেষজ্ঞদের স্তরকে সমান করেছে বা ছাড়িয়েছে, যার মধ্যে দুটি (Cloudcast এবং EPLB) সমস্ত সিস্টেমের মধ্যে সর্বোত্তম পারফরম্যান্স অর্জন করেছে।

এই বৃত্তের বাইরে, এটি আরও কঠিন বাহ্যিক চ্যালেঞ্জগুলিতেও প্রতিদ্বন্দ্বিতা করেছে। MLE-Bench-এর পাঁচটি কঠিন Kaggle প্রতিযোগিতায়—যা মেডিকেল ইমেজিং, ফাইন-গ্রেনুলার শনাক্তকরণ এবং 3D পরিজ্ঞানকে কভার করে—এটি ২টি স্বর্ণপদক এবং ২টি রৌপ্যপদক অর্জন করেছে—যার মধ্যে 3D অবজেক্ট ডিটেকশনের প্রতিযোগিতায়, অন্যান্য সিস্টেমগুলি সম্পূর্ণভাবে ব্যর্থ হয়েছিল, কিন্তু এটি চ্যাম্পিয়নশিপ-স্তরের স্কোর অর্জন করেছিল। Parameter-Golf-এ, যেখানে হার্ডওয়্যার এবং ফাইল আকারের সীমা কঠোরভাবে নির্ধারিত, অন্যান্য সিস্টেমগুলি একটিও বৈধ সাবমিশন জমা দিতে পারেনি, কিন্তু এটি সমস্ত সীমাবদ্ধতা পূরণ করেছে এবং ২০২৬ সালের ২৭শে এপ্রিল পর্যন্ত সর্বোত্তম ফলাফলটি অর্জন করেছে। এবং এটি শুধুমাত্র হাইপারপ্যারামিটারগুলি টিউন করেই নয়, বরং সত্যিকারের নতুন অ্যালগরিদমিক পদ্ধতির আবিষ্কারের মাধ্যমে।

সুতরাং উত্তরটি স্পষ্ট: সৎ থাকুন, এটিকে বোকা করবেন না।

এটিই আমার সবচেয়ে বেশি গুরুত্ব দেওয়া বিষয়। যদি Science One শুধু সাবধানে কাজ করে পরিষ্কার হয়, তাহলে এর কোনো মূল্য নেই—কারণ কেউ একটি মন্দবুদ্ধি এবং সৎ বিজ্ঞান টুল ব্যবহার করবে না। কিন্তু এটি প্রমাণ করেছে যে, যাচাইযোগ্যতা এবং উচ্চ পারফরম্যান্স একসাথে অর্জন করা সম্ভব। এটিই "সৎভাবকে কঠোর সীমাবদ্ধতা হিসেবে নেওয়া"কে নৈতিক আহ্বান থেকে প্রকৌশলগতভাবে লাভজনক বিকল্পে পরিণত করেছে।

আমার মতামত: এটি গুরুত্বপূর্ণ, কিন্তু এটিকে অতিরঞ্জিত করার জন্য তাড়াহুড়ো করবেন না

এত ভালো কথা বলার পরে, দুটি ঠাণ্ডা পানির বালতি ঢেলে দিতে হবে।

প্রথম পাত্র: গুগল নিজেই শেষে স্পষ্টভাবে লিখেছে, সায়েন্স ওয়ান হল একটি পরীক্ষামূলক গবেষণা প্রোটোটাইপ, যা সরাসরি উৎপাদনের জন্য ব্যবহারযোগ্য কোনও টুল নয়।

এটি বিনয় নয়, এটি সীমানা। এটি যে পাঁচটি কাজ করে, সেগুলি সিস্টেম অপ্টিমাইজেশনের মতো "স্পষ্ট মূল্যায়নকারী এবং স্বয়ংক্রিয়ভাবে স্কোর দেওয়ার সক্ষম" ক্ষেত্র। অর্থাৎ, ভালো বা খারাপ মেশিন দ্বারা বস্তুনিষ্ঠভাবে নির্ধারণ করা যায়। কিন্তু প্রকৃত অগ্রগতির গবেষণা কেমন? অনেক অনুমানের মূল্য, অনেক উপসংহারের গুরুত্ব, সংক্ষিপ্ত সময়ের মধ্যে কোনো মূল্যায়নকারীই আপনাকে স্কোর দিতে পারে না। প্রমাণের শৃঙ্খলা "মিথ্যা উদ্ধৃতি" রোধ করতে পারে, কিন্তু "একটি সাধারণ সমস্যা বেছে নেওয়া" রোধ করতে পারে না। এটি সৎতা নিয়ন্ত্রণ করে, কিন্তু স্বাদ নয়।

দ্বিতীয় পাত্র: প্রমাণ শৃঙ্খলার নিজস্ব খরচ রয়েছে। প্রতিটি বিষয়ের জন্য ১০০টি PDF পড়ুন, প্রতিটি বাক্যের জন্য প্রমাণ তৈরি করুন, লেবেল সংযুক্ত করুন এবং আবার যাচাই করুন—এই প্রক্রিয়াটি মূল্যবান। এটি সত্যের অনুসন্ধানের সাথে সাথে ক্যালকুলেশনের ক্ষমতা এবং সময়ও ব্যয় করে। এটিকে বড়পরিসরে বিস্তার করার সময়, এই খরচগুলির হিসাবটি কীভাবে করা হবে, এখনও কোনও উত্তর নেই।

কিন্তু এই দুটি পাত্রের জল ফেলে দেওয়ার পরেও, আমি এটিকে একটি অবহেলিত বিষয় হিসাবেই মনে করি।

কেন?

কারণ এটি একটি ভিন্ন প্রশ্নের ফরম্যাট ব্যবহার করে।

গত দুই বছর ধরে সবাই জিজ্ঞাসা করেছে: কি এআই গবেষণা করতে পারে? এটি কতটা শক্তিশালী হতে পারে? সবাই সমাধানের ক্ষমতা, বোর্ডে স্কোরের তুলনা করছিল। সায়েন্স ওয়ান যে প্রশ্নটি তুলেছে, তা অন্য একটি মাত্রার: এআই দ্বারা তৈরি গবেষণাকে কি বিশ্বাস করা যায়?

এই দুটি প্রশ্ন একই রেস ট্র্যাকে নয়।

যখন আরও বেশি সিস্টেম সুন্দর সমাধান তৈরি করতে শুরু করবে, তখন সমস্যা সমাধানের ক্ষমতা আর পার্থক্য তৈরি করবে না। সেই সময়ে, তাদের মধ্যে পার্থক্য করবে তাদের আউটপুটকে বিশ্বাস করা যায় কিনা। গুগল "যাচাইযোগ্যতা"কে "প্রথম শ্রেণির নাগরিক" হিসাবে উত্থাপন করেছে, বলেছে এটি একটি আর্কিটেকচারাল সীমাবদ্ধতা হতে হবে, শুধুমাত্র পরবর্তীতে ঠিক করার জন্য নয়—আমি মনে করি, এই বিচারটি সঠিক, এবং এটি ঠিক সময়েই আসছে।

কারণ বিশ্বাস একটি জিনিস, এটি জমা করা খুব ধীরে হয়, কিন্তু ভেঙে পড়া খুব দ্রুত। যদি AI গবেষণা প্রাথমিক পর্যায়েই দেখাতে প্রতিশ্রুতিবদ্ধ, কিন্তু বাস্তবে ফাঁকা পেপারগুলির মাধ্যমে সমগ্র শিক্ষাগত সম্প্রদায়ের বিশ্বাসকে খরচ করে ফেলে, তাহলে পরবর্তীতে এটি ফিরিয়ে আনার খরচ অসহনীয় হয়ে উঠবে। Science One-এর কাজটি হলো, বিশ্বাসের ভিত্তি ভেঙে পড়ার আগেই, ভিত্তির মধ্যেই ইস্পাতের ছড়াগুলি পুনর্সজ্জিত করা।

শেষ অংশ

প্রথম প্রশ্নে ফিরে যাই: কি বিশ্বাস করবেন, AI লেখা পেপার?

Science One-এর আগে, সত্যি উত্তরটি হলো—খুব বেশি আত্মবিশ্বাস করা যায় না। এটি যত ভালোভাবে লেখা হবে, তত বেশি সতর্ক থাকা উচিত।

সায়েন্স ওয়ান এআইকে আরও বুদ্ধিমান করেনি। এটি অন্য একটি সাদামাটা কিন্তু আরও কঠিন কাজ করে: এআইকে তার প্রতিটি বক্তব্যের জন্য যাচাইযোগ্য প্রমাণ রাখতে শেখায়।

প্রয়োজনের চেয়ে বেশি বুদ্ধিমান এআই আছে।

নিজের জন্য দায়িত্ব নেওয়া একটি এআই শুধু শুরু হয়েছে।

এটি একটি ছোট পদক্ষেপ, একটি প্রোটোটাইপ, এখনও অসংখ্য সমস্যা সমাধান করা বাকি। কিন্তু দিশাটি সঠিক। কখনও কখনও, কোনো কিছুর প্রকৃত গুরুত্ব তার বর্তমানে কতটা দ্রুত চলার উপর নয়, বরং এটি যে মাপকাঠি বসিয়েছে তার উপর।

সায়েন্স ওয়ান মাপকাঠিটিকে "এটা কি ভালোভাবে লেখা হয়েছে" থেকে "এটা কি পরীক্ষার পরীক্ষা সহ্য করতে পারে" এ সরিয়ে দিয়েছে।

এই সরানোটাই মূল্যবান।

প্রসঙ্গ

  1. গুগল গবেষণা ব্লগ। সায়েন্স ওয়ান ফ্রেমওয়ার্ক: চেইন-অফ-ইভিডেন্স মাধ্যমে একটি যাচাইযোগ্য স্বায়ত্তশাসিত গবেষণা ফ্রেমওয়ার্ক, ২০২৬ সালের ৩০ জুলাই।
  2. গুগল ক্লাউড এআই গবেষণা। arXiv:2605.26340《Science One Framework / Chain-of-Evidence》 পেপার।
  3. AlphaSignal।《Google-এর Science One ফ্রেমওয়ার্ক এআই গবেষণার মিথ্যা উদ্ধৃতির সংকট সমাধান করে》, ২০২৬ সালের জুলাই।
  4. Zhiding Network. "Science One ফ্রেমওয়ার্ক: সাক্ষ্য চেইন-ভিত্তিক যাচাইযোগ্য স্বায়ত্তশাসিত গবেষণা সিস্টেম", 2026 সালের 31 জুলাই।
  5. সাকানা এআই। arXiv:2504.08066《দ্য এআই সায়েন্টিস্ট v2》(বেসলাইনের সাথে তুলনা)।
  6. OpenAI. GitHub প্রোজেক্ট প্যারামিটার-গল্ফ বেঞ্চমার্ক।
  7. arXiv:2410.07095 এমএলই-বেঞ্চ বেঞ্চমার্ক পেপার।
  8. arXiv:2510.06189 অটোমেটেড ডিজাইন অফ রিসার্চ সিস্টেমস (ADRS) বেঞ্চমার্ক।
দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।