ফ্রন্টিয়ার ল্যাবের মানুষ প্রায় কোনো পেপার পড়ে না?
OpenAI-এর একজন গবেষক একটি বাক্যে তিনটি শীর্ষ কনফারেন্সকে লক্ষ্য করেন: অতিরঞ্জন এবং প্রতারণার পরিমাণ অত্যধিক!

এই ঘটনার শুরু হয়েছিল একটি ICLR পেপার থেকে, যার ফলাফল এতটাই অসাধারণ যে এটি বুঝতে কষ্ট হচ্ছিল; ইন্টারনেট ব্যবহারকারীরা গবেষণা করে দেখেছিলেন যে এর "রহস্য"টি কী।

শীর্ষ কনফারেন্সে পেপার প্রকাশ এখন এমন হয়ে গেল?

প্রথমে দেখুন কোডটি ওপেন সোর্স কিনা, দ্বিতীয়ত পরীক্ষার পদ্ধতিতে কোনও 'অবৈধ পদ্ধতি' লুকিয়ে আছে কিনা, এবং তৃতীয়ত প্রাপ্ত ফলাফলগুলি কি মূল উপসংহারকে সমর্থন করে—এই ধাপে ধাপে প্রশ্ন করলে, শীর্ষ কনফারেন্সের কতগুলি পেপার পরীক্ষার মাপকাঠিতে দাঁড়াতে পারে?
এটা করেছে কেউ আসলেই।
105টির মধ্যে মাত্র 8টি যোগ্য
বছরের জুলাইয়ে, চিকাগো বিশ্ববিদ্যালয়ের কম্পিউটার বিজ্ঞান এবং ডেটা বিজ্ঞানের সহযোগী অধ্যাপক তান চেনহাওয়ের সহ-প্রতিষ্ঠাতা SAI একটি বৃহৎ "পরীক্ষামূলক সমালোচনা" ঘোষণা করে।
তারা নির্বাচন করেছে ICML 2026-এর সমস্ত 168টি ওরাল পেপার।
বর্তমান বছরে ICML-এ 23,918টি সাবমিশন পাওয়া গেছে, যার মধ্যে শুধুমাত্র 168টি অরাল যোগ্যতা অর্জন করেছে, যা প্রায় 0.7%।
অর্থাৎ, SAI যা পরীক্ষা করছে, তা দুই হাজারেরও বেশি সাবমিশনের মধ্যে থেকে বাছাই করা শীর্ষস্থানীয়।
প্রথমে সাধারণ সমালোচকদের মতো পেপার, পরীক্ষার ডিজাইন এবং ফলাফল পড়ার পাশাপাশি, SAI Review কোড, মডেল এবং ডেটা ডাউনলোড করে, পরিবেশ কনফিগার করে এবং পরীক্ষা চালায়, এরপর চলমান ফলাফলগুলি পেপারের মূল লেখার সাথে ধাপে ধাপে তুলনা করে।
SAI সমস্ত 168টি মৌখিক প্রস্তুতি পর্যালোচনা করেছে, যার মধ্যে শুধুমাত্র 104টি পেপারের কোড ওপেন-সোর্স ছিল, এবং চূড়ান্তভাবে 105টি পূর্ণাঙ্গ পুনরুৎপাদন সম্পন্ন করেছে।
তার মধ্যে, শুধুমাত্র 34টি 40% এর বেশি দাবি পুনরাবৃত্তি করেছে; 80% এর বেশি পুনরাবৃত্তি হওয়া শুধুমাত্র 8টি।

প্রতিটি পেপারে কমপক্ষে 1টি, 3টি বা 5টি যাচাইযোগ্য দাবি থাকা সত্ত্বেও, পুনরুৎপাদন স্কোরের মধ্যমা সর্বদা 28%–30% এ থাকে এবং সমগ্র বিন্যাসে বড় পরিবর্তন হয় না।

অপ্রচলিত, আগে থেকেই বন্ধ বা হার্ডওয়্যারের ক্ষমতার বাইরে যাওয়া পরীক্ষাগুলি বাদ দেওয়ার পরেও, পুনরুৎপাদন স্কোরের মধ্যমা মাত্র 42%–50%; যখন প্রতিটি গবেষণাপত্রে কমপক্ষে 3টি যাচাইযোগ্য দাবি থাকে, তখন মধ্যমা 42% এ স্থির হয়।
পুনরুৎপাদনে সবচেয়ে সাধারণ সমস্যাগুলি দেখা গেছে: কোড চালানো যাচ্ছে না, ফাইল অনুপস্থিত, নির্দেশাবলী অসম্পূর্ণ, নির্ভরশীলতা ক্ষতিগ্রস্ত, বা কোডের আউটপুট পেপারের সাথে মেলছে না।
আরও ৪টি পেপার এখন বন্ধ করে দেওয়া মডেলের উপর নির্ভর করে। পরবর্তী গবেষকদের জন্য, যদিও তারা টাকা এবং সময় খরচ করতে চায়, একই ফলাফল পুনরায় পাওয়া সম্ভব নয়।
SAI আরও দুটি বিশদ উদাহরণ উল্লেখ করেছে।
একটি পেপার একটি মূল মডেলের কেবলমাত্র 0.77% প্যারামিটার ট্রেনিং করাকে প্রধান বিক্রয় পয়েন্ট হিসাবে উপস্থাপন করেছে, কিন্তু প্রকাশিত চেকপয়েন্টগুলি আসলে 6.31% প্যারামিটার ট্রেনিং করেছে, যা দাবি করা সংখ্যার প্রায় 8 গুণ।
অন্য একটি গবেষণাপত্রে একটি বিচারক মডেল দ্বারা স্কোর করা বিশ্বস্ততা টেবিল উপস্থাপন করা হয়েছে, কিন্তু ওপেন-সোর্স কোডে এই বিচারক মডেলটি পাওয়া যায়নি, এবং টেবিলের সংখ্যাগুলি গণনা করার জন্য কোনও স্ক্রিপ্টও নেই।
নিম্ন মানের পেপার, উচ্চ আয়, কম ঝুঁকি
SAI-এর পুনরুৎপাদনের ফলাফল খুব খারাপ।
আরও খারাপ বিষয় হলো, এখানে পাওয়া সমস্যাগুলি কেবলমাত্র "শর্তাধীনভাবে পাওয়া যায়" এমন সমস্যা।
যাদের কোড নেই, তাদের প্রবন্ধগুলি সরাসরি 'অপরাজেয়'।

যদিও কোড সম্পূর্ণরূপে প্রকাশিত হয়, একটি গবেষণাপত্র যাচাই করতে যে সময়, শ্রম এবং অর্থ ব্যয় হয়, তা অত্যন্ত বড়, এবং শেষ ফলাফলও খুব খারাপ হয়, কীভাবে হতাশ হবে তা ভাবারও কথা।
Google Cloud-এর প্রকাশিত অন-ডিম মূল্যের ভিত্তিতে SAI-এর অনুমান অনুযায়ী, একটি ICML Oral পেপার পুনরায় চালানোর খরচের মধ্যকার মান 8,900 ডলার। 105টি পেপারের মধ্যে 17টি 10 ডলারের বেশি খরচ করে, এবং সবচেয়ে ব্যয়বহুল পেপারটি 2.2 মিলিয়ন ডলারের কাছাকাছি।
যত বেশি পেপার বড় পরিমাণে কম্পিউটিং পাওয়ারের উপর নির্ভরশীল হয়, তত বেশি স্বাধীনভাবে পুনরাবৃত্তি করা কঠিন হয়।
কোড না থাকলে অন্যরা পরীক্ষা করতে পারবে না; কোড থাকলেও এই খরচ বহন করতে পারবে এমন কেউ নাও থাকতে পারে।
অতএব, একটি সমস্যাপূর্ণ গবেষণাপত্র সহজেই পর্যালোচনা পার করতে পারে, উদ্ধৃত হতে পারে, এবং এটি রিজিউমেতে যোগ করে ভর্তি, শিক্ষকতা বা বড় ল্যাবের চাকরির সুযোগ অর্জন করা যেতে পারে।
কখনও কখনও ফলাফল মেলে না, মিটিংগুলি প্রায়ই পুনরায় পর্যালোচনা করা হয় না, এবং পেপারগুলি বাতিলও হতে পারে না।
এটিই মন্তব্য বিভাগে উল্লিখিত “খারাপ গবেষণা করলে লাভ হয়, কিন্তু প্রায় কোনও খরচ হয় না”।

পেপার পড়বেন না, কিন্তু নিয়োগের জন্য পেপার দেখবেন
বড় মডেল ক্ষেত্রে, প্রকৃতপক্ষে অনেক গুরুত্বপূর্ণ অগ্রগতি এখন পেপারের আকারে প্রকাশিত হচ্ছে না।
OpenAI-এর ইঞ্জিনিয়ার হিসাবে, শিল্পের অগ্রগতির সামনে এই অনুভূতি বুঝতে কোনও কষ্ট হয় না। যেহেতু আপনার কাছে বেশি ক্যালকুলেশন পাওয়ার, দ্রুত পরীক্ষার ফিডব্যাক এবং অসংখ্য অপ্রকাশিত অভ্যন্তরীণ ফলাফল রয়েছে, তাই 'পেপার না পড়ার' আত্মবিশ্বাস আছে।
কিন্তু এটা বলে ফেলা কিছুটা সূক্ষ্ম।
একটি মন্তব্য টেক কোম্পানিগুলিকে সমালোচনা করে যে, এই কোম্পানিগুলি “উঠে যাওয়ার পর সিঁড়ি সরিয়ে ফেলে”: বিশ্ববিদ্যালয়গুলি থেকে গবেষকদের টেনে আনে, শিক্ষাগত ক্ষেত্রে প্রকাশ্যে জমা হওয়া অর্জনগুলির উপর ভিত্তি করে, বেশি দামে মানুষ এবং GPU-এর জন্য প্রতিদ্বন্দ্বিতা করে, নিজেদের কম ও কম সহপেশাগত পর্যালোচনা গ্রহণ করে, এবং শেষপর্যন্ত ঘোষণা করে যে শিক্ষাগত গবেষণা “মূলত একটি প্রতারণা”।

কিছুটা কর্কশ, কিন্তু বাস্তবিকই যুক্তিসঙ্গত।
এই অগ্রগামী ল্যাবের মানুষগুলো পেপার পড়া ছাড়াই কাজ করতে পারে, কিন্তু প্রবেশ করতে চাইলে প্রথমে পেপার প্রকাশ করতে হবে।
শিক্ষার্থী এবং যুব গবেষকদের জন্য, যাদের শিল্পের অভিজ্ঞতা নেই, শীর্ষ কনফারেন্সের পেপার এখনও গবেষণার ক্ষমতা প্রমাণের সবচেয়ে সরাসরি প্রমাণ।
ডক্টরেট আবেদন করা, শিক্ষকতার পদ খোঁজা, বা OpenAI এর মতো অগ্রণী ল্যাবে যোগ দেওয়া—সবকিছুই পেপারের মাধ্যমে মনোযোগ আকর্ষণের উপর নির্ভর করে।
বড় ল্যাবে প্রবেশ করার পর শিল্প ক্ষেত্রের মানুষ পেপারকে হালকা ভাবে দেখে, কিন্তু বাইরের মানুষদের বাছাইয়ের জন্য এখনও পেপারের সংখ্যা, কনফারেন্সের মর্যাদা এবং উদ্ধৃতির পরিসংখ্যান ব্যবহার করে।
প্রবন্ধটি এখন একটি অস্বস্তিকর অবস্থানে পড়েছে: এর জ্ঞান প্রচারে বিশ্বাসযোগ্যতা প্রশ্নিত হচ্ছে, কিন্তু প্রতিযোগিতামূলক দক্ষতা বজায় রাখার মূল্য এখনও অক্ষুণ্ণ রয়েছে।
সুতরাং, “বড় ল্যাব এখন পেপার পড়ে না” বলাটা কিছুটা উচ্চাকাঙ্ক্ষী এবং অহংকারী মনে হয়। কারণ, যারা পেপার পড়ার দরকার নেই, তারা সাধারণত পেপারের মাধ্যমেই সেই দরজাটি পার হয়েছে।
অবশ্যই, সব ছাত্রই যে পরিকল্পিত প্রতারণার শিক্ষাগত খলনায়ক নয়।
একজন বিশ্ববিদ্যালয়ের গবেষক হাসিমুখে বলেছিলেন, তিনি চাইতেন যে তাঁর শিক্ষার্থীদের ইতিমধ্যেই অতিরঞ্জিত বা মিথ্যা প্রবন্ধ লেখার ক্ষমতা থাকুক।

কেউ কেউ 'শিক্ষাগত ধোকাবাজির' জন্য প্রতিযোগিতা করছে, আবার কেউ কেউ ল্যাটেক্স নিয়ে সংগ্রাম করছে।
রেফারেন্স লিঙ্ক:
https://x.com/MathewShen42/status/2084465434506768867
https://x.com/kellerjordan0/status/2084721463089902074
https://sai.science/blog/how-much-science-is-verifiable
https://x.com/mengyer/status/2085134204786921886
এই লেখাটি ওয়েইচ্যাট গ্রুপ "মেশিন মাইন্ড" (ID: almosthuman2014) থেকে এসেছে, লেখক: মেশিন মাইন্ড
