অ্যাইয়ের দক্ষতার পথ: যেখানে স্কোরিং সিস্টেম আছে, অ্যাই অনুসরণ করে

iconTechFlow
শেয়ার
AI summary iconসারাংশ
যেখানে স্কোরিং সিস্টেম বিদ্যমান, সেখানে AI-এর অধিকার বাড়ছে, যেমন গো, শ্যাচ এবং প্রোটিন ভুন্ডিংয়ে। অ্যালফাগোর লি সেডোলের মুভ, অ্যালফাজিরোর শ্যাচের দক্ষতা এবং অ্যালফাফোল্ড2-এর প্রোটিন বিপ্লব দেখায় যে AI পরিমাপযোগ্য লক্ষ্যের উপর প্রভুত্ব বিস্তার করে। অল্টকয়েন ট্র্যাক করা ট্রেডারদের এই প্রবণতা মনে রাখা উচিত। যখন AI সংগঠিত ক্ষেত্রগুলিতে প্রবেশ করছে, তখন ফear and greed index-এ বাজারের অনিশ্চয়তা প্রতিফলিত হতে পারে। পরবর্তী সীমানা? স্পষ্ট মেট্রিক্সহীন মানবিক কার্যকলাপ।

লেখক: Robonaissance

স্টিম টেকফ্লো

শেনচাওয়ের পরিচয়: গো, শ্যাচ, প্রোটিন ভাঁজ — এই মনে হয় মানুষের স্বাভাবিক বুদ্ধি ও সৃজনশীলতা প্রয়োজন হওয়া ক্ষেত্রগুলি কেন একের পর এক AI দ্বারা আক্রান্ত হচ্ছে? এই নিবন্ধটি একটি উপেক্ষিত নিয়মকে প্রকাশ করে: AI-এর মানুষকে ছাড়িয়ে যাওয়ার সিদ্ধান্তকারী বিষয়টি হল কাজের কঠিনতা নয়, বরং সাফল্যের জন্য স্কোরিং করা সম্ভব কিনা। যখন কোনো ক্ষেত্রে স্কোরিং মানদণ্ড প্রতিষ্ঠিত হয়, তখন সেই ক্ষেত্রটি নিজেকেই আক্রান্তের জন্য গণনা শুরু করে।

যে একমাত্র কাজটি যা মেশিন আমাদের পক্ষে করতে পারে না, তা হলো যা যা আপনি চান তা নিয়ে তৈরি করা।

One ten-thousandth

২০১৬ সালের ১০ মার্চ, সিওলের একটি হোটেলে, একটি মেশিন ঘরের সবাইকে অবিবেকিত করে দেয়া একটি চাল দিয়েছিল, যখন এর প্রতিপক্ষ উপস্থিত ছিল না।

이세돌 সিগারেট খাতে বাইরে গেছেন। তখন তিনি ৩৩ বছর বয়সী, ১৮টি বিশ্ব চ্যাম্পিয়নশিপ টাইটেল ধারণ করেছিলেন এবং তাঁকে সেই প্রজন্মের সর্বশ্রেষ্ঠ গো খেলোয়াড় হিসাবে স্বীকৃতি দেওয়া হয়েছিল। পূর্ববর্তী দিনের প্রথম ম্যাচে তিনি হেরে গিয়েছিলেন, এবং দ্বিতীয় ম্যাচের শুরুতে তাঁর আত্মবিশ্বাস কমে গিয়েছিল, তিনি আরও সতর্ক হয়ে পড়েছিলেন। বাইরে থাকতে থাকতে, AlphaGo ৩৭তম চালটি নির্বাচন করল, এবং DeepMind-এর গবেষক হুয়াং শিজিয়ে মেশিনের পক্ষে চুপচাপ চালটি বোর্ডে রাখলেন।

The piece landed on the fifth line.

কোনও গো খেলোয়াড় না হলে এটির কোনও অর্থ নেই। যারা জানেন, তাদের কাছে এটি প্রায় অবিবেচনাপূর্ণ। শুরুর পর্যায় এবং মধ্যের পর্যায়ে, প্রান্ত থেকে এতটাই দূরে চাল দেওয়াকে অকার্যকর বলা হয়, কারণ এটি কোনও ক্ষেত্র অর্জন করে না এবং কোনও অঞ্চল রক্ষা করে না—এটি শত্রুকে সহজেই পয়েন্ট দিয়ে দেওয়ার মতো। এটি শিক্ষকদের শিক্ষার্থীদের সংশোধন করার মতো চাল। বিশ্লেষণের আসনে, শীর্ষস্থানীয় পেশাদার গো খেলোয়াড় মাইকেল রেডমন্ড লাইভকভাবে ম্যাচটির শুরুতেই মনে করলেন যে বোর্ডের সংকেতটির সমস্যা। তিনি একটি পাথর uthhe ne, ar put back down.

লি সে-সিক ফিরে বসে দীর্ঘক্ষণ চারপাশের বোর্ডটি দেখলেন, কোনো চাল দিলেন না। বিভিন্ন প্রতিবেদন অনুযায়ী এই সময়কাল 12 থেকে 15 মিনিটের মধ্যে। পাঁচ মাস আগে আলফা গো দ্বারা পরাজিত ইউরোপীয় চ্যাম্পিয়ন ফান হুই সেই সময় ভবনের ভিতরে দেখছিলেন। দীর্ঘক্ষণ দেখার পর তিনি মন্তব্য করলেন: "এটি মানুষের চাল নয়। আমি আগে কখনও এমন চাল দেখিনি।"

তিনি ঠিক বলেছেন, এবং এটি পরিমাপযোগ্য। ডিপমাইন্ডের সিস্টেমের ভিতরে একটি আনুমানিক মেকানিজম রয়েছে, যা বহু মানুষের গেম শিখে যেকোনো পজিশনে মানুষ একটি নির্দিষ্ট চাল দেওয়ার সম্ভাবনা আনুমান করে। ৩৭তম চালের জন্য, এই আনুমানটি প্রায় দশহাজারের এক।

মেশিনটি এখনও নামানো হয়নি, এবং এই চালটি পুরো খেলা জিতে নিয়েছে।

এই গল্পের জন্য একটি সহজ ব্যাখ্যা হল যে মেশিন মানুষের মহান খেলোয়াড়দের শিখতে অত্যন্ত পরিশ্রম করেছিল এবং শেষ পর্যন্ত তাদের মধ্যে সবচেয়ে শক্তিশালীদের ছাড়িয়ে গেছে। এই ব্যাখ্যা ভুল, এবং এক লক্ষের একটি সংখ্যা ঠিক কেন এটি ভুল তা ব্যাখ্যা করে। মানুষের চালগুলি অনুকরণ করার জন্য ডিজাইন করা একটি সিস্টেমের একটি সীমাবদ্ধতা থাকে—সেই সীমাবদ্ধতা হল মানুষের চাল। সিওলে যা ঘটেছিল, তা হল, একটি সিস্টেম এই সীমাবদ্ধতা থেকে মুক্তি পেয়েছিল, কারণ এটির দেওয়া লক্ষ্য ছিল মানুষের মহানদের প্রশংসা নয়, বরং জিততে।

এই পার্থক্যটি প্রশংসার চেয়ে বেশি উপযোগী দিক নির্দেশ করে। যদি আপনি জানতে চান যে কোন মানবিক কার্যকলাপগুলি শুধুমাত্র ক্ষমতার দিক থেকে হারিয়েছে এবং পরবর্তীটি কোনটি, তাহলে প্রশ্নটি হওয়া উচিত না যে এই কার্যকলাপটি কতটা কঠিন, কতটা সৃজনশীলতা প্রয়োজন, বা কতটা অনুভূতির প্রয়োজন। প্রশ্নটি তার চেয়ে অনেক বেশি বিরক্তিকর।

সমস্যা হলো, সাফল্যকে কি পয়েন্ট দেওয়া যায়?

একটি প্লেটের পর আরেকটি প্লেট

১৯ বছর আগে শতরঞ্জ হারিয়েছিল, এবং হারার পদ্ধতি সম্পূর্ণ ভিন্ন।

1997 এর দ্বারা ক্যাস্পারভের পরাজয়ের সময় ডিপ ব্লু যে আর্কিটেকচার ব্যবহার করেছিল, তা মূলত একটি বিশাল মানব প্রকাশের কাজ ছিল। এর মূল্যায়ন ফাংশন—একটি অবস্থান দেখে এটি কতটা ভালো তা একটি সংখ্যা হিসেবে প্রদান করে—একজন গ্র্যান্ডমাস্টার পরামর্শদাতার সহায়তায় তৈরি ও সমন্বিত হয়েছিল। মানব শ্যাচের জ্ঞানকে কঠিনভাবে মানব শ্যাচ খেলোয়াড়দের থেকে সংগ্রহ করে মেশিনের মধ্যে লিখে ফেলা হয়েছিল। মেশিনটি যা যোগ করেছিল, তা হলো অনুসন্ধানের ক্ষমতা: দ্রুততরভাবে আরও বেশি পদক্ষেপের আগের দিকে তাকানো, ক্লান্তির অভাব, এবং মনোযোগের অভাবের কারণে পদক্ষেপ হারানোর সম্ভাবনা না।

এটি একটি প্রকৃত বিজয়, এবং এটিকে একটি বিজয় হিসাবে গণ্য করা উচিত। তবে এর রূপটি মনোযোগ দিয়ে দেখুন। ডিপব্লুর শ্যাচের বোঝাপড়া মানুষের বোঝাপড়া। এর সুবিধা হল গতি। যদি আপনি জিজ্ঞাসা করেন যে কেন সে একটি অবস্থানকে এভাবে মূল্যায়ন করে, তাহলে উত্তরটি চূড়ান্তভাবে কারও কাছে পৌঁছাবে যারা তাকে এভাবে করতে বলেছিল।

20 বছর পর, ডিপমাইন্ড একটি অ্যালফা জিরো নামের সিস্টেম প্রকাশ করে, যার আকৃতি পরিবর্তিত হয়েছে।

অ্যালফাজিরোকে শতরঞ্জের নিয়মগুলি দেওয়া হয়েছিল। এটিকে ওপেনিং বুক—প্রতিটি গুরুত্বপূর্ণ প্রোগ্রামের উপর নির্ভর করা গবেষিত প্রথম চালের তালিকা—দেওয়া হয়নি। এটিকে এন্ডগেম টেবিল দেওয়া হয়নি। এটিকে মানুষের কোনো খেলা দেওয়া হয়নি। এটি নিজের সাথে নিজে খেলেছে, যাত্রা শুরু করেছে যাদুকরী চাল দিয়ে, এবং কী জিতবে তা অনুযায়ী নিজেকে সামঞ্জস্য করেছে।

প্রায় চার ঘন্টার মধ্যে, ডিপমাইন্ড এর রেটিং স্টকফিশ 8 এর চেয়ে বেশি হয়ে যায়। প্রায় নয় ঘন্টার মধ্যে, এটি সময়সীমার শর্তে স্টকফিশের বিরুদ্ধে শতাধিক খেলা খেলে, ২৮টি জিতে, একটিও হারায়নি, এবং বাকি ৭২টি ড্রয়ে শেষ হয়। পেপারটি জানায়, ২৪ ঘন্টার মধ্যে, এটি শতরঞ্জ, শোগি এবং গোতে অতিমানবিক স্তরে পৌঁছেছিল।

এই সংখ্যাগুলি প্রায়শই অপর অংশ ছাড়াই উদ্ধৃত হয়, যেখানে অপর অংশটি খুবই গুরুত্বপূর্ণ। স্ব-প্রতিদ্বন্দ্বিতামূলক শতরঞ্জের খেলাগুলি পাঁচহাজারটি প্রথম প্রজন্মের টেনসর প্রসেসিং ইউনিটে তৈরি করা হয়েছিল, আর ষাটচারটি দ্বিতীয় প্রজন্মের ইউনিট নেটওয়ার্কটি প্রশিক্ষণ দিয়েছিল, সবগুলি সমান্তরালভাবে চলছিল। চার ঘন্টা ঘড়ির সময়, চার ঘন্টা কম্পিউটেশনের পরিমাণ—এই পরিমাণটি কোনও ব্যক্তি, এমনকি কয়েকটি প্রতিষ্ঠানই জোটাতে পারেনা। সাফল্যটি হলো শতরঞ্জ খেলা সহজ। সাফল্যটি হলো, যখন আপনার এতটা কম্পিউটেশনাল ক্ষমতা থাকে, তখন মানবজাতির জ্ঞান আপনার প্রয়োজনীয় জিনিস নয়।

ক্যাস্পারোভ যে কোনও জীবিত ব্যক্তির চেয়ে এই ফলাফলকে নিজের বিরুদ্ধে একটি আক্রমণ হিসেবে নেওয়ার বেশি কারণ রাখেন, তিনি তবুও সায়েন্স জার্নালে একটি প্রতিক্রিয়া লিখেছিলেন, যা অত্যন্ত উদারতাপূর্ণ ছিল। তাঁর পর্যবেক্ষণ ছিল যে, AlphaZero দ্বারা খেলা হওয়া শত্রুর সম্ভাব্য পারফেক্ট মেশিনের মতো একটি শুষ্ক, সতর্ক, ড্র প্রবণ শতরঞ্জ নয়। এটি শক্তির চেয়ে সক্রিয়তাকে পছন্দ করে, এবং তাঁর দৃষ্টিতে ঝুঁকিপূর্ণ অবস্থার জন্য পিসগুলি ত্যাগ করে। তিনি উল্লেখ করেন যে, প্রাচীন প্রোগ্রামগুলির অগ্রাধিকার এবং পক্ষপাতিত্ব তাদের লেখকদেরই। AlphaZero নিজেই নিজেকে লিখেছে। তিনি উপসংহারে বলেন, এর শৈলীতে প্রোগ্রামারদের স্বাদের চেয়েও বেশি বাস্তবিকতা প্রতিফলিত হয়, এবং উল্লেখ করেন যে, AlphaZero-এর প্রতি সেকেন্ডে পরীক্ষিত অবস্থা, বিশ্বের সর্বশ্রেষ্ঠ প্রাচীন ইঞ্জিনগুলির চেয়েও অনেক কম, তবুও এটি জিতেছিল।

এই শেষ বিস্তারিতটি মনে রাখার মতো। প্রচলিত ইঞ্জিনগুলি প্রতি সেকেন্ডে অনেক বেশি সম্ভাবনা অনুসন্ধান করেছিল, তবুও হারল। AlphaZero-এর সুবিধা ছিল বেশি পরিশ্রম করা নয়, বরং কোথায় তাকাবে তা জানা, এবং এই জ্ঞানটি মিলিয়ন ম্যাচের নিজের সাথে খেলা এবং কে জিতল তা নির্ধারণের একটি নিয়ম দ্বারা গঠিত, অন্য কিছুই নয়।

শোগির ফলাফলগুলি যাদের জন্য এটি বোঝা যায়, তাদের জন্য আরও অদ্ভুত। শোগি হল একটি জাপানি চেস খেলা, যেখানে ধ্বংস হওয়া পিসগুলি যে খেলোয়াড় ধ্বংস করেছে, তার হাতে ফিরে আসে, যা এটিকে চেসের চেয়ে অধিক অস্থির করে তোলে, এবং রাজাকে নিরাপদে রাখার বিষয়ে এটির কয়েকশত বছরের তত্ত্বও রয়েছে। শক্তিশালী শোগি খেলোয়াড়রা মেশিনের খেলাগুলি দেখে বলেছেন, শুরুর পদক্ষেপগুলি পরিচিত তত্ত্বকে লঙ্ঘন করছে, এবং রাজা প্রতিটি বইয়ের মতোই, যেখানে রাজাকে কোণায় সরিয়ে রাখা উচিত, সেখানেও চ্যাসবোর্ডের মাঝখানে ছুটছে। এই খেলাগুলি প্রশিক্ষিত চোখের জন্য几乎 uninterpretable, but they won.

দুটি সিস্টেম পাশাপাশি রাখা হয়েছে, যার নিয়ম অস্বস্তিকর পর্যায়ে স্পষ্ট। গভীর নীল হল মানুষের জ্ঞান এবং মেশিনের গতির সমন্বয়। অ্যালফাজিরো হল মেশিনের গতি এবং বিজয়ের সংজ্ঞার সমন্বয়, যেখানে মানুষের জ্ঞানকে ইচ্ছাকৃতভাবে সরিয়ে ফেলা হয়েছে। মানুষের জ্ঞান বিবর্জিত সংস্করণটি ভালো।

এটি মানে এই নয় যে 2016 সালের মেশিনটি নিখুঁত ছিল, একই সিউল ম্যাচে প্রমাণ ছিল।

চতুর্থ গেমে, তিন সেট পিছনে থাকা অবস্থায় সম্মান রক্ষার জন্য লি সে-সিক চাদরের মাঝখানে অ্যালফা গোর দুটি টুকরোর মধ্যে একটি পাথর রাখেন। এটি পরে ঈশ্বরীয় হাত নামে পরিচিত হয়। অ্যালফা গো নিজেই মনে করেছিল যে মানুষ এই হাতটি বসানোর সম্ভাবনা প্রায় দশহাজারে এক, যা অদ্ভুতভাবে সমমিত। সিস্টেমটি এটির প্রতিক্রিয়া দিতে পারেনি। পরবর্তী কয়েকটি হাতে এটির জয়ের সম্ভাবনা মূল্যায়নটি ধ্বংসপ্রাপ্ত হয়, এটির খেলার মান খারাপ হয়ে যায়, এবং এই গেমটি হারিয়ে ফেলে।

তাই 2016 সালের মার্চে, মেশিনের একটি ফাঁক ছিল, এবং একজন মানুষ বিশ্বব্যাপী দৃষ্টির সামনে, সর্বোচ্চ চাপের মধ্যে এটি খুঁজে পেয়েছিল। এটি স্পষ্টভাবে উল্লেখ করা উচিত, এটিকে চুপচাপ উপেক্ষা করা উচিত নয়। একইভাবে, পরবর্তীতে যা ঘটেছিল তা উল্লেখযোগ্য: এই ধরনের ফাঁকগুলি ধাপে ধাপে মেরামত করা হয়েছিল, এবং সেই সিস্টেমের পরবর্তী প্রজন্মগুলি আর এই ধরনের খেলায় হারেনি, শীর্ষস্থানীয় ইঞ্জিনগুলি গুরুত্বপূর্ণ অবস্থানগুলিতে দীর্ঘদিন ধরে মানুষকে হারিয়েছে। 2016 সালের ফলাফলটি ছিল একটি রূপান্তরের একটি ছবি, স্থায়ী শক্তির ভারসাম্য নয়।

এই চেসবোর্ড থেকে অন্যান্য সবকিছুতে, বিজয় নয়, বরং প্রক্রিয়াটি স্থানান্তরিত হচ্ছে। চেস এবং গো অবশ্যই প্রথম পতন করবে, কারণ এটি অত্যন্ত সহজ এবং অপমানজনকভাবে স্পষ্ট। গেমগুলিতে, সাফল্যকে নিয়মগুলি সম্পূর্ণ সুনির্দিষ্টভাবে সংজ্ঞায়িত করে। আপনি জিতেন বা হারিয়েছেন, স্কোরিং মুক্ত, তাৎক্ষণিক এবং বিতর্কহীন। একটি সিস্টেম একটি সপ্তাহান্তের মধ্যে নিজের সাথে 40 মিলিয়ন গেম খেলতে পারে, 40 মিলিয়নটি স্পষ্ট ও অবিবাদিত রায় পেয়েছে।

এটি পরবর্তী দেখার জায়গাটি নির্দেশ করে। সাধারণ কাজগুলি নয়, বরং নিজস্ব স্কোরবোর্ড সহ কাজগুলি।

পঞ্চাশ বছরের সমস্যা

প্রোটিন হল অ্যামিনো অ্যাসিডের শৃঙ্খল, যা তৈরি হওয়ার সাথে সাথে জটিল ত্রিমাত্রিক আকৃতিতে ভাঁজ হয়। আকৃতি নির্ধারণ করে প্রোটিন কী করে। ক্রম নির্ধারণ করে আকৃতি। ১৯৭০-এর দশকের শুরু থেকেই প্রথমটি থেকে দ্বিতীয়টি বের করা জীববিজ্ঞানের একটি খোলা সমস্যা ছিল, এবং এটি এমনভাবে খোলা ছিল যে এটি সব প্রকার আক্রমণকে প্রতিরোধ করেছিল: প্রথম নীতির ভৌত প্রাকৃতিক অনুকরণ, বিবর্তনীয় সম্পর্কের পরিসংখ্যানগত বিশ্লেষণ, এবং দশকগুলির সঞ্চিত কাঠামোগত অনুমান—সবই ব্যর্থ হয়েছিল।

১৯৯৪ সালে, জন মৌল্টের নেতৃত্বে একটি গবেষক দল এই তথ্যের উপর কিছু করেছিল: ক্ষেত্রের প্রত্যেকে অগ্রগতির দাবি করছিল, কিন্তু কেউই এটি যাচাই করতে পারছিল না।

তারা একটি পরীক্ষা আয়োজন করে। তারপর থেকে প্রতি দুই বছর পর কনস্ট্রাকশন প্রেডিকশন কী অ্যাসেসমেন্ট (CASP) শুধুমাত্র পরীক্ষাগতভাবে নির্ধারিত প্রোটিন স্ট্রাকচারগুলি প্রকাশ করে, কিছু ক্ষেত্রে এখনও নির্ধারণের মধ্যে থাকে, এবং সেই সিকোয়েন্সগুলি বিশ্বব্যাপী প্রকাশ করে। যেকোনো দল প্রেডিকশন জমা দিতে পারে। কারণও কিছু টার্গেটের উত্তরগুলি এখনও অস্তিত্বহীন, তাই কেউও উত্তরগুলির সাথে অ্যাক্সেস পায় না। যখন পরীক্ষাগত স্ট্রাকচারগুলি প্রকাশিত হয়, তখন প্রেডিকশনগুলির সঙ্গে স্কোরিং করা হয়।

পয়েন্টিং একটি গ্লোবাল ডিসট্যান্স টেস্ট নামক একটি মেট্রিক দ্বারা পরিমাপ করা হয়, যা 0 থেকে 100 পর্যন্ত হয় এবং এটিকে প্রায় বুঝা যায় যে চেইনের চূড়ান্ত অবস্থানটি বাস্তব অবস্থানের কতটা কাছাকাছি। মৌল্ট বলেছেন, প্রায় 90 পয়েন্টকে অফিসিয়ালভাবে পরীক্ষাগারে নির্ধারিত কাঠামোর সমতুল্য হিসাবে বিবেচনা করা হয়। মূল্যায়নের বেশিরভাগ ইতিহাসে, সেরা পূর্বানুমানগুলি 60 পয়েন্টের আশপাশে ঘুরেবেড়ায়।

2020 এর CASP14-এ, 427 নম্বরে নিবন্ধিত একটি দল সমস্ত লক্ষ্যে মধ্যক স্কোর 92.4 অর্জন করে। সবচেয়ে কঠিন শ্রেণী—যেখানে কোনো কার্যকরী স্ট্রাকচারাল হোমোলোগি উপলব্ধ নয়—মধ্যক স্কোর 87.0। গড় ত্রুটি প্রায় 1.6 এংস্ট্রম, যা প্রায় একটি পরমাণুর প্রস্থের সমান।

মাউল্ট প্রতিযোগিতার শুরু থেকেই চেয়ারম্যান হিসেবে দায়িত্ব পালন করেছেন, এবং তিনি গ্রাফ প্রদর্শনের আগে দর্শকদের প্রতিযোগিতার ইতিহাসের সারসংক্ষেপ দিয়েছিলেন। গ্রাফটি একটি চিত্রে সম্পূর্ণ গল্পটি ব্যাখ্যা করে। বিশ বছরের লাইনটি 60-এর কাছাকাছি ঘুরে বেড়ায়, তারপর একটি লাইন অন্যান্য লাইনগুলির কখনও পৌঁছায়নি এমন একটি জায়গায় দাঁড়ায়।

427 গ্রুপটি আলফাফোল্ড2। মাউল্ট ঘোষণা করেছেন যে একক প্রোটিন চেইনের জন্য সমস্যাটি সমাধান করা হয়েছে।

সীমাবদ্ধতা যেখানে থাকা উচিত, সেখানে থাকা উচিত, প্রতিটি সৎ বর্ণনায়। একটি একক শৃঙ্খল প্রোটিন বিজ্ঞানের সম্পূর্ণ নয়। প্রোটিনগুলি কীভাবে কমপ্লেক্সে সংগঠিত হয়, কীভাবে চলে, এবং জীবিত কোষের ভিতরে কীভাবে আচরণ করে, এগুলি এখনও খোলা। বন্ধ করা মহাচ্যালেঞ্জটি একটি নির্দিষ্ট, সঠিকভাবে বিবৃত চ্যালেঞ্জ।

এবং এই সঠিকতাই এই গল্পটি বলার মূল বিষয়। কাঠামোর ভবিষ্যদ্বাণী যে পতনের কারণ হয়নি এটি আসলে খুব সহজ ছিল, কারণ অর্ধশতাব্দীর ব্যর্থতা বিপরীতটি প্রমাণ করে। এটি পতনের কারণ হয়েছিল, 1994 সালে এই ক্ষেত্রটি নিজেদের জন্য একটি স্কোরবোর্ড তৈরি করেছিল।

CASP কে বিজ্ঞান নয়, ইঞ্জিনিয়ারিং হিসাবে দেখলে এটি কী প্রদান করে? এটি যেকোনো পূর্বানুমানের জন্য একটি স্পষ্ট ও অদ্বিতীয় সাফল্যের মাপদণ্ড প্রদান করে, যা কয়েক সেকেন্ডের মধ্যে গণনা করা যায়। এটি একটি চালানোর অসম্ভব বেঞ্চমার্ক তথ্য প্রদান করে, কারণ উত্তরগুলি অন্যরা পরীক্ষাগারে ভৌতভাবে নির্ধারণ করেছেন। এটি নির্দিষ্ট সময়সূচীতে নিয়মিতভাবে নতুন সমস্যার প্রবাহ প্রদান করে। এটি তিন দশকের মূল্যায়নযুক্ত ইতিহাস প্রদান করে, অর্থাৎ, এই ক্ষেত্রে কীভাবে "ভাল" এবং "খারাপ" এর মধ্যে শ্রেণিবদ্ধকরণের রেকর্ড।

এই সবকিছু করা একটি ক্ষেত্রে, নিজের সমস্যার জন্য অনিচ্ছাকৃতভাবে অটোমেশন আক্রমণের প্রস্তুতি হয়েছে। স্কোরবোর্ডটি পূর্বশর্ত। অন্য সবকিছুই প্রকৌশল এবং গণনা, এবং এই দুটি বছরের পর বছর ধরে অনেকদিন ধরে সস্তা হয়ে আসছে।

এটি একটি অসহনীয়ভাবে সহজে প্রচার করা হয়েছে। যেখানে কোনো বিষয়ে মানদণ্ড সম্মতি হয়েছে, সেখানে একটি লক্ষ্য প্রকাশ করা হয়েছে। মেশিন অনুবাদের জন্য মানদণ্ড রয়েছে। ভয়েস রিকগনিশনের জন্য মানদণ্ড রয়েছে। ইমেজ ক্লাসিফিকেশনের জন্য একটি একমিলিয়ন ছবি লেবেলযুক্ত সংগ্রহ এবং বার্ষিক প্রতিযোগিতা রয়েছে, যে কেউ সেই প্রতিযোগিতা দেখেছেন, তিনি জানেন গল্পটি কীভাবে শেষ হয়। নিয়মটি কঠিন জিনিসগুলির আগে পড়ে যাওয়া বা সহজ জিনিসগুলির আগে পড়ে যাওয়া নয়। নিয়মটি হলো, যা পরিমাপ করা হয়, তাই আগে পড়ে যায়।

এটি এখনও পরিমাপ করা হয়নি এমন সবকিছুর জন্য স্পষ্ট প্রশ্ন তুলে ধরে।

যার জন্য স্কোর দেওয়া যায় না তার জন্য স্কোর দিন

শেষ প্রতিরোধ হওয়া উচিত যাদের স্কোর দেওয়া যায় না।

লেখন একটি মানক উদাহরণ। কোনো প্রোগ্রামই একটি অনুচ্ছেদ নিয়ে একটি সংখ্যা ফেরত দিতে পারে না যে এটি কতটা ভালো। দুজন যোগ্য সম্পাদকের মতামত একমত হয় না। একই সম্পাদক ভিন্ন ভিন্ন দিনে নিজের সঙ্গে মতামতে অসম্মত হয়। ভাষার গুণগত মান প্রেক্ষাপট, পাঠক, উদ্দেশ্য এবং স্বাদের সঙ্গে জড়িয়ে আছে, যা কোনো পরিমাপযোগ্য মানে হ্রাস করা যায় না। যদি মেশিনের জন্য স্কোরবোর্ড প্রয়োজন হয়, আর ভাষার কোনো স্কোরবোর্ড না থাকে, তবে ভাষা নিরাপদ।

এই যুক্তিটি বৈধ। এর সাথে ঘটেছে এমন ঘটনাগুলি হল এই সম্পূর্ণ বর্ণনার সবচেয়ে গুরুত্বপূর্ণ কারণ।

এই ক্ষেত্রে কোনও বস্তুনিষ্ঠ মাপদণ্ড খুঁজে পাওয়া যায়নি। এখনও এমন কিছু নেই। এটি মানুষের বিচারকেই একমাত্র উপলব্ধ উপকরণ হিসাবে ব্যবহার করে একটি স্কোর তৈরি করে।

এই পদ্ধতির ইতিহাস অধিকাংশ মানুষের ধারণার চেয়ে অনেক পুরনো। ২০০৮ সালে, নক্স এবং স্টোন একটি TAMER সিস্টেমের বর্ণনা দেন, যেখানে মানুষ বুদ্ধিমান এজেন্টের আচরণ পর্যবেক্ষণ করে মূল্যায়ন দেয়, এবং এই মূল্যায়নগুলি ব্যবহার করে একটি মডেল প্রশিক্ষিত হয় যা ভবিষ্যতে মানুষ কী বলবে তা পূর্বানুমান করে। তারপরে প্রশিক্ষণ সংকেতগুলি মানুষের পরিবর্তে মডেলটির দ্বারা প্রদান করা হয়। ২০১৭ সালে, ক্রিস্টিয়ানো এবং তাঁর সহকর্মীরা একটি কাজ প্রকাশ করেন, যা অধিকাংশকেই বর্তমান অনুশীলনের প্রত্যক্ষ উৎস হিসাবে বিবেচনা করে, এবং এই ধারণাটি Atari গেমের এজেন্টগুলিতে প্রয়োগ করেন। ২০১৯ সালে,জিগলার এবং তাঁর সহকর্মীরা এটিকে ভাষা মডেলগুলিতে প্রয়োগ করেন, এবং আজকের বেশিরভাগ শব্দভাণ্ডারই সেই পেপারেই নির্ধারিত হয়। ২০২২-এ,ওয়াঙ্গা এবং তাঁর সহকর্মীরা ইনস্ট্রাকশন-ফলো-আপটাস্কগুলিতে শিল্প-স্কেলে এইপদ্ধতিরপ্রদর্শনকরেন,এবংঅল্পকিছুদিনপরই,পৃথিবীরঅধিকাংশমানুষঅজান্তেএইসফলতাগুলিরসংস্পর্শেআসেন।

এর মূল কার্যপ্রণালী বিস্তারিতভাবে বুঝতে যোগ্য, কারণ এটি প্রচলিত প্রতিষ্ঠানের চেয়ে অনেক সহজ।

একজন ব্যক্তি দুটি পাঠ্যের সামনে বসে আছে, যেগুলি একই প্রম্পটের জন্য মডেল দ্বারা উত্পাদিত। কাজটি এগুলিকে স্কোর দেওয়া নয়। স্কোর দেওয়া মানুষের জন্য খুবই খারাপভাবে করা হয়, কারণ একজনের সাতটি অন্যজনের পাঁচটির সমান, এবং একই ব্যক্তি একই দুপুরের মধ্যেই অস্থির। কাজটি শুধুমাত্র বলা, কোনটি ভালো। এটি মানুষের জন্য বিশ্বস্তভাবে করা যায়, এবং এইরকম অসংখ্য তুলনাকে একটি সামঞ্জস্যপূর্ণ স্কেলে রূপান্তরিত করার গাণিতিক পদ্ধতিগুলি, এর ব্যবহারের ক্ষেত্রেরও পুরনো, ১৯৫২ সালের Bradley এবং Terry-এর জোড়া-তুলনা কাজের সময়েই শুরু হয়েছিল।

এই ধরনের সিদ্ধান্ত নেওয়ার কাজের পরিস্থিতি বিবেচনা করুন, কারণ এগুলি চূড়ান্তভাবে প্রভাব ফেলবে। এই ব্যক্তি প্রতি ঘন্টায় অসংখ্যবার এই ধরনের সিদ্ধান্ত নেয়, একটি পেশাদার গাইডলাইনের সাথে মিলিয়ে, যা ব্যাখ্যা করে গ্রাহকরা কী বিষয়ে ভালো উত্তর বলে মনে করে। কিছু জোড়া প্রায় সম্পূর্ণরূপে একই। কিছুতে এই ব্যক্তির কোনো জ্ঞানই নেই, এই পরিস্থিতিতে, দুটি উত্তরের মধ্যে যেটি বেশি আত্মবিশ্বাসী এবং ভালভাবে সংগঠিত, তা প্রায়শই বাছা হয়, যদিও এটি আরও সঠিক না। এটি এই মানুষদের প্রতি সমালোচনা নয়। এটি এই পরিস্থিতিতে যেকোনো মানুষের কীভাবে আচরণ করবে, তারই বর্ণনা, এবং ফলাফলগুলিরই কাঁচা কাঁচামাল।

এই বিকল্পগুলির যথেষ্ট সংখ্যক সংগ্রহ করুন, তাহলে আপনি একটি দ্বিতীয় মডেল প্রশিক্ষণ দিতে পারবেন, যার কাজ হবে দুটি টেক্সটের মধ্যে মানুষ কোনটি বেশি পছন্দ করবে তা পূর্বানুমান করা। এই দ্বিতীয় মডেলটি একটি সংখ্যা আউটপুট দেয়। আর একটি সংখ্যাই এই পর্যন্ত একমাত্র অভাব।

এখানে যা তৈরি হচ্ছে তা ভালোভাবে দেখুন, কারণ এটি সহজেই উপেক্ষা করা হয়। অপ্টিমাইজড স্কোরটি বিশ্বের সত্য সম্পর্কিত নয়। এটি আমাদের মডেলের সম্পর্কিত। এটি একটি নির্দিষ্ট জনগোষ্ঠীর বিচারের সংক্ষিপ্ত, শিক্ষিত অনুকরণ, যাদের একটি নির্দিষ্ট সময়ে নিয়োগ করা হয়েছিল, একটি নির্দিষ্ট নির্দেশনা অনুসারে কাজ করেছিল, এবং অন্যদের মতোই বিকালে ক্লান্ত হয়েছিল। CASP পরীক্ষাগারে নির্ধারিত ভৌতবাস্তবতার ভিত্তিতে পূর্বানুমানকে স্কোর করে, আর এই সিস্টেমটি মানুষের স্বীকৃত পরিসংখ্যানগত ছবির ভিত্তিতে টেক্সটকে স্কোর করে।

এই চিত্রটি উপযোগী। কিন্তু এটি অবশ্যই একটি প্রায়ানুমান, এটি চিত্রিত বস্তুর সাথে পার্থক্য রাখে, এবং কেউ এই পার্থক্যগুলি সম্পূর্ণরূপে বুঝতে পারেনি। আমাদের পছন্দের মডেল যা আমাদের প্রকৃত পছন্দকে ধরে রাখতে ব্যর্থ হয়েছে, তা লক্ষ্যের মধ্যে নেই, তাই এটি অপ্টিমাইজ হয় না, এবং তাই যেকোনো পরিস্থিতিতেই প্রভাবিত হয়—এবং শক্তিশালী অপ্টিমাইজারের জন্য এই পরিমাণকে সুরক্ষিত রাখার কোনো কারণ নেই।

এটি গঠনের একটি তথ্য, এখানে পরিণতির গুরুত্ব সম্পর্কে কোনও দাবি করা হয়নি। বর্তমান বিষয়টি আরও সংকীর্ণ এবং আরও কঠিনভাবে প্রত্যাখ্যানযোগ্য। মূল্যায়নযোগ্য নয় এমন বিষয়গুলির শ্রেণী যা দেখায় তার চেয়ে ছোট। যদি কোনও ক্ষেত্র পরিমাপকে প্রতিরোধ করে, তবে মানুষের পছন্দ থেকে একটি পরিমাপ তৈরি করা যেতে পারে এবং এগিয়ে যাওয়া যেতে পারে। এই প্রতিরোধশীলতা শুধুমাত্র কেউ স্কোর তৈরির কথা ভাবেননি তখনই কার্যকর।

পরবর্তীতে কী পড়ে যাবে

এটি একটি ব্যাবহারিক প্রশ্ন এবং একটি ব্যবহারযোগ্য উত্তর রেখে যায়।

আপনি যেকোনো পছন্দের কাজ বাছুন: একটি চাকরি, একটি শিল্প, একটি পেশা, বা এমন একটি কাজ যা আপনি বছরের পর বছর শিখেছেন। তিনটি প্রশ্ন জিজ্ঞাসা করুন।

প্রথমত, সফলতা এবং ব্যর্থতা বিশ্বস্তভাবে পৃথক করা যায় কি? পরিপূর্ণভাবে নয়, এবং প্রত্যেকেই করতে পারে না, কিন্তু যথেষ্ট সুসংগঠিতভাবে যাতে ক্ষমতাবান মূল্যায়কদের বেশিরভাগ সময় একমত হয়। গেমটি এই পরীক্ষা সহজেই পার করে। প্রোটিন গঠন পূর্বানুমান এই পরীক্ষা পার করে কারণ পরীক্ষাগারে চূড়ান্ত উত্তর পাওয়া যায়। লেখন পরম অর্থে এই পরীক্ষা পার করে না, কিন্তু আপেক্ষিকভাবে পার করে, কারণ মানুষ সাধারণত দুটি চেষ্টার মধ্যে কোনটি ভালো তা বলতে পারে।

দ্বিতীয়ত, এই বিচারকে কি কম খরচে বড় পরিসরে উৎপাদন করা যায়? এই প্রশ্নটি সম্ভাবনা নয়, বরং সময়নির্ধারণ নির্ণয় করে। একটি বিনামূল্যে এবং তাৎক্ষণিক বিচার, যেমন গেমে, মানে যে সিস্টেমটি নিজেই মিলিয়ন মিলিয়ন ট্রেনিং ডেটা তৈরি করতে পারে। একটি প্রয়োগশালার প্রয়োজনীয় বিচার ধীরগতির, কিন্তু এখনও সম্ভব, ৩০ বছরের স্কোরিং প্রচেষ্টার আর্কাইভ রয়েছে। একটি পেইড মানুষের দ্বারা টেক্সট পড়ার প্রয়োজনীয় বিচার খুবই ব্যয়বহুল, যা ঠিকই এই কারণে যে, এই মানুষদের চক্র থেকে সরিয়ে ফেলতে মডেলগুলিকে অনুকরণ করার জন্য এতটাই প্রচেষ্টা করা হয়েছে।

তৃতীয়ত, প্রশ্নটি হল কোন ক্ষেত্রের পতন নয়, বরং এর পরে কী ঘটবে: এই স্কোরটি কি আসলেই আপনার চাওয়া জিনিস? গেমের স্কোর হল আপনার চাওয়া জিনিস, কারণ গেমে, জয় সংজ্ঞাগতভাবেই সমস্ত অর্থ। পরীক্ষামূলকভাবে পরিমাপিত প্রোটিন স্ট্রাকচারগুলি আপনার চাওয়া জিনিসের খুব কাছাকাছি। একজন লেবেলারের পছন্দের শিক্ষিত মডেলটি আপনার চাওয়া জিনিস নয়। এটি আপনার চাওয়া জিনিসের একটি চিত্র, এবং চিত্র এবং মুখের মধ্যে একটি ব্যবধান রয়েছে।

নিজের কাজটি পরীক্ষা করতে এই তিনটি প্রশ্ন জিজ্ঞাসা করুন। অধিকাংশ মানুষ প্রথম উত্তরটি দ্রুত এবং চিন্তাচ্ছল পায়। আমরা যা দক্ষতা বলি, তার বেশিরভাগই, অন্তত আপেক্ষিক অর্থে, দক্ষ ব্যক্তিদের পাশাপাশি দুটি চেষ্টা দেখে মূল্যায়ন করা যায়। দ্বিতীয় প্রশ্নটি সত্যিকারের অনিশ্চয়তার স্থান, কারণ খরচ এবং পরিসর হল চলমান লক্ষ্য, এবং তারা দীর্ঘদিন ধরে একটি দিকে সরেছে। তৃতীয় প্রশ্নটি প্রায় কেউই জিজ্ঞাসা করেননি, এবং এটি নির্ধারণ করে যে আপনার ক্ষেত্রটি অপরপাশে কীভাবে দেখায়।

সাধারণ বিষয়গুলিতে এই অনুশীলনটি ধীরে ধীরে করা উচিত। রেডিওলজির ক্ষেত্রে নেওয়া যাক। সফলতা এবং ব্যর্থতা পৃথক করা যায় কি? হ্যাঁ, এবং খুব সূক্ষ্মভাবে, কারণ নির্ণয় চূড়ান্তভাবে রোগীর অবস্থা দ্বারা প্রমাণিত বা খণ্ডিত হয়। মূল্যায়নগুলি কম খরচে বড় পরিসরে উৎপাদন করা যায় কি? প্রায় হ্যাঁ, কারণ হাসপাতালগুলি বছরের পর বছর ধরে চিত্র এবং নিশ্চিতকরণের ফলাফলের মাধ্যমে মূল্যায়নের নমুনা সঞ্চয় করেছে। এই স্কোরটি কি আপনি চান? এখানে উত্তরটি জটিল হয়ে পড়ে, কারণ মূল্যায়ন করা হয়েছে রেকর্ডকৃত নির্ণয়ের সাথে সঙ্গতি, কিন্তু আপনি চান রোগীর অবস্থা ভালো, এবং এই দুটির বেশিরভাগ সময়েই সঙ্গতি থাকে, কিন্তু সবচেয়ে গুরুত্বপূর্ণ পরিস্থিতিতেই এটি বিচ্ছিন্ন হয়।

এখন একটি বেশি নিরাপদ জিনিস নিন। পরিচালনার কথা বলুন। প্রথম প্রশ্নটি ইতিমধ্যেই কঠিন, কারণ সক্ষম ব্যক্তিদের মধ্যে একজন নির্দিষ্ট পরিচালক কতটা ভালো তার মতামত ভিন্ন ভিন্ন, এবং এই মতবিরোধ দ্রুত সমাধান হয় না। দ্বিতীয়টি আরও কঠিন, কারণ পরিচালনা সংক্রান্ত সিদ্ধান্তের ফলাফল বছরের পর বছর পরেই আসে, এবং এটি অন্যান্য সমস্ত ঘটনার সাথে জড়িয়ে যায়। তৃতীয়টি সবচেয়ে কঠিন, কারণ যেকোনো ব্যক্তি যেসব বিকল্প সূচক—যেমন ধরে রাখা, নিয়োগের স্কোর, বা প্রতি ব্যক্তির উৎপাদন—পরিচালনার জন্য প্রস্তাব করেন, সেগুলো স্পষ্টতই বিষয়টির নিজেরই অংশ নয়। এই 진단ের ভিত্তিতে, পরিচালনা গভীরতার কারণেই নিরাপদ নয়। এটি অমাপযোগ্য, যা একটি ভিন্ন, কমই পছন্দের ধরনের সুরক্ষা।

মেশিনগুলি ইতিমধ্যেই অপ্টিমাইজেশন অক্ষ দখল করে নিয়েছে। যথেষ্ট গণনার সাথে, কোনও পরিষ্কারভাবে নির্দিষ্ট লক্ষ্যে ভালো চাল খোঁজা এখন প্রতিযোগিতা নয়, এবং ফলাফলগুলি প্রায়শই আমাদের চেয়েও শক্তিশালী এবং অপরিচিত—আমাদের ঐতিহ্যগতভাবে আমাদের যা দেখতে না হওয়ার পরামর্শ দেওয়া হয়েছিল, সেখানে পৌঁছে যায়। এটি ভবিষ্যদ্বাণী নয়। এটি শতরঞ্জ, গো, শোগি, প্রোটিন গঠন এবং যা কিছুই আগে শুধুমাত্র মানুষেরই করার তালিকায় ছিল, তার বর্ণনা।

বাকিটি লক্ষ্য নিজেই। কেউ স্কোর কী হবে তা ঠিক করেছে। উপরের প্রতিটি ক্ষেত্রে, সেই সিদ্ধান্তটি একটি বিকাল নিয়েছিল, এবং প্রতিটি অসাধারণ ফলাফল এটি থেকে উৎপন্ন হয়েছে, এটির প্রতি বিশ্বাসী ছিল, এবং এটি যা কিছু বাদ দিয়েছে তার প্রতি উদাসীন ছিল।

তাই শেষ প্রশ্নটি গভীরভাবে চিন্তা করার মতো। আপনার কাজে ইতিমধ্যেই স্কোর আছে? যদি থাকে, তাহলে এটি কে লিখেছে, এবং তারা লিখতে গিয়ে আপনাকে মনে রাখেনি?

এটি যা আপনি চান তার সিরিজের দ্বিতীয় অংশ, যেখানে মেশিনটি শেষ পর্যন্ত আমাদের কী চায় এবং আমরা কতটা খারাপভাবে কাজ করি।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।