লেখক: ঝু শুয়েয়িং
এই দুই দিনে, একটি অস্বাভাবিক এআই মডেল হঠাৎ ভাইরাল হয়ে গেল।
এটার নাম জেভ।
কথা বলতে পারে না, কোড লিখতে পারে না, এমনকি চ্যাটজিপিটির মতো আপনাকে একটি দীর্ঘ উত্তর জেনারেট করতেও পারে না। এটি শুধু একটি কাজ করে: সিদ্ধান্ত নেয়।
কিন্তু এমন একটি মডেল, যার দক্ষতা অর্ধেক কেটে ফেলা হয়েছে বলে মনে হচ্ছে, হঠাৎ ডেভেলপার সম্প্রদায়ে জনপ্রিয় হয়ে উঠেছে।
কেউ এটি ব্যবহার করে 40 সেকেন্ডে 724টি রিয়েল-টাইম বিজ্ঞাপন বিশ্লেষণ করেছেন এবং মোট 8724টি সিদ্ধান্ত নিয়েছেন; কেউ এটিকে Claude Code-এর সাথে যুক্ত করেছেন যাতে অপ্রয়োজনীয় কনটেক্সট পরিষ্কার করা যায়; আবার কেউ এটিকে AI Agent-এর “বিচারক” হিসাবে ব্যবহার করেছেন, যাতে দেখা যায় কাজটি প্রকৃতপক্ষে সম্পন্ন হয়েছে কিনা। LangChain-ও Jev-কে Agent মূল্যায়নকারী হিসাবে পরীক্ষা শুরু করেছে।
এর চেয়েও বেশি হলো গতি এবং মূল্য।
টাইপসেফ দ্বারা প্রকাশিত পরীক্ষায়, জেভ সর্বোচ্চ 193.6 গুণ দ্রুততর এবং খরচ সর্বোচ্চ 444.6 গুণ কমিয়েছে। প্রতি মিলিয়ন টোকেন ইনপুটের জন্য শুধুমাত্র 0.042 ডলার খরচ হয়, আর আউটপুট টোকেন এমনকি বিনামূল্যে।
কেন একটি কম ক্ষমতাসম্পন্ন এআই হঠাৎ জনপ্রিয় হয়ে উঠল?
যেহেতু এজেন্ট যুগে পৌঁছেছি, AI-এর প্রকৃত প্রয়োজন হতে পারে শুধু “গভীরভাবে চিন্তা করা” নয়, বরং অসংখ্য, দ্রুত এবং সস্তা সিদ্ধান্ত: পরবর্তী পদক্ষেপ কী, কোন টুল কল করবে, কাজটি সম্পন্ন হয়েছে কিনা। আরও গুরুত্বপূর্ণ বিষয় হল, ভবিষ্যতে এই সিদ্ধান্তগুলি AI-এর নিজের ব্যাকগ্রাউন্ডেই সম্পন্ন হবে, মানুষকে সবসময় স্ক্রিনের সামনে বসে থাকার দরকার থাকবে না। Jev-এর লক্ষ্য, এই প্রতিদিন কয়েক মিলিয়নবার ঘটতে পারে এমন ছোট সিদ্ধান্তগুলি।
আরও আকর্ষণীয় বিষয় হলো, Jev মডেলের প্রতিষ্ঠাতা ডিওগো আলমিডা ঠিক একই সময়ে RLHF-এ অংশগ্রহণ করেছিলেন, এখন তিনি RLHF-এর প্রতি পুনর্বিচার করছেন: যে প্রশিক্ষণ পদ্ধতির মাধ্যমে ChatGPT কে ব্যবহারযোগ্য করা হয়েছিল, সেটি সম্ভবত AI-এর প্রকৃত স্বয়ংক্রিয়তার দিকে যাওয়ার জন্য উপযুক্ত নয়।
এক মাসের বেশি আগে, আলমেইডা একটি বক্তৃতা দিয়েছিলেন। এখন পিছনে ফিরে তাকালে, সেই বক্তৃতাটি প্রায় জেভের “চিন্তার ম্যানুয়াল”।


এআই উচ্চতর গণিত করতে পারে, তবে কেন কাস্টমার সার্ভিস ভালোভাবে করতে পারে না?
ডিয়েগো আলমিডার প্রোফাইল অসাধারণ।
তিনি ওপেনএআই-এ কাজ করেছিলেন এবং GPT-4, ChatGPT এবং InstructGPT/RLHF-এর সাথে সম্পর্কিত কাজে অংশগ্রহণকারী ছিলেন। অর্থাৎ, তিনি আজকের বড় মডেলগুলির সবচেয়ে গুরুত্বপূর্ণ পোস্ট-ট্রেনিং পদ্ধতি তৈরির কাজে সরাসরি অংশগ্রহণ করেছিলেন।
কিন্তু সেই বক্তৃতায়, তিনি নিজেকেই উপহাস করেন, যে তিনি OpenAI-এর মধ্যে কয়েকজন অল্প লোকের মধ্যে একজন যারা প্রকাশ্যে ChatGPT-কে “ব্ল্যাক” করেন।
তার বক্তৃতার বিষয় আরও সরাসরি: What's Next After RLHF?
ডিয়েগো প্রথমে একটি প্রতীয়মান বিরোধিতামূলক প্রশ্ন উত্থাপন করেন।
আজকের বড় মডেলগুলি খুব কঠিন গণিতের সমস্যা, কোড এবং বিভিন্ন বেঞ্চমার্কের চ্যালেঞ্জ করতে পারে।
কিন্তু যেসব ব্যবসায়িক প্রক্রিয়ায় প্রতিষ্ঠানগুলি আসলে স্বয়ংক্রিয়করণ চায়, সেখানে মানুষকে সরিয়ে ফেলা যায় না।
যেমন গ্রাহক সেবা।
এআইকে তথ্য খোঁজার জন্য, ডকুমেন্ট সারাংশ করার জন্য এবং উত্তর প্রস্তুত করার জন্য ব্যবহার করা যেতে পারে।
কিন্তু যদি এআই নিজে সিদ্ধান্ত নেয়: এই টাকা ফেরত দেওয়া হবে কি না? এই ব্যবহারকারীকে ক্ষতিপূর্তি দিতে হবে কি না?
কোম্পানিটি একদম সতর্ক হয়ে পড়ল।
এই বিষয়গুলি উচ্চতর গণিতের চেয়ে অনেক সহজ মনে হচ্ছে, তবুও এগুলি এআইকে দেওয়ার জন্য কেন ভয় পাওয়া হচ্ছে?
ডিয়েগোর উত্তরটি খুব সহজ: আজকের এআই সহায়তায় অসাধারণ, স্বয়ংক্রিয়করণে নয়।
আজকের এআই আপনার কাজে সাহায্য করতে ভালো, কিন্তু এখনও নিজে কাজটা শেষ করতে পারে না।
এই দুটি বিষয় একটু পার্থক্য মনে হলেও, বাস্তবে সম্পূর্ণ ভিন্ন।
ক্লড কোড যতই শক্তিশালী হোক না কেন, আপনি সাধারণত কম্পিউটারের সামনে বসে থাকেন। এটি কোড লিখে, আপনি দেখেন; এটি ফাইল পরিবর্তন করে, আপনি চেক করেন; ভুল হলে, আপনি আবার এটিকে পরিবর্তন করতে বলেন।
সুতরাং ডিওগোর দৃষ্টিতে, ক্লড কোড এখনও চ্যাটজিপিটি দ্বারা শুরু হওয়া “সহায়তামূলক যুগ” এর অংশ।
বাস্তবিক অটোমেশন কী?
মানুষটি বাস্তবিকভাবে উপস্থিত ছিল না।
এআই ব্যাকগ্রাউন্ডে নিজেই বিচার করে এবং নিজেই কার্যকর করে, একদিনে এটি দশহাজার বা এমনকি কয়েক মিলিয়ন বার চলতে পারে, আপনি কখনও দেখতে পাবেন না যে এটি কী করেছে।
এখন প্রশ্ন আসে: আজকের এআই এত বুদ্ধিমান হয়েছে, তবুও এটি মানুষের উপর কেন নির্ভরশীল?
ডিওগো তার খুব পরিচিত একটি জিনিসের দিকে ইশারা করলেন—RLHF।

আমরা আমাদের এআই প্রশিক্ষণের সময় মানুষকে লুপে রাখি
এটি কিছুটা বিচিত্র।
কারণ RLHF হল সেই প্রযুক্তির একটি যার প্রচারে ডিওগো তখন অংশগ্রহণ করেছিলেন।
আরএলএইচএফ-এর মূল যুক্তি আসলে জটিল নয়: মানুষের পছন্দ সংগ্রহ করুন, এবং তারপর মডেলটিকে মানুষের পছন্দের সাথে আরও বেশি সামঞ্জস্যপূর্ণ করুন।
সুতরাং ডিয়েগো তার বক্তৃতায় খুব সরলভাবে ব্যাখ্যা করেছেন: আজকের বড় মডেলগুলির জন্য কেন সবসময় মানুষের হাত দরকার?
যখন আমরা এটিকে প্রশিক্ষণ দিয়েছিলাম, তখন আমরা বর্ণগত অর্থে মানুষকে সেই লুপের মধ্যে ঢুকিয়েছিলাম।
মডেলটি শুরু থেকেই শিখছে: মানুষ কী ধরনের উত্তর পছন্দ করে?
এটি আমাদের যে বৈশিষ্ট্যটি খুব পরিচিত, তারও ব্যাখ্যা করে—যদিও সে জানে না, তবুও এটি প্রায়শই খুব প্রাসঙ্গিকভাবে বলে।
ডিওগো একটি খুব কটু উদাহরণ দিয়েছিলেন।
কেউ চ্যাটজিপিটিকে একটি পুঁটির রেকর্ডিং পাঠিয়েছিল এবং এটিকে তার রচিত একটি সংগীত বলে দাবি করেছিল, এবং এটিকে "ঈমন, স্পষ্ট"ভাবে মূল্যায়ন করতে বলেছিল।
চ্যাটজিপিটি গম্ভীরভাবে প্রশংসা করল যে এটি একটি ভয়ঙ্কর ও অদ্ভুত আবহযুক্ত পরিবেশগত সঙ্গীত।
ডিয়েগো একটি বাক্যে সারাংশ দিয়েছেন: “ওভারপ্রমিসিং একটি ফিচার।”
অতিরিক্ত প্রতিশ্রুতি একটি বাগ নয়, এটি একটি ফিচার।
চ্যাট পণ্যের জন্য এটি অবশ্যই মারাত্মক নয়। ব্যবহারকারী এখনও স্ক্রিনের সামনে আছে, ভুল ঠিক করা যায়।
কিন্তু প্রকৃত অটোমেশন সিস্টেম সম্পূর্ণ ভিন্ন।
মেশিন আপনার উত্তরটি কতটা ভালো শোনায় তা নিয়ে চিন্তা করে না, এটি শুধুমাত্র দুটি জিনিস জানতে চায়: সঠিকভাবে কী করতে হবে, এবং আপনার কতটা আত্মবিশ্বাস আছে?
এটাই ব্যাখ্যা করে যে কেন এক মাসের বেশি সময় পরে প্রকাশিত Jev এতটাই অস্বাভাবিক দেখাচ্ছে।

সুতরাং, জেভ সিদ্ধান্ত নিয়েছেন যে এআইকে কথা বলতে দেবেন না
সাধারণ বড় মডেলগুলি যদিও শেষ পর্যন্ত কেবলমাত্র "A নাকি B" উত্তর দিতে পারে, তবুও প্রায়শই টোকেন উত্পাদনের প্রক্রিয়া অতিক্রম করে।
জেভ সরাসরি এই অংশটি কেটে ফেলল।
এটি বর্তমানে মূলত তিনটি কাজ করছে:
নো, হ্যাঁ বা না উত্তর দিন;
চয়েস, কয়েকটি বিকল্পের মধ্যে একটি বাছুন;
স্কোর, স্ট্যান্ডার্ড অনুযায়ী স্কোর দিন।
তারপর সরাসরি বিচার এবং সম্ভাবনা ফেরত দিন।
আমি আপনার জন্য ছোট রচনা লিখব না, আর আপনার সাথে কথা বলব না।
অফিসিয়ালভাবে ঘোষিত এন্ড-টু-এন্ড ল্যাটেন্সি কেবলমাত্র 70–500 মিলিসেকেন্ড, যা সর্বশেষ মডেলের তুলনায় 20–200 গুণ দ্রুত এবং 40–400 গুণ সস্তা।
কিন্তু প্রকৃতপক্ষে গুরুত্বপূর্ণ বিষয়টি হল “দ্রুত” নয়, এর পরের সম্ভাবনা।
এর জন্য, TypeSafe একটি নতুন প্রশিক্ষণ পদ্ধতি প্রস্তাব করেছে: RLCD, Reinforcement Learning for Calibrated Decisions, ক্যালিব্রেটেড সিদ্ধান্তের জন্য শক্তিশালী শিক্ষা।
এটি যে সমস্যার সমাধান করতে চায় তা খুবই বাস্তবিক: যদি এআই আপনাকে বলে যে কোনো কিছু ঘটার ৮০% সম্ভাবনা আছে, তাহলে এই ৮০% কি বিশ্বাসযোগ্য?
আদর্শভাবে, 80% সম্ভাবনা হিসাবে মডেল দ্বারা নির্ণীত ঘটনাগুলির প্রায় 80% প্রকৃতপক্ষে ঘটা উচিত।
এটি অটোমেশন সিস্টেমে খুবই গুরুত্বপূর্ণ।
99% নিশ্চিত, সরাসরি কার্যকর করুন।
৫১% বিশ্বাস রাখে, এটিকে আরও শক্তিশালী এবং ব্যয়বহুল মডেলের দিকে ফেলে দিন, বা মানুষের দিকে পাঠান।
সমস্যাটি হল এটি যে AI জানে না, বরং AI জানে না যে এটি জানে না।
সুতরাং জেভ যা পরিবর্তন করতে চান, তা হলো এআই আউটপুটের লক্ষ্য।
গতকাল ChatGPT দ্বারা উত্পাদিত উত্তরগুলি মূলত মানুষের জন্য ছিল। জেভ দ্বারা প্রদানকৃত বিচার এবং সম্ভাবনা তবে সরাসরি সফটওয়্যারের জন্য প্রস্তুত করা হয়েছিল।

এজেন্ট যুগে, সম্ভবত একটি বড় মস্তিষ্কের প্রয়োজন নেই
এটাই ব্যাখ্যা করে যে কেন এখনই জেভ জনপ্রিয় হয়েছে।
যখন এজেন্ট প্রকৃতপক্ষে চালু হয়ে যায়, তখন এটি অসংখ্য ছোট সিদ্ধান্ত তৈরি করে:
পরবর্তী ধাপে কোন টুল ব্যবহার করবেন? এই ওয়েবসাইটে কোন বোতামে ক্লিক করবেন? এই তথ্যটি এখনও কাজে লাগবে? কাজটি সম্পূর্ণ হয়েছে কি না? ফলাফলটি আবার পরীক্ষা করা দরকার কি?
এই প্রশ্নগুলি একে একে দেখলে কঠিন নয়, কিন্তু একটি এজেন্ট একদিনে দশ লক্ষ, এককোটি বার বিচার করতে পারে।
যদি প্রতিবার সবচেয়ে শক্তিশালী মডেলকে ডাকা হয়, কয়েক সেকেন্ড গভীরভাবে চিন্তা করে একটি বড় টোকেন সমষ্টি তৈরি করা হয়, তাহলে খরচ এবং ল্যাটেন্সি দ্রুত বাড়ে।
জেভ যা ধরতে চায়, তা হলো এই স্তর।
জেভকে বহু প্রায়শই নেওয়া ছোট সিদ্ধান্তগুলি দিন, আর প্রকৃতপক্ষে জটিল যুক্তির প্রয়োজন হওয়া কাজগুলি বড় মডেলগুলিকে দিন।
এটাই কারণ যে টাইপসেফ Jev-কে সিস্টেম ওয়ান মডেল বলে।
এই ধারণাটি ড্যানিয়েল কানেম্যানের “সিস্টেম 1” এবং “সিস্টেম 2” থেকে এসেছে: একটি দ্রুত, স্বাভাবিক বিচারের জন্য দায়ী, অন্যটি ধীর, জটিল চিন্তার জন্য দায়ী।
Jev এর নামটিও "জেভন্স প্যারাডক্স" থেকে এসেছে:
একটি সম্পদ যখন আরও সস্তা হয়ে যায়, তখন মানুষ অবশ্যই তা কম ব্যবহার করবে না, বরং সম্ভবত আরও বেশি ব্যবহার করবে।
যদি একবার এআই ব্যবহার করা খরচি হয়, তাহলে আপনি শুধুমাত্র সবচেয়ে গুরুত্বপূর্ণ জায়গাগুলিতে এটি ব্যবহার করবেন।
কিন্তু যদি একবারে AI এমনভাবে সস্তা বলে মনে করে যে এটি প্রায় উপেক্ষা করা যায়?
একটি ইমেইল, একটি লগ, একটি টুল কল, একটি ওয়েবসাইটের বোতাম, বা এজেন্টের প্রতিটি ধাপে একটি এআই সিদ্ধান্ত যোগ করা যেতে পারে।
অবশ্যই, এখনই বলা যায় যে Jev পরবর্তী প্রজন্মের AI, তা অত্যন্ত আগে।
এর প্রতিশ্রুতিবদ্ধ "শূন্য হ্যালুসিনেশন" বলতে বেশিরভাগই এটি নির্দিষ্ট উত্তরের ধরন থেকে বেরিয়ে গিয়ে মিথ্যা তথ্য তৈরি করবে না, কিন্তু ভুল উত্তর বাছাই করবে না এমন কিছু নয়; 193.6 গুণ, 444.6 গুণের মতো চরম ডেটা মূলত TypeSafe-এর নিজস্ব পরীক্ষা থেকে এসেছে।
কিন্তু জেভ এবার এতটাই জনপ্রিয় হওয়ার সত্যিকারের মূল বিষয় হতে পারে যে এটি GPT বা Claude-এর চ্যালেঞ্জ করতে পারবে কিনা।
কিন্তু একজন চ্যাটজিপিটি তৈরি করার অংশগ্রহণকারী যিনি একটি আরও মৌলিক প্রশ্নের পুনরায় অনুসন্ধান করছেন:
গত কয়েক বছর ধরে, পুরো শিল্পটি ভাবছিল যে কীভাবে এআইকে বেশি সময় চিন্তা করতে এবং বেশি কথা বলতে দেওয়া যায়।
কিন্তু যদি ভবিষ্যতে প্রকৃতপক্ষে কয়েক বিলিয়ন মেশিনের মধ্যে বিচারের প্রয়োজন হয়, তবে AI প্রতিবার কেন “একটি বাক্য বলবে”?
ChatGPT মেশিনকে মানুষের সাথে কথা বলার শিক্ষা দিয়েছে।
এবং জেভের পরবর্তী বিনিয়োগ হল: যখন মানুষ স্ক্রিনের সামনে বসবে না, তখন মেশিনগুলি কি নিজেরাই সিদ্ধান্ত নিতে পারবে?
