लेखक: झु श्वेयिंग
इन दो दिनों, एक थोड़ा असामान्य एआई मॉडल अचानक वायरल हो गया।
इसका नाम जेव है।
बातचीत नहीं करता, कोड नहीं लिखता, यहां तक कि ChatGPT की तरह आपको एक लंबा उत्तर भी नहीं बनाता। यह सिर्फ एक काम करता है: निर्णय लेना।
लेकिन ऐसा लगने वाला मॉडल, जिसकी क्षमता में बहुत बड़ी कमी हुई है, अचानक डेवलपर समुदाय में लोकप्रिय हो गया।
कुछ लोग इसका उपयोग 40 सेकंड में 724 रियल-टाइम विज्ञापनों का विश्लेषण करने और कुल 8724 निर्णय लेने के लिए करते हैं; कुछ लोग इसे Claude Code में जोड़कर अनावश्यक संदर्भ को साफ करते हैं; और कुछ इसे AI Agent के लिए "न्यायाधीश" के रूप में उपयोग करते हैं, जो यह जांचता है कि कार्य वास्तव में पूरा हुआ है या नहीं। LangChain भी Jev को Agent आकलनकर्ता के रूप में परीक्षण करना शुरू कर चुका है।
और इससे भी अधिक, गति और कीमत।
TypeSafe द्वारा प्रकाशित परीक्षणों में, Jev ने अधिकतम 193.6 गुना तक गति बढ़ाई और लागत को अधिकतम 444.6 गुना तक कम किया। प्रति एक मिलियन Token के लिए इनपुट केवल 0.042 डॉलर है, और आउटपुट Token मुफ्त हैं।
एक ऐसा AI जिसकी क्षमता कम लगती है, वह अचानक क्यों लोकप्रिय हो गया?
क्योंकि एजेंट युग में, AI को शायद केवल "गहन विचार" की आवश्यकता नहीं है, बल्कि अत्यधिक, त्वरित और सस्ते निर्णयों की भी आवश्यकता है: अगला कदम क्या है, कौन सा उपकरण उपयोग करना है, कार्य वास्तव में पूरा हो गया है या नहीं। और महत्वपूर्ण बात यह है कि भविष्य में ये निर्णय AI को बैकग्राउंड में स्वयं लेने होंगे, और मनुष्य को स्क्रीन के सामने हमेशा बैठे रहने की आवश्यकता नहीं होगी। Jev को वे छोटे निर्णय पसंद हैं, जो प्रतिदिन कई मिलियन बार हो सकते हैं।
अधिक दिलचस्प बात यह है कि Jev मॉडल के संस्थापक डियोगो अल्मेइडा ने वास्तव में RLHF में भाग लिया था, और अब वह RLHF पर पुनर्विचार कर रहे हैं: यह ट्रेनिंग विधि, जिसने ChatGPT को उपयोगी बनाया, शायद AI को वास्तविक रूप से स्वचालित करने के लिए उपयुक्त नहीं है।
एक महीने से अधिक पहले, अल्मेइडा ने एक भाषण दिया था। अब पीछे मुड़कर देखें, तो वह भाषण लगभग Jev का “विचारों का निर्देशिका” है।


AI उच्च गणित कर सकता है, फिर भी कस्टमर सर्विस क्यों नहीं कर पा रहा?
डियागो अल्मेडा की प्रोफाइल असामान्य है।
वह OpenAI में काम कर चुके हैं और GPT-4, ChatGPT और InstructGPT/RLHF से संबंधित कार्यों में शामिल रहे हैं। अर्थात, उन्होंने आज के बड़े मॉडल के सबसे महत्वपूर्ण पोस्ट-ट्रेनिंग पैटर्न के निर्माण में सीधे हिस्सा लिया है।
लेकिन उस भाषण में, उन्होंने शुरुआत में ही खुद को मजाक में लिया, और कहा कि वे OpenAI के कुछ न्यूनतम लोगों में से एक हैं जो खुले तौर पर ChatGPT की आलोचना करते हैं।
उनका विषय अधिक सीधा है: What's Next After RLHF?
डियागो ने पहले एक ऐसा प्रश्न उठाया जो विरोधाभासी लगता था।
आज के बड़े मॉडल बहुत कठिन गणित के प्रश्नों, कोड और तर्क तथा विभिन्न बेंचमार्क को चुनौती दे सकते हैं।
लेकिन जब कई कंपनियाँ वास्तव में स्वचालित करना चाहती हैं, तब भी लोगों को हटाया नहीं जा सकता।
जैसे कस्टमर सपोर्ट।
AI को जानकारी खोजने, दस्तावेज़ सारांशित करने और उत्तर तैयार करने के लिए उपयोग करना समस्याहीन है।
लेकिन अगर AI खुद फैसला करे: यह पैसा वापस किया जाए या नहीं? क्या इस उपयोगकर्ता को क्षतिपूर्ति करनी चाहिए?
कंपनी तुरंत सावधान हो गई।
ऐसी बातें जो उच्च गणित से कहीं अधिक सरल लगती हैं, फिर भी इन्हें AI को क्यों नहीं सौंपा जाता?
डियागो का उत्तर बहुत सरल है: आज का AI सहायता में अद्भुत है, ऑटोमेशन में नहीं।
आज का AI आपके काम में मदद करने में बहुत अच्छा है, लेकिन अभी भी खुद से काम पूरा करने में असमर्थ है।
ये दोनों चीजें एक दूसरे से थोड़ी सी भिन्न लगती हैं, लेकिन वास्तव में बिल्कुल अलग हैं।
Claude Code जितना भी शक्तिशाली हो, आप आमतौर पर कंप्यूटर के सामने बैठे रहते हैं। यह कोड लिखता है, आप देखते हैं; यह फाइलें बदलता है, आप जांचते हैं; गलती होती है, तो आप उसे फिर से बदलने को कहते हैं।
इसलिए डियोगो के अनुसार, क्लॉड कोड अभी भी चैटजीपीटी द्वारा शुरू किए गए "सहायता युग" का हिस्सा है।
What is real automation?
व्यक्ति मौजूद नहीं था।
AI पृष्ठभूमि में खुद निर्णय लेता है और खुद कार्रवाई करता है, एक दिन में यह दसों हजार या लाखों बार चल सकता है, और आप कभी नहीं देख पाएंगे कि इसने क्या किया।
इसलिए सवाल उठता है: आज का AI इतना बुद्धिमान क्यों है, लेकिन फिर भी इंसानों के बिना अकेला नहीं रह सकता?
डियागो ने अपने बहुत परिचित चीज़—RLHF पर निशाना साधा।

हमने एआई को प्रशिक्षित करते समय इंसानों को लूप में शामिल कर लिया।
इस बात में कुछ हद तक व्यंग्य है।
क्योंकि RLHF, वही तकनीकी राह है जिसमें डियोगो ने उस समय योगदान दिया था।
RLHF का मूल तर्क वास्तव में जटिल नहीं है: मानव प्राथमिकताओं को इकट्ठा करें, और फिर मॉडल को मानव प्राथमिकताओं के अनुसार और अधिक अनुकूलित करें।
तो डियोगो ने अपने भाषण में एक बहुत सीधी व्याख्या दी: आज के बड़े मॉडल्स को हमेशा एक इंसान की आवश्यकता क्यों होती है?
क्योंकि इसे ट्रेन करते समय, हमने अक्षरशः इंसानों को उस लूप में डाल दिया।
मॉडल शुरू से ही सीख रहा है: लोग किस प्रकार के उत्तर को पसंद करते हैं?
यह बड़े मॉडल की एक ऐसी विशेषता को भी समझाता है जिसके बारे में हम पहले से ही बहुत अच्छी तरह जानते हैं—भले ही वह ना जानता हो, वह अक्सर इतना सटीक लगता है।
डियागो ने स्थान पर एक बहुत तीखा उदाहरण दिया।
किसी ने चैटजीपीटी को एक पेट की आवाज़ का रिकॉर्डिंग भेजा और उसे बताया कि यह उसकी रचित संगीत है, और उससे "ईमानदारी से और स्पष्टता से" मूल्यांकन करने को कहा।
चैटजीपीटी ने गंभीरता से तारीफ की कि यह एक बहुत ही डरावनी और अजीब माहौल वाली वातावरण संगीत है।
डियागो ने एक वाक्य में सारांश दिया: “Overpromising is a feature.”
Overpromising is not a bug, it's a feature.
चैट उत्पाद के लिए, यह जीवन-मरण का मुद्दा नहीं है। उपयोगकर्ता अभी भी स्क्रीन के सामने हैं, गलतियाँ सुधारी जा सकती हैं।
लेकिन वास्तविक स्वचालित प्रणाली बिल्कुल अलग होती है।
मशीन आपके जवाब को अच्छा या बुरा नहीं सोचती, इसे बस दो बातें जाननी होती हैं: वास्तव में क्या करना है, और आपको इसमें कितना विश्वास है?
इसलिए समझ में आता है कि एक महीने से अधिक बाद जारी किए गए Jev क्यों इतने असामान्य लग रहे हैं।

तो, जेव ने AI को बिल्कुल "बोलने" नहीं दिया
सामान्य बड़े मॉडल भले ही अंततः केवल "A या B" का उत्तर देने की आवश्यकता हो, अक्सर टोकन उत्पन्न करने की प्रक्रिया से गुजरते हैं।
Jev ने इस भाग को सीधे हटा दिया।
यह वर्तमान में मुख्य रूप से तीन कार्य कर रहा है:
नो, जी हाँ या नहीं का उत्तर दें;
चुनें, कुछ विकल्पों में से एक चुनें;
Score, standard ke hisaab se score karein.
फिर निर्णय और संभावना तुरंत लौटाएं।
मैं आपके लिए छोटा निबंध नहीं लिखूंगा और आपके साथ बातचीत नहीं करूंगा।
आधिकारिक रूप से घोषित एंड-टू-एंड लेटेंसी 70–500 मिलीसेकंड तक है, जो अग्रणी मॉडल की तुलना में 20–200 गुना तेज है और कीमत 40–400 गुना सस्ती है।
लेकिन वास्तविक रूप से महत्वपूर्ण बात “तेज” नहीं, बल्कि उसके बाद की संभावना है।
इसके लिए, TypeSafe ने एक नया प्रशिक्षण विधि प्रस्तावित की है: RLCD, Reinforcement Learning for Calibrated Decisions, कैलिब्रेटेड निर्णय के लिए प्रवर्धन अधिगम।
यह जिस समस्या को हल करना चाहता है, वह बहुत वास्तविक है: अगर AI आपको बताए कि किसी चीज के होने की 80% संभावना है, तो यह 80% वाकई में भरोसेमंद है?
आदर्श रूप से, जिन चीजों के लिए मॉडल ने 80% संभावना निर्धारित की है, उनमें अंततः लगभग 80% ही सच होना चाहिए।
यह ऑटोमेटेड सिस्टम में बहुत महत्वपूर्ण है।
99% की आशा के साथ, सीधे निष्पादित करें।
51% की आशा के साथ, इसे अधिक शक्तिशाली और महंगे मॉडल को दे दें, या फिर इसे मनुष्य को सौंप दें।
असली समस्या यह नहीं है कि AI नहीं जानता, बल्कि यह है कि AI नहीं जानता कि वह नहीं जानता।
तो जेव वास्तव में बदलना चाहता है, AI आउटपुट का लक्ष्य।
पिछले ChatGPT द्वारा उत्पन्न उत्तर मुख्य रूप से मनुष्यों के लिए थे। Jev द्वारा दिए गए निर्णय और संभावनाएँ, तो सीधे सॉफ्टवेयर के लिए तैयार की गई थीं।

एजेंट युग में, शायद एक बड़ा दिमाग नहीं चाहिए
यह भी समझाता है कि जेव ठीक अभी क्यों लोकप्रिय हो गया।
क्योंकि एजेंट को वास्तविक रूप से चलाने के बाद, यह असंख्य छोटे निर्णय उत्पन्न करेगा:
अगला कौन सा टूल कॉल करें? इस वेबसाइट पर कौन सा बटन दबाएं? इस सूचना का कोई उपयोग है? क्या कार्य पूरा हो गया? क्या परिणाम को फिर से जांचना चाहिए?
इन प्रश्नों को अलग-अलग देखने पर कोई मुश्किल नहीं है, लेकिन एक एजेंट एक दिन में दर्ज़नों लाख, लाखों बार निर्णय लेने की आवश्यकता हो सकती है।
अगर हर बार सबसे शक्तिशाली मॉडल को कॉल किया जाए, कुछ सेकंड के लिए "गहराई से सोचा" जाए और फिर एक बड़ा टोकन सेट उत्पन्न किया जाए, तो लागत और लेटेंसी जल्दी ही बढ़ जाती है।
जेव जिस स्तर को पकड़ना चाहता है, वही है।
जेव को बड़ी संख्या में उच्च आवृत्ति वाले छोटे निर्णय दें, और वास्तविक रूप से जटिल तर्क की आवश्यकता वाले कार्यों को ही बड़े मॉडल को सौंपें।
यही कारण है कि TypeSafe Jev को System One Model कहता है।
यह अवधारणा डैनियल कानेमैन के "सिस्टम 1" और "सिस्टम 2" से आती है: एक त्वरित, अनुभवजन्य निर्णय के लिए और दूसरा धीमे, जटिल विचार के लिए।
Jev का नाम भी "जेवन्स पैराडॉक्स" से आया है:
एक संसाधन जब और अधिक सस्ता होता है, तो लोग इसका उपयोग कम नहीं करते, बल्कि अक्सर अधिक करते हैं।
अगर एक बार AI का उपयोग करना महंगा है, तो आप केवल सबसे महत्वपूर्ण जगहों पर ही इसका उपयोग करेंगे।
लेकिन अगर एक बार में AI इतना सस्ता मान ले कि लगभग नजरअंदाज किया जा सके?
एक ईमेल, एक लॉग, एक टूल कॉल, एक वेब पेज बटन, या एजेंट द्वारा किया गया प्रत्येक कदम, एक AI निर्णय को शामिल कर सकता है।
बेशक, अभी Jev को अगली पीढ़ी की AI कहना बहुत जल्दी है।
इसका जो "शून्य भ्रम" कहा जाता है, उसका अर्थ अधिकतर यह है कि यह निर्धारित उत्तर प्रकार के बाहर नहीं निकलकर गलत जानकारी नहीं देगा, लेकिन गलत चयन करने से नहीं बचेगा; 193.6 गुना, 444.6 गुना जैसे चरम आंकड़े मुख्य रूप से TypeSafe के स्वयं के परीक्षणों से आए हैं।
लेकिन जेव के इस बार के वायरल होने का वास्तविक ध्यान देने योग्य पहलू शायद यह नहीं है कि यह GPT या Claude को चुनौती दे सकता है या नहीं।
लेकिन एक ऐसा व्यक्ति जिसने ChatGPT बनाने में हिस्सा लिया है, वह एक और अधिक मूलभूत प्रश्न पर पुनः विचार कर रहा है:
पिछले कुछ वर्षों में, पूरा उद्योग सोच रहा था कि AI को अधिक समय तक सोचने और अधिक बोलने के लिए कैसे बनाया जाए।
लेकिन यदि भविष्य में वास्तव में लाखों मशीनों के बीच निर्णय की आवश्यकता है, तो AI प्रत्येक बार क्यों "एक वाक्य कहता है"?
ChatGPT ने मशीनों को लोगों के साथ बात करना सिखाया।
और जेव द्वारा अगला अनुमान है: जब इंसान स्क्रीन के सामने नहीं बैठेंगे, तो मशीनें क्या खुद निर्णय ले सकती हैं?
