Vals AI ने a16z के नेतृत्व में $40 मिलियन की सीरीज़ A फंडिंग एकत्र की है, जिससे स्वतंत्र AI मॉडल बेंचमार्क बनाए जाएंगे

Vals AI ने a16z के नेतृत्व में $40 मिलियन की सीरीज़ A फंडिंग एकत्र की है, जिससे स्वतंत्र AI मॉडल बेंचमार्क बनाए जाएंगे

2026/08/22 12:06:00

कस्टम इमेज

फंडिंग राउंड से पता चलता है कि वास्तविक दुनिया के AI प्रदर्शन बेंचमार्क की मांग बढ़ रही है

अगस्त 2026 के मध्य में, Vals AI ने $400 मिलियन के मूल्यांकन पर $40 मिलियन की सीरीज़ A राउंड की घोषणा की, जिसका नेतृत्व Andreessen Horowitz ने किया और मौजूदा निवेशकों 8VC, Pear VC और Bloomberg Beta के साथ-साथ नए समर्थक HRT Ventures और Next Ladder Ventures ने भाग लिया। सैन फ्रांसिस्को-आधारित कंपनी खुद को सीमांत AI मॉडलों का स्वतंत्र मूल्यांकनकर्ता स्थापित करती है, जो शैक्षणिक शैली के परीक्षणों के बजाय आर्थिक रूप से महत्वपूर्ण पेशेवर कार्य पर प्रदर्शन का मूल्यांकन करने के लिए मानक बनाती है, जो आज तक अधिकांशतः संतृप्त हो चुके हैं। इसके परिणाम पहले ही OpenAI, Anthropic, Google, Meta और xAI के मॉडल कार्ड्स में दिखाई दे चुके हैं। 2025 के सम्पूर्ण समय की तुलना में आय आठगुना बढ़ गई है, ग्राहक आधार दोगुना हो गया है, और टीम छह महीनों में तीनगुना हो गई है।
 
फंडिंग के साथ-साथ, वॉल्स ने किसी भी GitHub रिपॉजिटरी से लिए गए कस्टम कोडिंग बेंचमार्क के लिए Vals Smith जारी किया, CoreWeave के साथ विकसित RSI सूचकांक जो आत्म-सुधार क्षमताओं को मापता है, Columbia, Tufts, UC Berkeley और UCLA के शोधकर्ताओं के साथ बनाया गया ReverseEngBench, और एक विस्तारित Vals सूचकांक 2.0 जो U.S. GDP के प्रति क्षेत्र के योगदान के आधार पर प्रदर्शन को भार देता है। ये कदम तब आए हैं जब उद्यमों को AI अपनाने के लिए बढ़ते दबाव का सामना करना पड़ रहा है, जबकि निवेश पर प्रतिफल को मापने के लिए विश्वसनीय तरीके नहीं हैं, और सरकारें सीमांत क्षमताओं और साइबर जोखिम के लिए स्वतंत्र मापदंड ढूंढ रही हैं। मूल परिकल्पना यह है कि स्वतंत्र, निरंतर अपडेट होने वाले पेशेवर-कार्य बेंचमार्क AI अर्थव्यवस्था के लिए आवश्यक बुनियादी ढांचा बन गए हैं, जो विक्रेता-रिपोर्ट किए गए लीडरबोर्ड स्कोर और वित्त, कानून, सॉफ्टवेयर इंजीनियरिंग, और उच्च-जोखिम वाले क्षेत्रों में बहु-चरणीय कार्य पूरा करने की वास्तविक क्षमता के बीच बढ़ते हुए अंतर को समाप्त करते हैं।

क्यों पारंपरिक एआई लीडरबोर्ड्स उद्यम निर्णयों के लिए भविष्यवाणी क्षमता खो चुके हैं

पहले सार्वजनिक शैक्षिक मानक आधार पर मॉडल की प्रगति को ट्रैक करने के लिए एक साझा भाषा प्रदान करते थे, लेकिन ETH ज्यूरिख और स्टैनफोर्ड के शोधकर्ताओं द्वारा फरवरी 2026 में किए गए विश्लेषण में 60 अत्यधिक उपयोग किए जाने वाले बड़े-भाषा-मॉडल मूल्यांकनों की जांच की गई और पाया गया कि उनमें से 29 संतृप्त हो चुके हैं, जिसमें शीर्ष और दूसरे मॉडल के बीच प्रदर्शन का अंतर मापने के शोर के भीतर आ गया है। संक्रमण तब होता है जब परीक्षण डेटा प्रशिक्षण कॉर्पस में प्रवेश करता है, कभी-कभी कॉमन क्रॉल के माध्यम से, जबकि प्रयोगशालाएं पहचाने गए लक्ष्यों के खिलाफ सीधे अनुकूलन करती हैं। परिणामस्वरूप, MMLU, HumanEval या समान सूट पर उच्च स्कोर अब गंदे, बहु-चरणीय पेशेवर प्रवाहों पर सफलता का विश्वसनीय रूप से पूर्वानुमान नहीं लगा पाते। Vals इस समस्या को हल करता है द्वारा मुख्य परीक्षण सेट को निजी रखना, क्षेत्र के विशेषज्ञों के साथ साझेदारी करके प्रतिनिधित्वपूर्ण कार्यों को परिभाषित करना, और जब मॉडलों को अलग करना बंद हो जाए, तो मानकों को समाप्त करना।
 
मई 2026 में, कंपनी ने अपने पिछले CorpFin मूल्यांकन को एक कठिन Excel मॉडलिंग बेंचमार्क से बदल दिया, ठीक इसलिए कि भेदभाव गायब हो चुका था। यह अनुकूलन दृष्टिकोण मूल्यांकन को स्थिर परीक्षा के बजाय निरंतर बुनियादी ढांचे के रूप में मानता है, जिससे उद्यमों को उत्पादन तैनाती के लिए मॉडल चुनने में स्पष्ट संकेत मिलता है। कंपनी की पद्धति पर आधिकारिक दस्तावेज़ और a16z निवेश घोषणा दोनों ही यह जोर देते हैं कि निजी, विशेषज्ञ-संकलित सेट, जिनमें निरंतर प्रतिस्थापन होता है, पूरी तरह सार्वजनिक या केवल निजी स्थिर परीक्षाओं की तुलना में संतृप्ति मार्ग का अधिक प्रभावी ढंग से सामना करते हैं।

कैसे वाल्स वास्तविक पेशेवर कार्यप्रवाहों के आधार पर बेंचमार्क बनाता है

Vals, प्रथागत वकीलों, वित्तीय विश्लेषकों, सॉफ्टवेयर इंजीनियरों और चिकित्सकों के साथ साझेदारी करता है ताकि प्रत्येक क्षेत्र में योग्य कार्य को परिभाषित करने वाले कार्यों की वर्गीकरण प्रणाली का मानचित्रण किया जा सके, और फिर स्वचालित मूल्यांकन प्रणालियाँ विकसित करता है जो बहुविकल्पीय सही उत्तर या सटीक स्ट्रिंग मेल के बजाय विशेषज्ञ मानकों के खिलाफ उत्पादित कार्य का मूल्यांकन करती हैं। एक सामान्य Finance Agent v2 कार्य में एजेंट को दस्तावेजों से समर्थन डेटा प्राप्त करना, सहप्रतियोगी कंपनियों के बीच सापेक्ष मूल्य मॉडलों का संश्लेषण करना, क्षेत्र के प्रेरकों की पहचान करना, और आंकड़ों को भ्रमित न करते हुए और चरणों के बीच संदर्भ खोए बिना स्थिर निवेश सिफारिशें प्रस्तुत करना शामिल है। मई 2026 में, सर्वोच्च स्कोर प्राप्त मॉडल ने इस सूट पर केवल 52 प्रतिशत सटीकता प्राप्त की, जिससे यह सूचित होता है कि भले ही सीमांत प्रणालियाँ एक पेशेवर विश्लेषक द्वारा संभाले जाने की अपेक्षा किए गए कार्यों में से लगभग आधे में विफल होती हैं।
 
वही दर्शन कानूनी शोध, कोड स्थानांतरण, टर्मिनल-आधारित इंजीनियरिंग और चिकित्सा कोडिंग के लिए भी लागू होता है। क्योंकि ग्रेडिंग स्वचालित है लेकिन विशेषज्ञ निर्णय के अनुसार समायोजित है, इसलिए मॉडल तक पहुँच प्राप्त होने के कुछ घंटों के भीतर मूल्यांकन तैयार किए जा सकते हैं, जो वर्तमान साप्ताहिक अनुसूची के साथ मेल खाते हैं। कंपनी ने अपने मूल्यांकन बुनियादी ढांचे के कुछ हिस्सों को ओपन-सोर्स कर दिया है ताकि पुनरुत्पादनता का समर्थन किया जा सके, जबकि प्राथमिक स्कोर उत्पन्न करने वाले निजी परीक्षण सेट्स की पूर्णता की रक्षा की जा सके। प्रादेशिक साझेदारी, स्वचालित विशेषज्ञ-स्तरीय स्कोरिंग, और त्वरित प्रतिक्रिया का यह संयोजन इस प्लेटफॉर्म को शैक्षणिक लीडरबोर्ड और केवल प्राथमिकता-आधारित मंचों से अलग करता है।

a16z का $400 मिलियन मूल्यांकन पर राउंड की नेतृत्व करने का तर्क

एंड्रीसेन होरोविट्ज ने इस निवेश को अर्थशास्त्री जॉर्ज एकरलोफ द्वारा वर्णित क्लासिक जानकारी-असमानता समस्या के चारों ओर संरचित किया: जब विक्रेता उत्पाद की गुणवत्ता के बारे में खरीददारों की तुलना में अधिक जानते हैं और अनुकूल डेटा प्रस्तुत करने के लिए प्रेरित होते हैं, तो बाजार कम गुणवत्ता वाले परिणामों की ओर गिरते हैं। जेनिफर ली और a16z के सहयोगियों ने स्वतंत्र AI स्कोरकीपर की आवश्यकता की तुलना क्रेडिट बाजारों में मूडीज के ऐतिहासिक उदय और सार्वजनिक कंपनियों की रिपोर्टिंग में स्वतंत्र ऑडिटर्स के साथ की। वैल्स का आय मॉडल, जो किसी विशेष प्रयोगशाला के दावों की प्रमाणीकरण के बजाय मूल्यांकन सेवाओं के लिए शुल्क लेता है, संरचनात्मक स्वतंत्रता को बनाए रखने का लक्ष्य रखता है।
 
कंपनी ने संस्थापकों की तकनीकी डेप्थ और बेंचमार्क की वैधता के बारे में लंबे समय से अनुमान को उजागर किया, जिसमें यह नोट किया गया कि रयान कृष्णन और लैंग्स्टन नैशोल्ड ने स्टैनफोर्ड में कंप्यूटर साइंस का अध्ययन करते समय पहले ही वास्तविक दुनिया की माप समस्याओं पर सहयोग किया था। इस राउंड का मूल्यांकन और क्वांटिटेटिव-ट्रेडिंग-लिंक्ड HRT Ventures की भागीदारी यह भी संकेत देती है कि जटिल पूंजी विश्वसनीय माप को एक परिधीय शोध उपकरण के बजाय महत्वपूर्ण बुनियादी ढांचे के रूप में देखती है। a16z की आधिकारिक टिप्पणी पर जोर दिया गया है कि मॉडल अब प्रश्नों के उत्तर देने से बदलकर कई घंटे के एजेंटिक कार्यप्रवाहों को संचालित करने लगे हैं, जिससे एक खराब मॉडल के चयन की लागत टोकन खर्च से खोए हुए समय और ग्राहक परिणामों तक बढ़ गई है।

संस्थापकों की पृष्ठभूमि और स्वतंत्र-मूल्यांकन परिकल्पना की उत्पत्ति

रयान कृष्णन, जो कंपनी के सीईओ हैं, के पास पलैंटिर, एक प्रसिद्ध डेटा विश्लेषण कंपनी में पिछले काम का उल्लेखनीय अनुभव है। उनके सह-संस्थापक, लैंगस्टन नैशोल्ड, सीटीओ का पद रखते हैं और मेटा, एनविडिया और हडसन रिवर ट्रेडिंग जैसी प्रमुख टेक कंपनियों में अपने समय से अनुभव का समृद्ध संग्रह लाते हैं। दोनों संस्थापकों का पहला मिलन स्टैनफोर्ड विश्वविद्यालय पर एक प्री-ओरिएंटेशन बैकपैकिंग यात्रा के दौरान हुआ, जहां उन्होंने जल्दी ही एक बंधन बना लिया। बाद में उन्होंने कंप्यूटर साइंस के विभिन्न कोर्सवर्क पर सहयोग किया, जिससे उन्हें एक महत्वपूर्ण अवधारणा प्राप्त हुई: बड़े भाषा मॉडल कार्य के तरीके को क्रांतिकारी ढंग से बदल सकते हैं। हालांकि, उन्होंने यह भी महसूस किया कि उद्योग में इन मॉडलों की परीक्षा के लिए विश्वसनीय और प्रभावी तरीके अभी भी कम हैं। अपनी अवधारणाओं से प्रेरित होकर, उन्होंने अपने-अपने स्नातक कार्यक्रमों को छोड़कर Vals स्थापित करने का साहसिक निर्णय लिया। उनके नए उद्यम का प्रारंभिक ध्यान वित्त और कोडिंग कार्यों पर केंद्रित था, जिन्हें उन्होंने संयुक्त राज्य अमेरिका में आर्थिक गतिविधि के महत्वपूर्ण हिस्सों के रूप में पहचाना।
 
जब वे बाजार में लोकप्रियता प्राप्त करने लगे, तो उन्हें प्रमुख मॉडल कार्ड्स में उल्लेख किया गया और व्यापार विभाग से अपनी पहलों के लिए समर्थन प्राप्त हुआ, साथ ही AI नीति से संबंधित कांग्रेसी प्रयासों में शामिल हुए। संस्थापक अप्रचलित बेंचमार्क को निरंतर समाप्त करने और निजी परीक्षण सेट का उपयोग करने के महत्व पर प्रबल जोर देते हैं। यह दृष्टिकोण उनके अवलोकनों का परिणाम है कि मॉडल कैसे तेजी से स्थिर बेंचमार्क के शीर्ष पर पहुँच जाते हैं और प्रशिक्षण डेटा कैसे सार्वजनिक मूल्यांकन को प्रभावित कर सकता है। उनका उत्पादन प्रणालियों और मात्रात्मक परिवेशों में संयुक्त अनुभव आकलन स्टैक के डिज़ाइन के साथ-साथ उद्यमों द्वारा अब उपयोग किए जा रहे व्यावसायिक उत्पाद को भी महत्वपूर्ण रूप से प्रभावित किया है, जो प्रौद्योगिकी की कटनी के साथ मॉडल का चयन और निगरानी करता है।

फाइनेंस एजेंट बेंचमार्क्स से पता चलता है कि लीडरबोर्ड स्कोर और एनालिस्ट-लेवल के कार्य के बीच लगातार अंतर बना हुआ है

हालांकि मॉडल पुराने एकेडमिक सूट पर लगभग परफेक्ट परिणाम प्राप्त करते हैं, लेकिन फाइनेंस एजेंट v2 सूट अभी भी ऐसे महत्वपूर्ण कमियों को उजागर कर रहा है जिन्हें नज़रअंदाज़ नहीं किया जा सकता। इस सूट में शामिल कार्य मल्टी-डॉक्यूमेंट सिंथेसिस, रिलेटिव-वैल्यू मॉडलिंग और अनुशंसा जनरेशन को शामिल करते हैं, जो सभी उद्योग में पेशेवर वित्तीय विश्लेषकों द्वारा दैनिक उत्पादित किए जाने वाले कार्यों के समान हैं। मई 2026 में शीर्ष प्रणाली द्वारा दर्ज 52 प्रतिशत की सीमा एक स्पष्ट याददाश्त है कि उच्च सामान्य ज्ञान स्कोर स्वतः ही विश्वसनीय और स्वतंत्र वित्तीय विश्लेषण क्षमताओं के समान नहीं होते।
 
Vals अपने संयुक्त Vals सूचकांक को यू.एस. के सकल घरेलू उत्पाद (GDP) में लगभग क्षेत्रों के योगदान को ध्यान में रखकर भारित करता है, जिससे वित्त को एक उल्लेखनीय गुणक प्रभाव प्राप्त होता है, जिससे विभिन्न मॉडलों के समग्र रैंकिंग में आर्थिक प्रभाव को सटीकता से प्रतिबिंबित किया जाता है। ऐसे उद्यम जिन्होंने Vals मूल्यांकन के माध्यम से आंशिक रूप से चुने गए मॉडलों को सफलतापूर्वक लागू किया है, वे प्लेटफ़ॉर्म का उपयोग न केवल प्रारंभिक चयन प्रक्रिया के लिए, बल्कि स्थापित सीमांत आधारों के खिलाफ उत्पाद प्रदर्शन के निरंतर मापन के लिए भी करते हैं। इसके अलावा, प्रदर्शन में मौजूदा अंतर वित्तीय संस्थानों में पूंजी-आवंटन निर्णयों को सूचित करने में महत्वपूर्ण भूमिका निभाता है। इन संस्थानों को गुणात्मक प्रदर्शनों पर, जो अक्सर विषयगत और कम विश्वसनीय होते हैं, केवल निर्भर नहीं रहना होगा, बल्कि मापनीय उत्पादकता में वृद्धि के साथ अपने AI व्यय का औचित्य प्रस्तुत करना होगा। AI प्रौद्योगिकियों में निवेश से स्पष्ट लाभ और संचालन की कुशलता में सुधार प्राप्त होने की गारंटी के लिए यह निरंतर मूल्यांकन प्रक्रिया आवश्यक है।

वैल्स स्मिथ ने एंटरप्राइज रिपॉजिटरीज से सीधे निकाले गए कस्टम कोडिंग बेंचमार्क्स खोले

सीरीज़ A घोषणा के साथ, Vals ने Smith को सामान्य उपलब्ध कराया, जिससे किसी भी संगठन को अपने GitHub भंडारों से एक कस्टम कोडिंग बेंचमार्क बनाने की अनुमति मिलती है। प्रणाली ऐतिहासिक पुल अनुरोधों से वास्तविक विकास कार्यों को निकालती है और छिपे हुए परीक्षणों का उपयोग करके यह निर्धारित करती है कि क्या मॉडल कार्य पूरा कर सकता है। उपयोगकर्ताओं को शुरुआत के लिए 120 मुफ्त क्रेडिट मिलते हैं। ऐसी कंपनियों के लिए जिनके कोडबेस में स्वामित्व वाले पैटर्न, पुस्तकालय और आर्किटेक्चरल परंपराएँ होती हैं, सामान्य Python या Java क्षमता और उस विशिष्ट परिवेश में काम करने की क्षमता के बीच का अंतर निर्णायक होता है।
 
स्मिथ इसलिए कोडिंग क्षमता के अमूर्त प्रश्न को एक विशिष्ट, संगठन-विशिष्ट माप में रूपांतरित करते हैं। प्रारंभिक उद्यम अग्रणी अब सार्वजनिक सूटों के बजाय अपने वास्तविक इंजीनियरिंग कार्यभार पर मॉडलों को प्रदर्शन के आधार पर रैंक कर सकते हैं, जो आंशिक रूप से स्मृति में या अनुकूलित हो सकते हैं। इस रिलीज़ से Vals की पहुँच पूर्व-निर्मित डोमेन बेंचमार्क के बाहर, ग्राहक की आवश्यकताओं के साथ बढ़ने वाली अनुकूलित मूल्यांकन बुनियादी ढाँचे तक विस्तारित होती है।

RSI सूचकांक और ReverseEngBench की सीमा को सीमांत जोखिम क्षेत्रों में विस्तारित किया जाता है

हालिया फंडिंग के साथ, वाल्स ने कोरवेव के सहयोग से विकसित RSI सूचकांक की घोषणा की है। यह नवीन सूचकांक यह मूल्यांकन करने का प्रयास करता है कि विभिन्न मॉडल मॉडल विकास, संपीड़न तकनीकों, प्रशिक्षण विधियों, पैरामीटर अनुकूलन रणनीतियों, हार्नेस इंजीनियरिंग प्रथाओं और पोस्ट-ट्रेनिंग मूल्यांकन के लिए आवश्यक शोध कार्यों को निष्पादित करने में सक्षम हैं या नहीं। इसके अलावा, कंपनी ने ReverseEngBench नामक एक प्रोजेक्ट पेश किया है, जिसे कोलंबिया विश्वविद्यालय, टफ्ट्स विश्वविद्यालय, UC बर्कले और UCLA सहित मान्यता प्राप्त शैक्षणिक संस्थानों के साथ सूक्ष्मता से विकसित किया गया है। यह व्यापक बेंचमार्क 19 स्वामित्व वाले प्रोग्रामों से मिलकर बना है, जो मिलकर औसतन 16,000 से अधिक पंक्तियों कोड का औसत है।
 
इन कार्यक्रमों का विस्तृत रूप से नेटवर्क प्रोटोकॉल, फर्मवेयर, गेमिंग अनुप्रयोग, फाइल-फॉर्मेट रिकवरी प्रक्रियाओं और मैलवेयर विश्लेषण जैसे क्षेत्रों में विस्तार है, जिन सभी की सुरक्षा एक व्यापक एंटी-एनालिसिस सूट द्वारा की जाती है जो सुरक्षा को बढ़ाने के लिए डिज़ाइन किया गया है। प्रारंभिक परिणाम दर्शाते हैं कि अग्रणी सीमा मॉडलों के बीच एक महत्वपूर्ण भिन्नता है, जो यह दर्शाती है कि एजेंट्स वास्तविक बाइनरी को लगातार रिवर्स-इंजीनियर करने से पहले अभी भी काफी क्षमता शेष है। इन प्रयासों के अलावा, मानसिक स्वास्थ्य अनुप्रयोगों के क्षेत्र में प्रारंभिक चरण का कार्य भी शुरू किया गया है, और पर्यावरणीय प्रभाव मूल्यांकन, सैन्य अनुप्रयोग और जैविक सुरक्षा क्षेत्रों में आगे विस्तार की योजना है। ये मूल्यांकन, जो जोखिम के प्रति उन्मुख हैं, उन क्षमताओं को समेटते हैं जो उद्यम सुरक्षा स्थिति को मजबूत करने और अग्रणी प्रणालियों के सरकारी मूल्यांकन के लिए महत्वपूर्ण हैं।

Vals सूचकांक 2.0 आर्थिक योगदान के आधार पर प्रदर्शन को संयोजित करता है

पुनर्डिज़ाइन किए गए वेबसाइट और वैल्स सूचकांक 2.0 अब वित्त, कोडिंग और कानूनी कार्यों सहित विभिन्न क्षेत्रों में काफी विस्तृत कवरेज प्रदान करते हैं। सूचकांक में उपयोग किए गए क्षेत्रीय भार ब्यूरो ऑफ इकोनॉमिक एनालिसिस द्वारा प्रदान किए गए मूल्य-वर्धित डेटा से निकाले गए हैं। उपयोग किए गए समग्र सूत्र में प्रत्येक क्षेत्र के भीतर प्रदर्शन मापदंडों का औसत लिया जाता है और फिर इन क्षेत्रीय स्कोर को उनके GDP के अनुमानित हिस्से के आधार पर मिलाया जाता है। 2026 के मध्य अगस्त तक, क्लॉड ओपस 5 सूचकांक में सबसे आगे है, जिसके तुरंत बाद क्लॉड फेबल 5 और GPT-5.6 Sol आते हैं।
 
सूचकांक को नवीनतम मॉडल रिलीज़ को दर्शाने के लिए अक्सर अपडेट किया जाता है और यह एक एकल प्रमुख मीट्रिक के रूप में कार्य करता है जो संभावित आर्थिक प्रभाव को दर्शाता है, जबकि उपयोगकर्ताओं को अधिक विस्तृत जानकारी के लिए व्यक्तिगत क्षेत्र के लीडरबोर्ड में जाने की अनुमति देता है। चूंकि आधारभूत मानक अधिकांशतः निजी रहते हैं और नियमित रूप से अपडेट किए जाते हैं, इसलिए सूचकांक पूर्णतः सार्वजनिक संयोजनों की तुलना में लंबे समय तक अपनी विशिष्टता को बनाए रखने में सक्षम है। उद्यम और शोधकर्ता दोनों इस सूचकांक का संदर्भ न केवल सापेक्ष रैंकिंग के उद्देश्य से, बल्कि वर्तमान मॉडल परितंत्र के भीतर लागत-लेटेंसी-क्षमता के व्यापार-विश्लेषण के लिए भी करते हैं, जिससे वे सबसे प्रासंगिक उपलब्ध डेटा के βाधार पर सूचित निर्णय ले सकें।

उद्यम अपनाने के पैटर्न और मापने योग्य ROI की मांग

बड़े पैमाने पर AI डिप्लॉयमेंट्स, बेस मॉडल्स का चयन करते समय और आंतरिक उत्पादों का फ्रंटियर प्रदर्शन मीट्रिक्स के खिलाफ मूल्यांकन करते समय, वैल्स मूल्यांकनों को अधिकाधिक एकीकृत कर रहे हैं। त्वरित टर्नअराउंड, डोमेन-विशिष्टता और स्वतंत्रता के इस संयोजन ने खरीद टीमों और तकनीकी नेताओं के सामने आने वाली व्यावहारिक चुनौतियों को प्रभावी ढंग से हल कर दिया है: वेंडर स्कोरकार्ड्स अब उच्च-जोखिम वाले निर्णय लेने के लिए पर्याप्त नहीं हैं।
 
2025 के पूरे समय की तुलना में आठ गुना की उल्लेखनीय आय वृद्धि, छह महीनों में गुणित ग्राहक आधार और तिगुना कर्मचारी संख्या स्पष्ट रूप से दर्शाती है कि मांग प्रारंभिक प्रयोग के चरण के पार चली गई है और संचालनात्मक निर्भरता के चरण में प्रवेश कर चुकी है। सरकारें भी क्षमता मापन और साइबर जोखिम के बारे में मूल्यवान जानकारी प्राप्त करने के लिए इस प्लेटफॉर्म के साथ जुड़ चुकी हैं, जिससे व्यावसायिक और नीतिगत संदर्भों में इसका महत्व बढ़ता है। सप्ताहिक मॉडल रिलीज़ के साथ चले जाने की प्लेटफॉर्म की क्षमता सुनिश्चित करती है कि सिग्नल वर्तमान और प्रासंगिक बना रहे, बजाय कई महीनों तक सीमा से पीछे रहने के।

परितंत्र और पसंद-आधारित प्लेटफॉर्म से संरचनात्मक भिन्नता

अन्य मूल्यांकन प्रयास वास्तव में इस क्षेत्र में मौजूद हैं, जिनमें खुले उत्तरों पर मानव निर्णयों को एकत्रित करने वाले प्राथमिकता-मतदान के मंच शामिल हैं, साथ ही मूल्यांकन समय को काफी कम करने का लक्ष्य रखने वाले मनोवैज्ञानिक दृष्टिकोण भी हैं। वॉल्स अपने विशेषज्ञ-संशोधित पेशेवर कार्य डिज़ाइन के माध्यम से अपने आप को अलग करता है, जो उच्च संबंधिता और लागूकरण सुनिश्चित करता है, साथ ही स्थापित क्षेत्र मानकों को पूरा करने के लिए सूक्ष्म रूप से समायोजित स्वचालित अंकन के साथ। कंपनी अपने मूल्यांकनों की अखंडता को बनाए रखने के लिए निरंतर समाप्त किए जाने वाले निजी परीक्षण सेट का उपयोग करती है, और इसके पास क्षेत्र के प्रत्येक प्रमुख सीमांत प्रयोगशाला द्वारा प्रदर्शित संदर्भ रिकॉर्ड है।
 
यह संदर्भ रिकॉर्ड एक महत्वपूर्ण कानूनी मान्यता का कार्य करता है जिसे नए प्रवेशकर्ताओं को विश्वसनीयता प्राप्त करने के लिए प्राप्त करने की आवश्यकता होती है। इसके अलावा, कंपनी का आर्थिक रूप से भारित, बहु-चरणीय प्रक्रियाओं पर जोर, जो केवल संवादात्मक प्राथमिकता या शुद्ध गति पर निर्भर नहीं है, इसे शोध लीडरबोर्ड्स में केवल एक प्रतियोगी के रूप में नहीं, बल्कि सूचित उत्पादन निर्णय लेने के लिए एक महत्वपूर्ण बुनियादी ढांचे के रूप में स्थापित करता है। निवेशकों ने स्पष्ट रूप से इस अद्वितीय भिन्नता को पहचाना है और इसे $400 मिलियन के प्रभावशाली मूल्यांकन में समाहित कर दिया है।

मॉडल डेवलपर्स के लिए निष्कर्ष और क्षमता माप की गति

अब फ्रंटियर प्रयोगशालाएँ एक ऐसे परिवेश में कार्य कर रही हैं, जहाँ स्वतंत्र स्कोर की बाह्य विश्वसनीयता होती है, जबकि स्व-रिपोर्ट किए गए नंबरों की विश्वसनीयता लगातार कम हो रही है। मॉडल कार्ड में संदर्भित करना उद्योग खरीददारों को संकेत देता है कि परिणामों को तीसरे पक्ष की समीक्षा के अधीन किया गया है। एक साथ, कठिन बेंचमार्क के निरंतर निर्माण से अगले मॉडल्स द्वारा पार किए जाने वाले मानक को ऊँचा कर दिया जा रहा है। इसलिए, AI प्रगति को आगे बढ़ाने वाली “पहाड़ी चढ़ाई” प्रक्रिया के सामने अब अधिक ऊँची और अधिक बार-बार अपडेट होने वाली पहाड़ियाँ हैं।
 
विकासक जो मूल्यांकन को बाद की बात समझते हैं, उनका खतरा है कि वे केवल डिप्लॉयमेंट के बाद ही क्षमता अंतर का पता लगाएंगे; जो लोग पहले से स्वतंत्र मापन को एकीकृत करते हैं, वे ऐसे सुधारों को प्राथमिकता दे सकते हैं जो वास्तविक कार्य के लिए महत्वपूर्ण हैं। चयनित अवसंरचना घटकों का ओपन-सोर्सिंग अतिरिक्त रूप से पुनरुत्पादन को प्रोत्साहित करता है, जबकि सर्वोच्च-सिग्नल स्कोर्स उत्पन्न करने वाले मूल निजी मूल्यांकनों की सुरक्षा करता है।

विश्वसनीय मापन संस्थानों की व्यापक बाजार की आवश्यकता

जैसे-जैसे एआई प्रणालियाँ कानूनी और वित्तीय रूप से प्रभावशाली प्रक्रियाओं में गहराई से शामिल हो रही हैं, स्वतंत्र मापन की अनुपस्थिति ऐसे ही सूचना-असमानता जोखिम पैदा करती है, जो पिछले समय में अन्य उद्योगों में रेटिंग एजेंसियों और ऑडिटर्स के उदय का कारण बनी थी। वॉल्स के विकास मापदंड और उसके समर्थकों की योग्यता से पता चलता है कि पूंजी इस संस्थागत अंतर को पहचानती है। कंपनी का घोषित मिशन, कृत्रिम बुद्धिमत्ता का स्वतंत्र मूल्यांकनकर्ता बनना, आय रिटर्न की स्पष्टता की आवश्यकता रखने वाले उद्यमों और क्षमता और जोखिम के बारे में जानकारी की आवश्यकता रखने वाले नीति निर्माताओं की व्यावहारिक आवश्यकताओं के साथ संगत है।
 
अतिरिक्त पेशेवर और जोखिम क्षेत्रों में विस्तार से परीक्षण होगा कि यह विधि स्वतंत्रता और सिग्नल की गुणवत्ता को बनाए रखते हुए स्केल हो पाती है या नहीं। अभी के लिए, हाल के उत्पाद लॉन्च, त्वरित व्यावसायिक अपनाने और उच्च-प्रोफ़ाइल पूंजी की प्रतिबद्धता के संयोजन से Vals को उन सभी के लिए केंद्रीय संदर्भ बिंदु बना दिया गया है जिन्हें यह निर्णय लेना होगा कि कौन से मॉडल वास्तव में महत्वपूर्ण कार्य कर सकते हैं।

अक्सर पूछे जाने वाले प्रश्न

Vals AI ने अपने सीरीज़ A फंडिंग राउंड में क्या घोषणा की?

Vals AI ने 13 अगस्त, 2026 को $400 मिलियन के मूल्यांकन पर $40 मिलियन की सीरीज़ A बंद की। एंड्रीसेन हॉरोविट्ज़ ने इस राउंड का नेतृत्व किया, जिसमें मौजूदा निवेशक 8VC, Pear VC और Bloomberg Beta ने वापसी की और नए निवेशक HRT Ventures और Next Ladder Ventures शामिल हुए। कंपनी ने एक साथ कस्टम कोडिंग बेंचमार्क के लिए Vals Smith, RSI सूचकांक, ReverseEngBench, विस्तारित Vals Index 2.0 और एक पुनर्निर्मित वेबसाइट जारी की। Vals और a16z दोनों के आधिकारिक बयानों ने इन संख्याओं और साथ ही हुए उत्पाद लॉन्च की पुष्टि की।
 

Vals बेंचमार्क, MMLU या SWE-bench जैसे सार्वजनिक लीडरबोर्ड से कैसे भिन्न हैं?

Vals, डोमेन विशेषज्ञों के साथ परिभाषित बहु-चरणीय पेशेवर कार्यप्रवाहों पर केंद्रित है और विशेषज्ञ मानकों के अनुसार कैलिब्रेट किए गए स्वचालित प्रणालियों द्वारा स्कोर किए जाते हैं। प्राथमिक परीक्षण सेट निजी रहते हैं और जब वे मॉडलों को अलग करना बंद कर देते हैं, तो उन्हें समाप्त कर दिया जाता है, जिससे संक्रमण और अनुकूलन खेल कम होता है। सार्वजनिक शैक्षणिक सूट अक्सर संतृप्त हो जाते हैं या प्रशिक्षण डेटा में रिस जाते हैं, जिससे वास्तविक उद्यम कार्यों के लिए उनकी भविष्यवाणी क्षमता सीमित हो जाती है। Vals का दृष्टिकोण मॉडल एक्सेस के कुछ घंटों के भीतर परिणाम प्रदान करता है और पहले ही प्रमुख प्रयोगशालाओं के मॉडल कार्ड में दिखाई देता है।
 

फाइनेंस एजेंट कार्यों पर 52 प्रतिशत स्कोर का क्या महत्व है?

मई 2026 में, अग्रणी मॉडल ने फाइनेंस एजेंट v2 सूट पर लगभग 52 प्रतिशत सटीकता प्राप्त की, जिसमें सापेक्ष मूल्य मॉडलिंग, दस्तावेज संश्लेषण और आधारित सिफारिशें शामिल हैं। यह आंकड़ा दर्शाता है कि यहां तक कि सबसे मजबूत उपलब्ध प्रणालियां भी एक पेशेवर वित्तीय विश्लेषक की अपेक्षित लगभग आधी कार्यों में विफल रहती हैं। शैक्षणिक स्कोर और पेशेवर-कार्य प्रदर्शन के बीच यह अंतर ही वह समस्या है जिसे Vals मापने का प्रयास करता है और इसे समाप्त करने में मदद करता है।
 

संस्थापक कौन हैं और उनके पास क्या अनुभव है?

सीईओ रयान कृष्णन पहले पलांटिर में काम कर चुके हैं। सीटीओ लैंगस्टन नैशोल्ड के पास मेटा, एनविडिया और हडसन रिवर ट्रेडिंग में अनुभव है। दोनों ने स्टैनफोर्ड में कंप्यूटर साइंस का अध्ययन किया और कंपनी की स्थापना से पहले मापन समस्याओं पर सहयोग करना शुरू कर दिया। उनके पृष्ठभूमि में उत्पादन प्रणालियों का अनुभव और मात्रात्मक और शोध संबंधी दृष्टिकोण शामिल हैं, जो वैल्स के कठोर, अनुकूलनयोग्य मूल्यांकन पर जोर को आकार देते हैं।
 

वैल्स स्मिथ उद्यमों के लिए क्या सक्षम बनाता है?

Vals Smith किसी भी संगठन को अपने GitHub रिपॉजिटरी से एक कस्टम कोडिंग बेंचमार्क बनाने की अनुमति देता है। यह प्रणाली ऐतिहासिक पुल रिक्वेस्ट से वास्तविक विकास कार्य निकालती है और छिपे हुए परीक्षण लागू करती है। उपयोगकर्ता 120 मुफ्त क्रेडिट्स के साथ शुरू करते हैं। यह उपकरण सामान्य कोडिंग बेंचमार्क को संगठन-विशिष्ट माप में रूपांतरित करता है जो स्वामित्व वाले कोड पैटर्न और इंजीनियरिंग अभ्यासों को प्रतिबिंबित करते हैं।
 

वैल्स सूचकांक आर्थिक भार को कैसे शामिल करता है?

सूचकांक वित्त, कोडिंग और कानूनी कार्यों के प्रदर्शन को एकत्रित करता है, फिर ब्यूरो ऑफ इकोनॉमिक एनालिसिस डेटा का उपयोग करके सेक्टर औसतों को संयुक्त राज्य अमेरिका के सकल घरेलू उत्पाद (जीडीपी) में उनके अनुमानित योगदान के अनुसार भारित करता है। परिणामी संयुक्त माप व्यक्तिगत क्षेत्र परिणामों की विस्तृत जांच की अनुमति देते हुए संभावित आर्थिक प्रभाव का एकल मुख्य माप प्रदान करता है। संस्करण 2.0 ने कवरेज का विस्तार किया है और नए मॉडल रिलीज़ को दर्शाने के लिए अक्सर अपडेट किया जाता है।

🔥 KuCoin एक अस्थिर बाजार में एक अधिक स्थिर विकल्प प्रदान करता है

अगर आप बाजार में अक्सर होने वाले उतार-चढ़ाव की चिंता करते हैं और पैसे कमाने के लिए एक अधिक स्थिर विकल्प ढूंढ रहे हैं, तो KuCoin आने के लिए सही जगह है:
 
कस्टम इमेज
 
Simple Earn: कभी भी टोकन डिपॉज़िट करें और विड्रॉ करें, स्थिर रिटर्न कमाएं।
KuCoin अर्न: पेशेवर संपत्ति प्रबंधन के साथ स्थिर लाभ कमाएं।
कमाने के लिए होल्ड करें: फंडिंग, ट्रेडिंग, मार्जिन, फ़्यूचर्स, माइनिंग और यूनिफाइड खातों में संपत्ति होल्ड करके रिवॉर्ड्स कमाएं।
स्टेकिंग: ऑन-चेन संपत्तियों की कमाई की क्षमता को अनलॉक करें।
उन्नत निवेश: उन्नत निवेश आपके पैसे को किसी भी बाजार में बढ़ाने में मदद करने के लिए विभिन्न संरचित उत्पाद प्रदान करते हैं।
शार्क फिन: मूलधन सुरक्षा और गारंटीकृत लाभ
दोहरा निवेश: कम में खरीदें और अधिक में बेचें, पारदर्शी रिटर्न की गणना के साथ।
स्नोबॉल: उच्च आय, मूल्य सुरक्षा के साथ।
छूट पर खरीदें: क्रिप्टो को छूट की कीमतों पर खरीदें।
KCS लॉयल्टी: ≥ 1 KCS स्टेक करके एक्सक्लूसिव लाभों का आनंद लें।
KuCoin वेल्थ: भविष्य के मूल्य की खोज करें और अपनी स्मार्ट निवेश यात्रा शुरू करें।
KCS लाभ: प्लेटफॉर्म पर लाभ प्राप्त करने के लिए KCS रखें और स्टेक करें।
KCS स्टेकिंग 2.0: आय कमाने के लिए KCS पर ऑन-चेन गवर्नेंस में भाग लें।

उपयोग के लिए छूट: यह सामग्री केवल सूचनात्मक उद्देश्यों के लिए है और निवेश सलाह नहीं है। क्रिप्टोकरेंसी निवेश में जोखिम होता है। कृपया अपनी खुद की शोध करें (DYOR)।
 

डिस्क्लेमर: इस पेज का भाषांतर आपकी सुविधा के लिए AI तकनीक का इस्तेमाल करके किया गया है। सबसे सटीक जानकारी के लिए, मूल अंग्रेजी वर्जन देखें।