Kinabigyan ng $40M Series A ni Vals AI na pinamumunuan ni a16z upang bumuo ng mga independiyenteng benchmark para sa AI model
2026/08/22 12:06:00

Ang funding round ay nagpapakita ng pagtaas ng pangangailangan para sa mga real-world na benchmark ng pagganap ng AI
Sa gitna ng Agosto 2026, inanunsyo ng Vals AI ang isang $40 milyong Series A round sa isang $400 milyong valuation, na pinamumunuan ni Andreessen Horowitz kasama ang pagkakasali ng mga umiiral na investor na 8VC, Pear VC, at Bloomberg Beta, pati na rin ang mga bagong tagasuporta na HRT Ventures at Next Ladder Ventures. Ang kumpanyang base sa San Francisco ay nagpapakilala bilang isang independiyenteng tagapag-evaluate ng mga frontier AI model, gumagawa ng mga benchmark na nagtataya sa performance sa ekonomikong may-kahulugan na propesyonal na trabaho kesa sa mga akademikong uri ng pagsusulit na malawak nang nasaturate. Ang mga resulta nito ay kumikilala na sa model cards mula sa OpenAI, Anthropic, Google, Meta, at xAI. Ang kita ay tumubo ng walong beses kumpara sa buong 2025, dumoble ang bilang ng mga customer, at tumatlong beses ang team sa loob ng anim na buwan.
Kasabay ng pagsasapilit, inilabas ni Vals ang Vals Smith para sa mga custom coding benchmarks na hinango mula sa anumang GitHub repository, ang RSI Index na nalikha kasama ang CoreWeave upang masukat ang mga kakayahan sa recursive self-improvement, ang ReverseEngBench na nilikha kasama ang mga mananaliksik mula sa Columbia, Tufts, UC Berkeley, at UCLA, at ang pinapalawig na Vals Index 2.0 na nagbibigay ng timbang sa performance batay sa kontribusyon ng sektor sa U.S. GDP. Ang mga hakbang na ito ay dumating habang ang mga negosyo ay nakakaranas ng patuloy na presyon upang tanggapin ang AI habang kulang sa maaasahang paraan upang sukatin ang return on investment, at habang ang mga gobyerno ay naghahanap ng sariling mga tukoy na sukat para sa frontier capabilities at cyber risk. Ang pangunahing teorya ay na ang mga independiyenteng, patuloy na isina-update na mga benchmark para sa propesyonal na gawain ay naging kritikal na imprastruktura para sa AI economy, at nagpapalapit sa lumalaking puwang sa pagitan ng mga score sa leaderboard na isinampa ng vendor at ang tunay na kakayahan na tapusin ang multi-step na gawain sa finance, batas, software engineering, at mga mataas na panganib na domain.
Bakit Nawala ang Kakayahan ng mga Tradisyonal na Leaderboard ng AI na Magbago sa Mga Paggawa ng Pasya sa Enterprise
Noong unang panahon, ang mga pampublikong akademikong benchmark ay nagbigay ng isang karaniwang wika para sa pagsubaybay sa pag-unlad ng mga modelo, ngunit isang pagsusuri noong Pebrero 2026 ng mga siyentipiko mula sa ETH Zurich at Stanford ay tumingin sa 60 malawakang ginagamit na pagtataya ng malalaking wika model at natuklasan na 29 sa kanila ay naging saturated, kung saan ang pagkakaiba sa performance sa pagitan ng unang at pangalawang modelo ay nasa loob ng ingay sa pagsukat. Ang contamination ay nangyayari kapag ang test data ay pumasok sa mga training corpora, minsan sa pamamagitan ng Common Crawl, habang ang mga laboratorio ay direktang pinapaganda ang kanilang mga modelo laban sa mga kilalang target. Ang resulta ay na ang mataas na marka sa MMLU, HumanEval, o mga katulad na suite ay hindi na maaasahan upang makapagpalaya ng tagumpay sa mga malinis, multi-step na propesyonal na workflow. Tinutugon ng Vals ito sa pamamagitan ng pagpapanatili ng mga pangunahing test sets bilang pribado, pagpapagtulungan sa mga eksperto sa larangan upang tukuyin ang mga kumakatawang gawain, at pagpapalabas ng mga benchmark kapag ito ay hindi na nakakadifferentiate ng mga modelo.
Noong Mayo 2026, palitan ng kumpanya ang dating pagtataya ng CorpFin ng mas mahirap na Excel Modelling Benchmark eksaktong dahil sa pagkabagsak ng pagkakaiba. Ang adaptive na pagkakasunod-sunod na ito ay tinuturing ang pagtataya mismo bilang patuloy na imprastruktura kaysa isang istatikong pagsusulit, na nagbibigay ng mas malinaw na signal sa mga enterprise habang pinipili ang mga modelo para sa production deployment. Ang opisyal na dokumentasyon sa metodolohiya ng kumpanya at ang pahayag tungkol sa investment ng a16z ay parehong nagteklar na ang mga pribadong, eksperto-na-curate na mga set na may patuloy na pagpapalit ay mas epektibong tumututol sa landas ng saturasyon kaysa sa ganap na pampubliko o purong pribadong istatikong pagsusulit.
Paano nila ginagawa ang mga benchmark ng Vals batay sa tunay mga propesyonal na proseso
Nagsasama ang Vals sa mga aktibong abogado, mga analista sa pondo, mga inhinyero sa software, at mga kliniko upang matukoy ang taxonomy ng mga gawain na nagtataglay ng kompetenteng trabaho sa bawat larangan, at pagkatapos ay bumubuo ng automated na sistema ng pagmamarka na sinusukat ang mga produkto ng trabaho batay sa mga pamantayan ng mga eksperto, hindi batay sa tamang sagot sa maraming pagpipilian o eksaktong pagkakatugma ng string. Kailangan ng isang karaniwang gawain sa Finance Agent v2 na ang isang agent ay kailangang makakuha ng suportang data mula sa mga dokumento, mag-synthesize ng mga modelo ng relative-value sa iba’t ibang kumpanya, matukoy ang mga catalyst sa sektor, at magbigay ng mga nakabatay na rekomendasyon sa pag-invest nang hindi nagbuo ng mga numero o nawawala sa konteksto sa bawat hakbang. Sa Mayo 2026, ang pinakamataas na marka ay nakamit lamang ng 52 porsyento na akurasye sa hanay na ito, na nagpapakita na kahit ang mga frontier system ay nababigo pa rin sa halos kalahati ng mga gawain na inaasahan mula sa isang propesyonal na analista.
Ang parehong pilosopiya ay nakakatugon sa legal na pag-aaral, pag-migrate ng code, terminal-based na inhinyeriya, at medical coding. Dahil ang pagmamarka ay awtomatiko ngunit na-calibrate sa husay ng mga eksperto, maaaring makapaglabas ng mga pagtataya sa loob ng ilang oras pagkatapos makareceba ng access sa model, na tumutugma sa kasalukuyang lingguhang takbo ng mga frontier release. Ang kumpanya ay open-sourced ang ilang bahagi ng kanilang evaluation infrastructure upang suportahan ang reproducibility habang ipinoprotektahan ang integridad ng mga pribadong test sets na nagpapagawa ng pangunahing mga score. Ang kombinasyon ng domain partnership, awtomatikong expert-level scoring, at mabilis na turnaround ang nagpapakilala sa platform mula sa mga akademikong leaderboard at mga purong preference-based na arena.
Ang paliwanag ni a16z para sa paglalayong punan ang pagsasakop sa halagang $400 milyon
Nilagay ni Andreessen Horowitz ang pag-invest sa paligid ng klasikong problema ng impormasyon na asimetrismo na ilarawan ni ekonomista na si George Akerlof: kapag alam ng mga nagbebenta ang mas marami tungkol sa kalidad ng produkto kaysa sa mga bumibili at may motibo silang ipakita ang positibong datos, bumabagsak ang mga merkado patungo sa mas mababang kalidad. Ipinaghambing ni Jennifer Li at ang kanyang mga kasamahan sa a16z ang pangangailangan para sa isang independiyenteng AI na tagapag-iskor sa pagdating sa historical na pagkakaroon ng Moody’s sa mga merkado ng kredito at ng mga independiyenteng auditor sa pag-uulat ng mga publikong kumpanya. Ang modelo ng kita ni Vals, na nag-uutos ng bayad para sa mga serbisyo ng pagsusuri kaysa sa pagpapatotoo sa anumang panlilinaw ng isang partikular na laboratorio, ay naglalayong panatilihin ang estruktural na independensya.
Ipinahiwatig ng kumpanya ang teknikal na depth ng mga tagapagtatag at matagal nang pagdududa sa wasto ng benchmark, na nagtatala na si Rayan Krishnan at Langston Nashold ay nagsasama na sa paglutas ng mga real-world na problema sa pagsukat habang nag-aaral ng computer science sa Stanford. Ang valuation ng round at ang pagkakaroon ng HRT Ventures na may kinalaman sa quantitative trading ay karagdagang palatandaan na ang mga sophisticated na kapital ay itinuturing ang tiyak na pagsukat bilang kritikal na infrastructure at hindi bilang periperal na pananaliksik. Ipinahalata ng opisyal na komentaryo ng a16z na ang mga modelo ay nagbabago mula sa pag-sagot sa mga tanong patungo sa pagpapatupad ng multi-hour agentic workflows, na nagpapataas ng gastos ng isang maling pagpili ng modelo mula sa paggastos ng token patungo sa nawawalang oras at resulta ng customer.
Mga Background ng mga Tagapagtatag at ang Mga Pinagmulan ng Independent-Evaluation Thesis
Si Rayan Krishnan, na naglilingkod bilang CEO ng kumpanya, ay may nakakatangi na background na naglalaman ng kanyang nakaraang paggawa sa Palantir, isang kilalang kumpanya sa data analytics. Ang kanyang co-founder, Langston Nashold, ay naghahatid ng posisyon bilang CTO at dala-dala ang malawak na karanasan mula sa kanyang panahon sa mga pangunahing tech company tulad ng Meta, NVIDIA, at Hudson River Trading. Ang dalawang founder ay unang nakasalubong sa isang backpacking trip bago ang orientation sa Stanford University, kung saan sila ay agad nagsilbing malapit. Pagkatapos ay nagtrabaho sila nang magkasama sa iba’t ibang kurso sa computer science, na nagdulot sa kanila ng isang mahalagang pag-unawa: ang mga malalaking language model ay may potensyal na magbago ng paraan ng paggawa. Gayunpaman, kilala rin nila na ang industriya ay patuloy na kulang sa kredible at epektibong paraan upang subukan ang mga modelong ito. Motibado ng kanilang mga pag-unawa, sila ay gumawa ng malakas na desisyon na umalis sa kanilang mga graduate program upang itatag ang Vals. Ang unang layunin ng kanilang bagong negosyo ay ang finance at coding tasks, na kanilang natukoy bilang kumakatawan sa malalaking bahagi ng ekonomikong aktibidad sa United States.
Habang umuunlad sila sa merkado, natanggap nila ang mga makabuluhang pagbanggit sa mga pangunahing model card at nakakuha ng suporta para sa kanilang mga inisyatiba mula sa Department of Commerce, pati na rin ang pakikilahok sa mga pagsisikap ng kongreso kaugnay ng patakaran sa AI. Ang mga tagapagtatag ay nagbibigay-diin sa kahalagahan ng patuloy na pagpapalit ng mga lumang benchmark at paggamit ng mga pribadong test set. Ang pagkakaroon ng ganitong pagkakasunod-sunod ay direkta resulta ng kanilang obserbasyon kung gaano kalakas ang mga model na makakamit ang pinakamataas na antas ng mga static benchmark at kung paano nakakaapekto ang training data sa mga pampublikong pagtataya. Ang kanilang pinagsamang karanasan sa production systems at quantitative environments ay malaki nang nagsilbing gabay sa disenyo ng evaluation stack, pati na rin sa komersyal na produkto na ngayon ay ginagamit ng mga enterprise upang piliin at suriin ang mga model na naka-ayos sa pinakamoderno ng teknolohiya.
Ang mga benchmark ng finance agent ay nagpapakita ng patuloy na pagkakaiba sa pagitan ng mga marka sa leaderboard at trabaho sa antas ng analyst
Bagaman ang mga modelo ay nakakamit ng halos perpektong resulta sa mga mas lumang akademikong suite, patuloy pa ring ipakita ng Finance Agent v2 suite ang malalaking kakulangan sa materyal na hindi maaaring balewalain. Ang mga gawain na kasali sa suite na ito ay kasama ang multi-document synthesis, relative-value modeling, at pagbuo ng rekomendasyon, na lahat ay malapit na tumutugma sa araw-araw na output na ginagawa ng mga propesyonal na financial analyst sa industriya. Ang 52 porsyento ang ceiling na nakarekord noong Mayo 2026 para sa pinakamataas na sistema ay isang malinaw na paalala na ang mataas na mga score sa pangkalahatang kaalaman ay hindi awtomatikong nangangahulugan ng mapagkakatiwalaan at awtonomong kakayahan sa financial analysis.
Ang Vals ay may estratehikong bigat sa kanyang kompositong Vals Index sa pamamagitan ng pag-uugnay sa approximated na kontribusyon ng sektor sa U.S. GDP, na nagbibigay ng malaking multiplier effect sa finance, upang siguraduhing tumpak na isinasaad sa aggregate na pagrereporma ng iba’t ibang modelo ang epekto ng ekonomiya. Ang mga enterprise na nakapag-deploy ng mga modelo na pinili ayon sa bahagya sa mga pagsusuri ng Vals ay nagsasalaysay na ginagamit ang platform hindi lamang para sa proseso ng pagpili ng una kundi pati na rin para sa patuloy na pagsusuri ng performance ng produkto kumpara sa mga itinakdang frontier baselines. Bukod dito, ang umiiral na puwang sa performance ay naglalaro rin ng mahalagang papel sa pagpapasiya tungkol sa pagkakaloob ng kapital sa loob ng mga institusyong pampinansyal. Dapat panghikayatin ng mga institusyong ito ang kanilang gastos sa AI gamit ang makikita at kuantipikadong pagtaas sa produktibidad kaysa mag-asa lamang sa kwalitatibong pagpapakita, na madalas ay subheto at mas maliit ang kapanatagan. Mahalaga ang patuloy na proseso ng pagsusuri upang siguraduhing nagdudulot ang mga investmeng sa AI ng makikita at mapapabuti ang operasyonal na epiisensiya.
Buksan ni Vals Smith ang mga custom coding benchmark na direktang hinango mula sa enterprise repositories
Sa pagpapahayag ng Series A, ginawa ni Vals ang Smith na pangkalahatang available, na nagpapahintulot sa anumang organisasyon na lumikha ng kustomisadong coding benchmark mula sa kanilang sariling GitHub repositories. Ang sistema ay naglalabas ng mga totoong gawain sa pag-unlad mula sa mga nakaraang pull request at naglalapat ng mga lihim na pagsubok upang matukoy kung ang isang modelo ay makakapagtapos ng gawain. Nakakatanggap ang mga user ng 120 libreng credit para magsimula. Para sa mga kumpanya na ang kanilang codebases ay naglalaman ng proprietary na mga pattern, library, at arkitektural na konbensyon, ang pagkakaiba sa pagitan ng pangkalahatang kakayahan sa Python o Java at ang kakayahang gumana sa loob ng partikular na kapaligiran ay desisibyo.
Kaya ni Smith ay isinasalin ang abstraktong tanong tungkol sa kakayahan sa pag-code sa isang konkretong, organisasyon-specific na pagsukat. Maaari ngayon ng mga maagang tagapag-adopt ng enterprise na magrank ng mga modelo batay sa kanilang sariling engineering workload kaysa sa mga pampublikong suite na maaaring bahagyang na-memorize o na-optimize. Ang paglabas ay nagpapalawak sa sakop ni Vals mula sa mga pre-built na domain benchmark patungo sa isang tailored na evaluation infrastructure na umaangkop sa pangangailangan ng customer.
Ang RSI Index at ang ReverseEngBench ay nagpapalawak ng sakop patungo sa mga frontier risk domains
Kasabay ng kamakailang pagsasapalaran, ipinakilala nang proud ng Vals ang RSI Index, na nilikha sa pakikipag-ugnayan sa CoreWeave. Ang inobatibong index na ito ay naglalayong suriin kung ang iba’t ibang modelo ay may kakayahang isagawa ang mga pananaliksik na gawain na mahalaga para sa pagpapabuti ng pag-unlad ng modelo, mga teknik ng kompresyon, mga pamamaraan ng pagtuturo, mga estratehiya sa pag-optimize ng parameter, mga praktika sa paggawa ng harness, at mga pagtataya pagkatapos ng pagtuturo. Bukod dito, ipinakilala ng kumpanya ang ReverseEngBench, isang proyekto na mabuting nilikha sa pakikipagtulungan sa mga kilalang akademikong institusyon, kabilang ang Columbia University, Tufts University, UC Berkeley, at UCLA. Ang komprehensibong benchmark na ito ay binubuo ng 19 proprietary na programa, na magkakasama ay naglalaman ng higit sa 16,000 na linya ng code.
Ang mga programa na ito ay sumasaklaw sa isang malawak na hanay ng mga larangan, kabilang ang mga network protocol, firmware, gaming applications, proseso ng pagkuha ng file-format, at malware analysis, lahat ng ito ay protektado ng isang malawak na anti-analysis suite na disenyo upang mapalakas ang seguridad. Ang mga maagang resulta ay nagpapakita ng malaking pagkakaiba sa pagitan ng mga lider sa harap ng mga modelo, na nagpapakita ng malaking potensyal na natitira bago makapag-reverse-engineer nang tumpak ang mga realistiko na binaries. Bukod sa mga pagsisikap na ito, sinimulan na rin ang maagang paggawa sa larangan ng mga aplikasyon sa kalusugan ng isip, kasama ang mga plano para sa karagdagang pagpapalawak sa mahahalagang larangan tulad ng pagtataya ng epekto sa kalikasan, militar na aplikasyon, at mga domain ng biosecurity. Ang mga pagtataya na ito, na nakatuon sa panganib, ay tumutukoy sa mga kakayahan na mahalaga para sa pagpapalakas ng seguridad ng mga enterprise at mga pagsusuri ng gobyerno sa mga pinakabagong sistema.
Ang Vals Index 2.0 ay nag-aagregate ng performance na binigyang-pugay ayon sa ekonomikong kontribusyon
Ang bagong disenyo ng website at ang Vals Index 2.0 ay may mas malawak na sakop sa iba’t ibang larangan, kabilang ang finansya, coding, at mga gawain sa batas. Ang mga timbang ng sektor na ginagamit sa Index ay nakabatay sa value-added data na ibinibigay ng Bureau of Economic Analysis. Ang kompositong pormula na ginagamit ay nag-aaverage ng mga pagsukat ng performance sa loob ng bawat sektor at pagkatapos ay pinagsasama ang mga score ng sektor batay sa kanilang approximated na bahagi sa GDP. Hanggang sa gitna ng Agosto 2026, nasa unahan ng Index ang Claude Opus 5, na agwat na sinundan ng Claude Fable 5 at GPT-5.6 Sol.
Ang Index ay ina-update sa madalas na batayan upang maipakita ang pinakabagong mga paglabas ng modelo at naglilingkod bilang isang pangunahing sukat na nagpapakita ng potensyal na epekto sa ekonomiya, habang nananatili pa ring nagbibigay-daan sa mga gumagamit na magpaliwanag sa mga indibidwal na leaderboard ng bawat domain para sa mas detalyadong mga insigh. Dahil sa katotohanan na ang mga batayang pagsusuri ay nananatiling karamihan ay pribado at binabago nang periodic, ang Index ay nakakapagpanatili ng kanyang pagkakaiba para sa mas mahabang panahon kumpara sa mga komposito na batay lamang sa publiko. Ang mga negosyo at mga mananaliksik ay tumitingin sa Index na hindi lamang para sa mga layunin ng relatif na pagrereklamo kundi pati na rin para sa paggawa ng mga pag-aaral sa trade-off ng gastos-latency-kakayahan sa kasalukuyang ecosystem ng modelo, upang siguraduhing gawin nila ang mga pinakamabisang desisyon batay sa pinakamakabuluang data na available.
Mga Pattern ng Pagtanggap ng Enterprise at ang Pangangailangan para sa Quantifiable ROI
Ang malalaking pagpapalawak ng AI ay lalong nag-iintegrase ng mga pagtataya ng Vals habang pinipili ang mga base model at habang sinusuri ang mga panloob na produkto kumpara sa mga metrikang pang-una. Ang kombinasyon ng mabilis na pagbabalik, spesipikong domain, at kalayaan ay epektibong tumutugon sa mga praktikal na hamon na kinakaharap ng mga koponan ng pagbili at mga teknikal na lider: ang mga scorecard ng vendor ay hindi na sapat para sa paggawa ng mga desisyon na may mataas na panganib.
Ang nakakapanumbalik na paglago ng kita na walong beses kumpara sa kabuuan ng taong 2025, kasama ang pagdoble ng bilang ng mga customer at pagtripla ng bilang ng mga empleyado sa loob ng anim na buwan lamang, ay malinaw na nagpapakita na ang demand ay lumipas na sa unang pagsubok patungo sa isang yugto ng operasyonal na pagkakabase. Ang mga gobyerno ay nakikilahok din sa platform upang makakuha ng mahalagang pag-unawa sa pagsukat ng kakayahan at cyber risk, kaya’t pinapalakas nito ang kahalagahan nito sa parehong komersyal at patakaran na konteksto. Ang kakayahan ng platform na manatili sa hakbang kasama ang mga paglabas ng modelo tuwing linggo ay nagpapanatili na ang signal ay kasalukuyan at may kahalagahan, at hindi nagpapahintulot na maging naiiwan ng ilang buwan sa harap.
Ecosystem at Structural Differentiation mula sa Mga Platform batay sa Preferensya
Kasama sa landscape ang iba pang mga pagsusuri, kabilang ang mga arena ng pagbabahagi ng pagpili na nag-aagamit ng mga husay ng tao sa mga bukas na output, pati na rin ang mga psychometric approach na naglalayong maikliin nang malaki ang oras ng pagsusuri. Nagsisilbing magkakaiba ang Vals sa pamamagitan ng kanyang expert-curated na disenyo ng propesyonal na gawain, na nagpapakatotoo ng mataas na kahalagahan at aplikasyon, kasama ang automated grading na mabuting inaayos upang matugunan ang mga itinakda na pamantayan sa larangan. Gumagamit ang kumpanya ng mga pribadong test set na patuloy na iniiwan upang mapanatili ang integridad ng kanilang mga pagsusuri, at mayroon itong ipinakita na record ng pagbanggit mula sa bawat pangunahing frontier laboratoryo sa larangan.
Ang tala na ito ay naglalayong maging mahalagang anyo ng pagkakakilanlan na dapat makamit ng mga bagong pumasok upang makakuha ng kredibilidad. Bukod dito, ang pagtutok ng kumpanya sa mga ekonomikong pinagbantayan, marami-salik na proseso, kaysa sa pagpapahalaga lamang sa paboritong talakayan o pure speed, ay nagpapahigpit sa kanya bilang mahalagang imprastruktura para sa paggawa ng mga batid na desisyon sa produksyon, kaysa sa pagiging isang tagapaglalaro lamang sa mga leaderboard ng pananaliksik. Nakikilala at pinapresyo ng mga investor ang natatanging pagkakaiba na ito sa nakakatandaan na halaga ng $400 milyon.
Pagsusuri para sa mga Developer ng Model at ang Tulin ng Pagsukat ng Kakayahan
Ang mga frontier laboratories ay ngayon ay gumagana sa isang kapaligiran kung saan ang mga independiyenteng score ay may panlabas na kredibilidad na kinakawala ng mga self-reported na numero. Ang pagbanggit sa model cards ay nagpapahiwatig sa mga enterprise buyer na ang mga resulta ay nailalabas sa pagsusuri ng ikatlong panig. Samantala, ang patuloy na paglikha ng mas mahihirap na benchmark ay itinataas ang antas na kailangang abutin ng bawat sunod-sunod na modelo. Ang proseso ng “hill-climbing” na nagdala sa pag-unlad ng AI ay nakakatagpo ng mas mataas at mas madalas na inirerefresh na mga bundok.
Ang mga developer na itinuturing ang pagtataya bilang panghuli ay baka makakatuklas ng mga kakulangan sa kakayahan lamang pagkatapos ng deployment; ang mga nagtatanim ng independiyenteng pagsusukat nang maaga ay maaaring magprioritize ng mga pagpapabuti na mahalaga para sa totoong trabaho. Ang pag-open-source ng mga piling komponente ng infrastraktura ay nagpapalakas pa ng pagkakaroon ng muling pagkakagawa habang pinoprotektahan ang mga pangunahing pribadong pagtataya na nagmumula sa pinakamataas na signal na mga marka.
Mas malawak na pangangailangan ng merkado para sa mga tiwalaang institusyon sa pagsukat
Habang lumalalim ang mga sistema ng AI sa mga proseso na may legal at pampinansyal na malalaking epekto, ang kakulangan ng independiyenteng pagsukat ay nagtataguyod ng mga panganib na katulad ng impormasyon-asimetriya na dati nang nagdulot ng mga ahensya ng pagrerebyu at mga auditor sa iba pang industriya. Ang mga sukat sa paglago ng Vals at ang antas ng kanyang mga tagasuporta ay nagpapakita na ang kapital ay nakikilala ang ganitong institutional gap. Ang ipinahayag na misyon ng kumpanya, na maging ang independiyenteng tagapagsusuri ng artificial intelligence, ay tumutugma sa mga praktikal na pangangailangan ng mga negosyo na naghahanap ng kalinawan sa ROI at ng mga patakaran na naghahanap ng pag-unawa sa kakayahan at panganib.
Ang patuloy na pagpapalawak sa karagdagang propesyonal at panganib na mga domain ay magtataas kung ang metodolohiya ay maaaring iskala habang pinapanatili ang kalayaan at kalidad ng signal. Sa kasalukuyan, ang kombinasyon ng mga bagong produkto, mabilis na komersyal na pagtanggap, at mataas na antas ng pagsisikap sa kapital ay nagtatatag ng Vals bilang sentral na puntos ng referensya para sa sinumang kailangang magdesisyon kung aling mga modelo ang talagang kayang gawin ang mahalagang trabaho.
Madalas na Itatanong
Ano ang eksaktong inanunsyo ng Vals AI sa kanyang Series A funding round?
Isara ng Vals AI ang kanilang Series A na $40 milyon sa halagang $400 milyon noong Agosto 13, 2026. Pinunohan ng Andreessen Horowitz ang round, kasama ang mga umuusbong na investor na 8VC, Pear VC, at Bloomberg Beta, at sumali ang mga bagong investor na HRT Ventures at Next Ladder Ventures. Samantala, inilabas ng kumpanya ang Vals Smith para sa custom coding benchmarks, ang RSI Index, ReverseEngBench, isang pinapalawig na Vals Index 2.0, at isang muli naitatayong website. Kumpirmado ng opisyal na pahayag mula sa Vals at a16z ang mga numero at kasamang paglalabas ng mga produkto.
Paano nagkakaiba ang Vals benchmarks sa mga publikong leaderboard tulad ng MMLU o SWE-bench?
Ang Vals ay nakatuon sa mga multi-step na propesyonal na workflow na natukoy kasama ang mga eksperto sa larangan at iskore ng automated na sistema na nakalatag sa mga pamantayan ng eksperto. Ang mga pangunahing test set ay nananatiling pribado at iniiwan kapag hindi na sila nakakadifferentiate ng mga modelo, na nagbabawas sa kontaminasyon at pagpapakalat ng optimization. Madalas na umabot sa saturation o lumalabas sa training data ang mga pampublikong akademikong suite, na naglalimita sa kanilang predictive value para sa mga totoong enterprise task. Ang pagkakasunod-sunod ng Vals ay nagbibigay ng resulta sa loob ng ilang oras pagkatapos ng access sa modelo at nasa mga model card ng mga pangunahing laboratorio na ito.
Ano ang kahalagahan ng markang 52 porsyento sa mga gawain ng Finance Agent?
Sa Mayo 2026, ang pinakamalaking modelo ay nakamit ang halos 52 porsyento na akurasya sa Finance Agent v2 suite, na nangangailangan ng relative-value modeling, document synthesis, at grounded recommendations. Ang numero ay nagpapakita na kahit ang pinakamalakas na available na mga sistema, ay nagkakaroon pa rin ng pagkabigo sa halos kalahati ng mga gawain na inaasahan mula sa isang propesyonal na financial analyst. Ang pagkakaiba sa pagitan ng academic scores at professional-task performance ay eksaktong problema na gustong sukatin at tulungan panghawakan ng Vals.
Sino ang mga tagapagtatag at anong karanasan ang dala nila?
Dating kay CEO Rayan Krishnan ay nagsimula sa Palantir. Ang CTO na si Langston Nashold ay may karanasan sa Meta, NVIDIA, at Hudson River Trading. Pareho silang nag-aral ng computer science sa Stanford at nagsimula ng pagtatrabaho kasama sa mga problema sa pagsukat bago itatag ang kumpanya. Ang kanilang mga background ay naglalaman ng karanasan sa production systems kasama ang quantitative at research perspectives na nagpapabuo sa pagte-teklado ni Vals sa masusing, adaptive na pag-evaluate.
Ano ang pinapagana ni Vals Smith para sa mga negosyo?
Pinapahintulutan ni Vals Smith ang anumang organisasyon na lumikha ng kustomisadong benchmark ng coding diretso mula sa kanilang GitHub repositories. Ang sistema ay nagmumula sa mga realistiko gawain sa pag-unlad mula sa kasaysayan ng mga pull request at naglalapat ng mga nakatagong pagsubok. Magsisimula ang mga gumagamit sa 120 libreng credit. Ang kasangkapan ay kumonbert ng generic na benchmark ng coding sa mga organisasyon-spesipikong pagsusuri na nagpapakita ng proprietary na code patterns at engineering practices.
Paano kinokonsidera ng Vals Index ang ekonomikong bigat?
Ang Index ay nag-aaggregat ng performance sa mga gawain sa finance, coding, at legal, at binabawasan ang mga average ng sektor batay sa kanilang approximated na kontribusyon sa U.S. GDP gamit ang data mula sa Bureau of Economic Analysis. Ang resultang composite ay nagbibigay ng isang pambungad na sukat ng potensyal na epekto sa ekonomiya habang nananatiling posible ang detalyadong pagsusuri sa mga resulta ng bawat domain. Ang Version 2.0 ay nagpalawak ng sakop at madalas na isinasaayos upang isama ang mga bagong paglabas ng model.
🔥 Nag-aalok ang KuCoin ng mas matatag na opsyon sa isang volatil na merkado
Kung nag-aalala ka sa madalas na pagtaas at pagbaba sa merkado, at hinahanap ang mas matatag na opsyon upang kumita nang pasibo, ang KuCoin ay ang tamang lugar para dumating:

Simple Earn: Mag-deposit at mag-withdraw ng mga token anumang oras, at kumita ng mga patatag na kita.
KuCoin Earn: Kumita ng mga matatag na kita gamit ang propesyonal na pamamahala ng mga ari-arian.
Hold to Earn: Kumita ng mga reward sa pamamagitan ng paghawak ng mga asset sa Funding, Trading, Margin, Futures, Mining, at Unified Accounts.
Staking: Buksan ang potensyal ng pagkakaroon ng mga asset sa chain.
Advanced Investments: Ang Advanced Investments ay nag-aalok ng iba’t ibang structured products upang tulungan ang iyong pera na lumago sa anumang merkado.
Shark Fin: Proteksyon sa Principal at Garantidong Kita
Dual Investment: Bumili nang mura at magbenta nang mahal na may transparent na kalkulasyon ng return.
Snowball: Mataas na kita, kasama ang pagprotekta sa presyo.
Discount Buy: Bumili ng crypto sa discounted na presyo.
KCS Loyalty: Pataasin ang antas upang makinabang sa eksklusibong benepisyo sa pamamagitan ng pag-stake ng ≥ 1 KCS.
KuCoin Wealth: Mag-discover ng hinaharap na halaga at magsimula ng iyong matalinong pag-invest.
KCS Benefits: Manatili at mag-stake ng KCS upang makakuha ng mga benepisyo sa buong platform.
KCS Staking 2.0: Makilahok sa on-chain governance ng KCS upang kumita ng yield.
Paalala: Ang nilalaman na ito ay para sa mga layuning impormasyonal lamang at hindi nagtataglay ng abiso sa pag-invest. Ang pag-invest sa cryptocurrency ay may panganib. Mangyaring gawin ang inyong sariling pag-aaral (DYOR).
Disclaimer: AI technology ang ginamit sa pag-translate ng page na ito para sa convenience mo. Para sa pinaka-accurate na impormasyon, mag-refer sa original na English version.
