Vals AI зібрала $40 млн серії A під керівництвом a16z для створення незалежних еталонів моделей ШІ
2026/08/22 12:06:00

Раунд фінансування свідчить про зростаючий попит на реальні еталони продуктивності ШІ
У середині серпня 2026 року Vals AI оголосила про серію A на $40 мільйонів при оцінці в $400 мільйонів, яку очолив Andreessen Horowitz при участи існуючих інвесторів 8VC, Pear VC та Bloomberg Beta, а також нових інвесторів HRT Ventures та Next Ladder Ventures. Компанія з Сан-Франциско позиціонує себе як незалежний оцінювач передових моделей ШІ, створюючи стандарти, які оцінюють продуктивність на економічно значущій професійній роботі, а не на академічних тестах, які вже майже насичені. Її результати вже з’являються у картках моделей від OpenAI, Anthropic, Google, Meta та xAI. Дохід збільшився в вісім разів порівняно з усім 2025 роком, кількість клієнтів подвоїлася, а команда збільшилася втричі за шість місяців.
Разом із фінансуванням Vals представив Vals Smith для кастомних кодових тестів, заснованих на будь-якому репозиторії GitHub, RSI Індекс, розроблений разом із CoreWeave для вимірювання здатностей рекурсивного самовдосконалення, ReverseEngBench, створений разом із дослідниками з Колумбійського, Трафсського, Каліфорнійського університету в Берклі та UCLA, та розширений Vals Index 2.0, який враховує продуктивність за внеском секторів до ВВП США. Ці кроки відбуваються на тлі зростаючого тиску на підприємства щодо прийняття ШІ при відсутності надійних способів вимірювання рентабельності інвестицій, а також коли уряди шукають незалежні показники передових можливостей і кіберризиків. Основна ідея полягає в тому, що незалежні, постійно оновлювані професійні тести завдань стали необхідною інфраструктурою для економіки ШІ, закриваючи зростаючий розрив між рейтингами, повідомленими виробниками, і реальною здатністю виконувати багатокрокову роботу у фінансах, праві, програмуванні та галузях з високим ризиком.
Чому традиційні рейтингові списки ШІ втратили прогностичну потужність для підприємницьких рішень
Раніше академічні публічні стандарти надавали спільну мову для відстеження прогресу моделей, але аналіз, проведений у лютому 2026 року дослідниками з ETH Zurich та Стенфорду, вивчив 60 широко використовуваних оцінок великих мовних моделей і виявив, що 29 з них досягли насичення: розрив у продуктивності між першою та другою моделями впав у межі вимірювального шуму. Забруднення відбувається, коли тестові дані потрапляють до навчальних корпусів, іноді через Common Crawl, а лабораторії також оптимізують моделі безпосередньо проти відомих цілей. В результаті високі бали на MMLU, HumanEval або подібних наборах більше не можна надійно використовувати для передбачення успіху у складних, багатокрокових професійних процесах. Vals вирішує цю проблему, зберігаючи основні тестові набори закритими, співпрацюючи з експертами у галузі для визначення репрезентативних завдань та виводячи з ужитку оцінки, які перестали розрізняти моделі.
У травні 2026 року компанія замінила свою попередню оцінку CorpFin на складніший експеримент Excel Modelling Benchmark саме через те, що диференціація зникла. Цей адаптивний підхід розглядає оцінку як безперервну інфраструктуру, а не статичний іспит, надаючи підприємствам чіткіший сигнал при виборі моделей для впровадження у виробництво. Офіційна документація щодо методології компанії та оголошення про інвестицію a16z підкреслюють, що приватні, експертно сформовані набори з постійною заміною краще опоряджують шлях насичення, ніж повністю публічні або чисто приватні статичні тести.
Як Vals створює еталони на основі реальних професійних робочих процесів
Vals співпрацює з практикуючими юристами, фінансовими аналітиками, інженерами-програмістами та клініцистами, щоб відобразити таксономію завдань, що визначають компетентну роботу в кожній галузі, а потім розробляє автоматизовані системи оцінювання, які оцінюють згенеровані робочі продукти за стандартами експертів, а не за правильністю вибору з кількох варіантів або точним співпадінням рядків. Типове завдання Finance Agent v2 вимагає від агента отримати підтримуючі дані з документів, синтезувати моделі відносної вартості між конкурентними компаніями, визначити секторальні катализатори та надати обґрунтовані інвестиційні рекомендації без вигадування цифр або втрати контексту на кожному етапі. У травні 2026 року найкраща модель досягла лише 52 відсотків точності на цьому наборі завдань, що свідчить про те, що навіть передові системи все ще невдали приблизно у половині завдань, які очікуються від професійного аналітика.
Та сама філософія застосовується до юридичних досліджень, міграції коду, інженерії на основі терміналу та медичного кодування. Оскільки оцінювання автоматизоване, але налаштоване на експертні судження, оцінки можуть бути отримані протягом кількох годин після отримання доступу до моделі, що відповідає поточному тижневому графіку випусків передових рішень. Компанія відкрила частину своєї інфраструктури оцінювання для підтримки відтворюваності, зберігаючи при цьому цілісність приватних тестових наборів, які генерують основні бали. Ця комбінація доменних партнерств, автоматизованого оцінювання на рівні експертів та швидкого часу виконання відрізняє платформу від академічних рейтингів та чисто преференційних середовищ.
Обґрунтування a16z щодо лідерства в раунді при оцінці в $400 мільйонів
Andreessen Horowitz обґрунтувала інвестицію через класичну проблему інформаційної асиметрії, описану економістом Джорджем Акерлофом: коли продавці знають більше про якість продукту, ніж покупці, і мають стимули подавати сприятливі дані, ринки деградують до результатів нижчої якості. Дженіфер Лі та її колеги з a16z порівняли потребу у незалежному оцінювачі штучного інтелекту з історичним виникненням Moody’s на ринках кредитів та незалежних аудиторів у звітності публічних компаній. Модель доходів Vals, яка стягує плату за послуги оцінки, а не за підтвердження тверджень будь-якої конкретної лабораторії, має за мету зберегти структурну незалежність.
Фірма звернула увагу на технічну глибину засновників та довготривалу скептичну позицію щодо валідності еталонів, зазначивши, що Раян Крішнан та Лангстон Нешолд вже співпрацювали над проблемами вимірювання у реальному світі, вивчаючи інформатику у Стенфорді. Оцінка раунду та участь HRT Ventures, пов’язаної з квантовою торгівлею, додатково свідчать про те, що сучасний капітал вважає надійне вимірювання критичною інфраструктурою, а не периферійним дослідницьким інструментом. Офіційний коментар a16z підкреслює, що моделі переходять від відповідей на запитання до виконання багатогодинних агентних робочих процесів, що підвищує вартість неправильного вибору моделі з витрат на токени на втраченний час та негативні наслідки для клієнтів.
Походження засновників та походження тези незалежної оцінки
Раян Крішнан, який є генеральним директором компанії, має відомий досвід роботи в Palantir — відомій фірмі з аналізу даних. Його співзасновник, Ленгстон Нешолд, займає посаду CTO і має величезний досвід роботи у таких великих технологічних компаніях, як Meta, NVIDIA та Hudson River Trading. Обидва засновники вперше зустрілися під час пішохідного походу перед орієнтацією в Стенфордському університеті, де швидко встановили зв’язок. Пізніше вони співпрацювали над різними курсами з інформатики, що привело їх до важливого висновку: великі мовні моделі мають потенціал революціонізувати спосіб ведення роботи. Однак вони також усвідомили, що в галузі все ще відсутні надійні та ефективні методи тестування цих моделей. Натхнені своїми інсайтами, вони прийняли сміливе рішення залишити свої відповідні аспірантські програми, щоб заснувати Vals. Початковою метою їхнього нового підприємства були фінансові та програмні завдання, які, як вони визначили, становлять значну частину економічної діяльності в США.
Коли вони почали набирати популярність на ринку, їх відзначили у головних моделях карток та отримали підтримку від Міністерства торгівлі, а також участь у конгресових ініціативах, пов’язаних із політикою ШІ. Засновники приділяють велику увагу важливості постійного виведення з ужитку застарілих еталонів та використання приватних тестових наборів. Цей підхід є прямим результатом їхніх спостережень щодо швидкості, з якою моделі можуть досягти піку статичних еталонів, та того, як навчальні дані можуть впливати на публічні оцінки. Їхній спільний досвід у системах виробництва та кількісних середовищах значно вплинув на розробку стеку оцінки, а також комерційного продукту, який підприємства зараз використовують для вибору та моніторингу моделей у відповідності з передовими досягненнями технологій.
Бенчмарки фінансових агентів виявили постійні розбіжності між рейтинговими балами та роботою аналітиків
Хоча моделі досягають майже ідеальних результатів на старіших академічних наборах, набір Finance Agent v2 продовжує виявляти значні суттєві недоліки, які не можна ігнорувати. Завдання, що входять до цього набору, охоплюють синтез багатодокументних даних, моделювання відносної вартості та генерацію рекомендацій — усе це тісно відтворює щоденний вихід професійних фінансових аналітиків у галузі. Поріг у 52 відсотки, зафіксований у травні 2026 року для лідируючої системи, є яскравим нагадуванням про те, що високі показники загальних знань не означають автоматично надійних та автономних здібностей до фінансового аналізу.
Vals стратегічно визначає вагу свого складного індексу Vals, враховуючи приблизний внесок секторів у ВВП США, що надає фінансовому сектору значний множниковий ефект і забезпечує точне відображення економічного впливу в загальному рейтингу різних моделей. Підприємства, які успішно внедрили моделі, відібрані частково на основі оцінок Vals, повідомляють, що використовують платформу не лише для початкового процесу відбору, але й для постійного вимірювання продуктивності продукту порівняно з встановленими фронтальними базовими показниками. Крім того, існуючий розрив у продуктивності також відіграє ключову роль у формуванні рішень щодо розподілу капіталу в фінансових установах. Цим установам потрібно обґрунтовувати свої витрати на ШІ за допомогою кількісних показників зростання продуктивності, а не полагоджуватися лише на якісних демонстраціях, які часто можуть бути суб’єктивними і менш надійними. Цей постійний процес оцінки є необхідним для забезпечення того, щоб інвестиції в технології ШІ приносили помітні переваги та покращення оперативної ефективності.
Vals Smith відкриває кастомні кодові тестові стенді, створені безпосередньо з підприємствених репозиторіїв
З оголошенням серії A Vals зробив Smith загальнодоступним, дозволивши будь-якій організації створювати кастомний кодовий бенчмарк зі своїх репозиторіїв GitHub. Система витягує реальні завдання розробки з історичних pull request і застосовує приховані тести, щоб визначити, чи може модель виконати цю роботу. Користувачі отримують 120 безкоштовних кредитів для початку. Для компаній, чиї кодові бази містять власні шаблони, бібліотеки та архітектурні угоди, різниця між загальною компетентністю у Python або Java та здатністю працювати в цьому конкретному середовищі є вирішальною.
Тому Сміт перетворює абстрактне питання про кодувальні здібності на конкретний, специфічний для організації показник. Ранні підприємствені впроваджувачі тепер можуть ранжувати моделі за продуктивністю на реальних інженерних завданнях, а не на загальнодоступних наборах, які можуть бути частково запам’ятані або оптимізовані під них. Випуск розширює діапазон Vals за межі попередньо створених доменних тестів до налаштованої інфраструктури оцінки, яка масштабується залежно від потреб клієнтів.
Індекс RSI та ReverseEngBench розширюють охоплення на передові ризикові домени
У поєднанні з останнім фінансуванням Vals гордо представила RSI Індекс, розроблений у співпраці з CoreWeave. Цей інноваційний індекс має за мету оцінити, чи здатні різні моделі виконувати дослідницькі завдання, необхідні для просування розробки моделей, технік стиснення, методів навчання, стратегій оптимізації параметрів, практик інженерії харнессів та післянавчальних оцінок. Крім того, компанія представила ReverseEngBench — проект, ретельно розроблений у співпраці з авторитетними академічними закладами, зокрема Колумбійським університетом, Університетом Тафтс, UC Берклі та UCLA. Цей всебічний бенчмарк складається з 19 власних програм, які разом у середньому містять понад 16 000 рядків коду.
Ці програми охоплюють різноманітні галузі, включаючи мережеві протоколи, прошивки, ігрові додатки, процеси відновлення файлових форматів та аналіз шкідливого ПЗ, всі вони захищені розширеним набором засобів проти аналізу, призначених для підвищення безпеки. Попередні результати свідчать про значну різницю між лідерами на передовому краю, що виявляє великий потенціал, що залишився, перш ніж агенти зможуть стабільно зворотно розробляти реалістичні бінарні файли. Крім цих зусиль, на початковому етапі також розпочато роботу в галузі застосунків для психічного здоров’я, з планами подальшого розширення на критичні сфери, такі як оцінка впливу на навколишнє середовище, військові застосунки та біобезпека. Ці оцінки, спрямовані на ризики, стосуються здатностей, що є ключовими як для підвищення рівня безпеки підприємств, так і для урядових оцінок передових систем.
Vals Index 2.0 агрегує продуктивність, зважену за економічним внеском
Перероблений веб-сайт та Vals Index 2.0 тепер мають значно ширший охоплення у різних галузях, включаючи фінанси, програмування та правові завдання. Ваги секторів, використовувані в Індексі, отримані з даних про додану вартість, наданих Бюро економічного аналізу. Композитна формула, що використовується, усереднює показники продуктивності в кожному секторі, а потім поєднує ці секторальні результати на основі їх приблизної частки ВВП. На середину серпня 2026 року Claude Opus 5 перебуває на першому місці в Індексі, за ним слідують Claude Fable 5 та GPT-5.6 Sol.
Індекс оновлюється з великою частотою, щоб відображати найновіші випуски моделей, і слугує як єдиний ключовий показник, що вказує на потенційний економічний вплив, водночас дозволяючи користувачам глибше аналізувати індивідуальні рейтингові таблиці доменів для отримання більш детальних інсайтів. Оскільки базові еталони залишаються переважно приватними і оновлюються періодично, Індекс здатний зберігати свою унікальність протягом довшого часу порівняно з чисто публічними композитами. Підприємства та дослідники звертаються до цього Індексу не лише для порівняльного ранжирування, але й для проведення аналізу компромісів між вартістю, затримкою та можливостями в межах поточної екосистеми моделей, що забезпечує їм прийняття обґрунтованих рішень на основі найбільш актуальними даними.
Шаблони впровадження підприємствами та попит на вимірюваний ROI
Масштабні впровадження ШІ все частіше використовують оцінки Vals під час вибору базових моделей та оцінки внутрішніх продуктів за показниками передових досягнень. Ця комбінація швидкого часу виконання, спеціалізації в галузі та незалежності ефективно вирішує практичні виклики, з якими стикаються команди закупівель та технічні лідери: одних лише рейтингів постачальників більше недостатньо для прийняття рішень з високим ризиком.
Примітний ріст доходів у вісім разів порівняно з усім 2025 роком, а також подвоєння кількості клієнтів і потроєння кількості співробітників лише за шість місяців, чітко свідчить про те, що попит перейшов від початкового експериментування до етапу операційної залежності. Уряди також взаємодіють із платформою, щоб отримати цінні дані щодо вимірювання здатностей та кіберризиків, що підсилює її значущість як у комерційному, так і в політичному контекстах. Здатність платформи встигати за тижневими випусками моделей забезпечує актуальність та актуальність сигналу, а не відставання від передньої межі на кілька місяців.
Екосистема та структурна відмінність від платформ, заснованих на преференціях
Інші оціночні ініціативи також присутні в цьому середовищі, зокрема арени голосування за перевагами, які агрегують людські судження щодо відкритих вихідних даних, а також психометричні підходи, спрямовані на значне скорочення часу оцінки. Vals відрізняється завдяки професійному дизайну завдань, підібраних експертами, що забезпечує високу актуальність і застосовність, а також автоматизоване оцінювання, яке докладно калібрується відповідно до встановлених галузевих стандартів. Компанія використовує приватні тестові набори, які постійно виводяться з експлуатації для підтримки цілісності своїх оцінок, а також має доведений рекорд цитувань від усіх головних лабораторій-лідерів у галузі.
Цей запис цитування слугує важливою формою легітимності, яку нові учасники повинні здобути, щоб отримати довіру. Крім того, акцент компанії на економічно зважених, багатоетапних робочих процесах, а не лише на мовній перевагі чи чистій швидкості, позиціонує її як життєво важливу інфраструктуру для прийняття обґрунтованих рішень у виробництві, а не просто як учасника рейтингів дослідницьких лідерів. Інвестори очевидно визнали й оцінили цю унікальну відмінність у вигляді вражаючої оцінки в $400 мільйонів.
Висновки для розробників моделей та темпи вимірювання здатностей
Лабораторії Frontier зараз функціонують у середовищі, де незалежні оцінки мають зовнішню авторитетність, якої все більше втрачають самоповідомлені дані. Цитування в картках моделей сигналізує корпоративним покупцям, що результати були піддані перевірці з боку третьої сторони. Разом із тим постійне створення складніших тестів піднімає планку, яку повинні подолати наступні моделі. Процес «підйому на пагорб», що стимулював розвиток ШІ, тепер стикається з більш стрімкими та частіше оновлюваними пагорбами.
Розробники, які вважають оцінку другорядною, ризикують виявити прогалини в можливостях лише після розгортання; ті, хто раніше інтегрує незалежне вимірювання, можуть пріоритизувати покращення, що мають значення для реальних завдань. Відкриття коду обраних компонентів інфраструктури додатково сприяє відтворюваності, захищаючи при цьому основні приватні оцінки, які генерують найбільш інформативні результати.
Більш широка потреба ринку у надійних інституціях з вимірювання
Зі збільшенням включення систем ШІ в юридично та фінансово значущі процеси відсутність незалежних вимірювань створює ті самі ризики інформаційної асиметрії, які раніше призводили до виникнення рейтингових агентств та аудиторів у інших галузях. Метрики зростання Vals та рівень його інвесторів свідчать про те, що капітал усвідомлює цей інституційний розрив. Заявлена місія компанії — бути незалежним оцінювачем штучного інтелекту — відповідає практичним вимогам підприємств, що шукають ясність щодо ROI, та політиків, які прагнуть зрозуміти можливості та ризики.
Подальше розширення до додаткових професійних і ризикових сфер перевірить, чи масштабується методологія, зберігаючи незалежність і якість сигналу. Наразі поєднання недавніх випусків продуктів, швидкого комерційного росту та великих капітальних інвестицій встановлює Vals як центральну точку відліку для будь-кого, хто повинен вирішити, які моделі справді здатні виконувати важливу роботу.
Часто Задавані Питання
Що саме оголосило Vals AI у своєму раунді фінансування серії A?
Vals AI закрила серію A на $40 мільйонів при оцінці в $400 мільйонів 13 серпня 2026 року. Керівником раунду виступив Andreessen Horowitz, а існуючі інвестори 8VC, Pear VC та Bloomberg Beta знову приєдналися, а нові інвестори HRT Ventures та Next Ladder Ventures долучилися. Компанія одночасно випустила Vals Smith для кастомних бенчмарків кодування, індекс RSI, ReverseEngBench, розширений Vals Index 2.0 та відновлений веб-сайт. Офіційні заяви як Vals, так і a16z підтверджують ці цифри та супутні запуски продуктів.
Як відрізняються бенчмарки Vals від публічних рейтингів, таких як MMLU або SWE-bench?
Vals зосереджується на багатоетапних професійних робочих процесах, визначених з експертами у галузі та оцінених автоматизованими системами, налаштованими на експертні стандарти. Основні тестові набори залишаються конфіденційними та виводяться з обігу, коли вони перестають розрізняти моделі, що зменшує забруднення та маніпуляції з оптимізацією. Публічні академічні набори часто насичуються або потрапляють у навчальні дані, що обмежує їхню прогностичну цінність для реальних підприємницьких завдань. Підхід Vals дає результати впродовж кількох годин після отримання доступу до моделі та вже зустрічається у картках моделей великих лабораторій.
Яка значущість рейтингу 52 відсотки у завданнях Finance Agent?
У травні 2026 року лідируюча модель досягла приблизно 52 відсотків точності на наборі Finance Agent v2, який вимагає моделювання відносної вартості, синтезу документів та обґрунтованих рекомендацій. Цей показник свідчить, що навіть найпотужніші доступні системи все ще невдали приблизно в половині завдань, які очікуються від професійного фінансового аналітика. Ця різниця між академічними результатами та виконанням професійних завдань — саме та проблема, яку Vals прагне виміряти та допомогти усунути.
Хто є засновниками та який досвід вони мають?
Генеральний директор Раян Крішнан раніше працював у Palantir. Технічний директор Лангстон Нешолд має досвід роботи у Meta, NVIDIA та Hudson River Trading. Обидва вивчали комп’ютерні науки у Стэнфорді та почали співпрацювати над проблемами вимірювання ще до заснування компанії. Їхній досвід поєднує знання в галузі продуктивних систем із кількісними та дослідницькими поглядами, що формують акцент Vals на строгій, адаптивній оцінці.
Що дає Vals Smith підприємствам?
Vals Smith дозволяє будь-якій організації генерувати кастомний кодовий бенчмарк безпосередньо зі своїх репозиторіїв GitHub. Система витягує реалістичні завдання розробки з історичних pull request і застосовує приховані тести. Користувачі отримують 120 безкоштовних кредитів. Інструмент конвертує загальні кодові бенчмарки у специфічні для організації вимірювання, які відображають власні шаблони коду та інженерні практики.
Як індекс Vals враховує економічну вагу?
Індекс агрегує продуктивність у фінансах, програмуванні та правових завданнях, а потім зважує середні значення секторів згідно з їх приблизним внеском до ВВП США за даними Бюро економічного аналізу. Отриманий композитний показник надає єдиний загальний показник потенційного економічного впливу, зберігаючи при цьому можливість детального аналізу результатів окремих доменів. Версія 2.0 розширила охоплення та оновлюється регулярно для відображення нових випусків моделей.
🔥 KuCoin пропонує більш стабільний варіант у волатильному ринку
Якщо вас турбують часті підйоми й спади на ринку, і ви шукаєте більш стабільний спосіб пасивного заробітку, KuCoin — це саме місце для вас:

Simple Earn: Депозит і виведення токенів будь-коли, отримуйте стабільний дохід.
KuCoin Earn: Отримуйте стабільний прибуток із професійним управлінням активами.
Утримуйте та заробляйте: Заробляйте нагороди, зберігаючи активи у Фінансових, Торгових, Маржових, Ф'ючерсних, Майнінгових та Єдиних акаунтах.
Стейкінг: Розблокуйте потенціал дохідності он-чейн активів.
Розширені інвестиції: Розширені інвестиції пропонують різноманітні структуровані продукти, щоб допомогти вашим грошам зростати на будь-якому ринку.
Shark Fin: Захист основної суми та гарантовані прибутки
Бівалютне інвестування: Купуйте дешево й продавайте дорожче з прозорим розрахунком прибутку.
Snowball: Високі дохідність, з захистом ціни.
Купівля зі знижкою: Купуйте криптовалюту за зниженими цінами.
KCS Loyalty: Підвищте рівень, щоб отримати ексклюзивні переваги за стейкінг ≥ 1 KCS.
KuCoin Wealth: Відкрийте для себе майбутню вартість і розпочніть свій розумний інвестиційний шлях.
Переваги KCS: Утримуйте та стейкайте KCS, щоб отримати переваги на всій платформі.
KCS Staking 2.0: Участь у на-ланцюговому управлінні KCS для отримання дохідності.
Відмова від відповідальності: Цей матеріал надано виключно в інформаційних цілях і не є інвестиційною порадою. Інвестиції в криптовалюту супроводжуються ризиком. Будь ласка, проводьте власне дослідження (DYOR).
Відмова від відповідальності: Для вашої зручності цю сторінку було перекладено за допомогою технології ШІ. Для отримання найточнішої інформації дивіться оригінальну англійську версію.
