Vals AI привлекла $40 млн в серии A под руководством a16z для создания независимых эталонов ИИ-моделей

Vals AI привлекла $40 млн в серии A под руководством a16z для создания независимых эталонов ИИ-моделей

2026/08/22 12:06:00

Пользовательское изображение

Круг инвестиций сигнализирует о растущем спросе на реальные контрольные показатели производительности ИИ

В середине августа 2026 года Vals AI объявила о раунде серии A на $40 млн при оценке в $400 млн, возглавляемом Andreessen Horowitz при участии существующих инвесторов 8VC, Pear VC и Bloomberg Beta, а также новых партнеров HRT Ventures и Next Ladder Ventures. Компания, базирующаяся в Сан-Франциско, позиционирует себя как независимый оценщик передовых моделей ИИ, создавая эталоны для оценки производительности на экономически значимой профессиональной работе, а не на академических тестах, которые уже в значительной степени насыщены. Ее результаты уже отображаются в карточках моделей от OpenAI, Anthropic, Google, Meta и xAI. Выручка выросла в восемь раз по сравнению со всем 2025 годом, база клиентов удвоилась, а команда утроилась за шесть месяцев.
 
Вместе с финансированием Vals выпустила Vals Smith для пользовательских кодовых тестов, основанных на любых репозиториях GitHub, RSI Index, разработанный совместно с CoreWeave для измерения способностей к рекурсивному самоусовершенствованию, ReverseEngBench, созданный совместно с исследователями из Колумбийского университета, Трафтского университета, Калифорнийского университета в Беркли и Калифорнийского университета в Лос-Анджелесе, а также расширенную версию Vals Index 2.0, которая учитывает производительность с учетом вклада секторов в ВВП США. Эти шаги предприняты на фоне растущего давления на предприятия по внедрению ИИ при отсутствии надежных способов оценки рентабельности инвестиций, а также по мере того как правительства ищут независимые меры передовых возможностей и киберрисков. Основная идея заключается в том, что независимые, постоянно обновляемые профессиональные тесты стали необходимой инфраструктурой для экономики ИИ, закрывая растущий разрыв между рейтингами, заявленными поставщиками, и реальной способностью выполнять многоэтапные задачи в финансах, праве, программной инженерии и областях с высоким уровнем риска.

Почему традиционные рейтинговые списки ИИ потеряли прогностическую силу для корпоративных решений

Ранее академические публичные эталоны обеспечивали общую систему для отслеживания прогресса моделей, но анализ, проведённый в феврале 2026 года исследователями из ETH Цюриха и Стэнфорда, изучивший 60 широко используемых оценок крупных языковых моделей, показал, что 29 из них достигли насыщения: разрыв в производительности между первой и второй моделями упал в пределы измерительного шума. Загрязнение происходит, когда тестовые данные попадают в обучающие корпусы, иногда через Common Crawl, а лаборатории также напрямую оптимизируют модели под известные цели. В результате высокие баллы на MMLU, HumanEval или подобных наборах больше не позволяют надёжно предсказать успех в сложных, многоэтапных профессиональных рабочих процессах. Vals решает эту проблему, сохраняя основные тестовые наборы закрытыми, сотрудничая с экспертами в области для определения репрезентативных задач и выводя из обращения эталоны, переставшие различать модели.
 
В мае 2026 года компания заменила свою предыдущую оценку CorpFin на более строгий эталон Excel Modelling именно потому, что дифференциация исчезла. Этот адаптивный подход рассматривает саму оценку как непрерывную инфраструктуру, а не статичный экзамен, предоставляя компаниям более четкий сигнал при выборе моделей для развертывания в производстве. Официальная документация по методологии компании и объявление об инвестициях a16z подчеркивают, что закрытые наборы, курируемые экспертами и регулярно обновляемые, лучше сопротивляются пути насыщения, чем полностью открытые или исключительно закрытые статичные тесты.

Как Vals создает эталоны на основе реальных профессиональных рабочих процессов

Vals сотрудничает с практикующими юристами, финансовыми аналитиками, инженерами-программистами и клиницистами, чтобы сопоставить таксономию задач, определяющих компетентную работу в каждой области, а затем разрабатывает автоматизированные системы оценки, которые оценивают созданный продукт по экспертным стандартам, а не по правильности выбора из нескольких вариантов или точному совпадению строк. Типичная задача Finance Agent v2 требует от агента извлечь поддерживающие данные из документов, синтезировать модели относительной стоимости по компаниям-аналогам, выявить катализаторы отрасли и сформулировать обоснованные инвестиционные рекомендации без вымышленных цифр или потери контекста на каждом этапе. В мае 2026 года самая высокорезультирующая модель достигла лишь 52 процентов точности на этом наборе задач, что указывает на то, что даже передовые системы все еще не справляются примерно с половиной задач, которые ожидается, что профессиональный аналитик сможет выполнить.
 
Та же философия применяется к юридическим исследованиям, миграции кода, инженерии на основе терминала и медицинскому кодированию. Поскольку оценка автоматизирована, но настроена на экспертные суждения, результаты могут быть получены в течение нескольких часов после получения доступа к модели, что соответствует текущей недельной частоте выпусков передовых решений. Компания открыла часть своей инфраструктуры оценки для обеспечения воспроизводимости, одновременно защищая целостность закрытых тестовых наборов, которые генерируют основные оценки. Эта комбинация партнерства в предметных областях, автоматизированной экспертизы и быстрой обработки отличает платформу как от академических рейтингов, так и от чисто предпочтительных систем.

Обоснование a16z по поводу возглавления раунда при оценке в 400 миллионов долларов

Andreessen Horowitz обосновала инвестицию через классическую проблему асимметрии информации, описанную экономистом Джорджем Акерлофом: когда продавцы знают больше о качестве продукта, чем покупатели, и имеют стимулы представлять выгодные данные, рынки деградируют в сторону более низкокачественных результатов. Дженнифер Ли и коллеги из a16z сравнили необходимость независимого оценщика ИИ с историческим появлением Moody’s на рынках кредитов и независимых аудиторов в отчетности публичных компаний. Модель доходов Vals, основанная на взимании платы за услуги оценки, а не на сертификации заявлений конкретных лабораторий, направлена на сохранение структурной независимости.
 
Компания подчеркнула техническую глубину основателей и их долгосрочную скептическую позицию по поводу достоверности эталонов, отметив, что Раян Кришнан и Лэнгстон Нэшолд уже сотрудничали над задачами измерения в реальных условиях, изучая информатику в Стэнфорде. Оценка раунда и участие HRT Ventures, связанной с количественной торговлей, дополнительно свидетельствуют о том, что сложный капитал рассматривает надежные измерения как критически важную инфраструктуру, а не как вспомогательный исследовательский инструмент. Официальные комментарии a16z подчеркивают, что модели переходят от ответов на вопросы к выполнению многочасовых агентных рабочих процессов, повышая стоимость неверного выбора модели с расходов на токены до потери времени и негативных последствий для клиентов.

Истории основателей и происхождение теории независимой оценки

Райан Кришнан, являющийся генеральным директором компании, имеет впечатляющий опыт работы в Palantir — известной компании по анализу данных. Его сооснователь Лэнгстон Нэшолд занимает должность технического директора и обладает богатым опытом работы в крупных технологических компаниях, таких как Meta, NVIDIA и Hudson River Trading. Первый контакт между основателями произошел во время похода на рюкзаках перед началом учебного года в Стэнфордском университете, где они быстро сблизились. Позже они сотрудничали над различными курсами по информатике, что привело их к важному осознанию: большие языковые модели способны революционизировать способы выполнения работы. Однако они также поняли, что в отрасли все еще отсутствуют надежные и эффективные методы тестирования этих моделей. Вдохновленные своими выводами, они приняли смелое решение бросить свои магистерские программы, чтобы основать Vals. Первоначальной целью их нового проекта стали финансы и программирование — задачи, которые, по их мнению, составляют значительную долю экономической активности в США.
 
По мере того как они начали набирать популярность на рынке, они получили значительные упоминания в основных моделях и поддержку своих инициатив от Министерства торговли, а также участие в конгрессских усилиях, связанных с политикой в области ИИ. Основатели уделяют большое внимание важности постоянного отказа от устаревших эталонов и использования закрытых тестовых наборов. Этот подход напрямую основан на их наблюдениях за тем, насколько быстро модели могут достичь пика статических эталонов и как обучающие данные могут влиять на публичные оценки. Их совокупный опыт работы как в производственных системах, так и в количественных средах значительно повлиял на разработку стека оценки, а также коммерческого продукта, который предприятия сейчас используют для выбора и мониторинга моделей в соответствии с передовыми технологиями.

Бенчмарки финансовых агентов выявляют устойчивые различия между рейтинговыми баллами и работой аналитиков

Хотя модели демонстрируют результаты, близкие к идеальным, на старых академических наборах, набор Finance Agent v2 продолжает выявлять существенные недостатки, которые нельзя игнорировать. Задачи, входящие в этот набор, включают синтез нескольких документов, моделирование относительной стоимости и генерацию рекомендаций — все это напрямую отражает ежедневные результаты, которые производят профессиональные финансовые аналитики в отрасли. Потолок в 52 процента, зафиксированный в мае 2026 года для ведущей системы, служит ярким напоминанием о том, что высокие показатели по общим знаниям не означают автоматически надежных и автономных возможностей финансового анализа.
 
Vals стратегически взвешивает свой составной индекс Vals, учитывая приблизительный вклад секторов в ВВП США, что обеспечивает значительный мультипликативный эффект для финансового сектора и гарантирует точное отражение экономического воздействия в общем рейтинге различных моделей. Предприятия, успешно внедрившие модели, отобранные частично на основе оценок Vals, сообщают, что используют платформу не только для начального процесса отбора, но и для постоянного измерения производительности продуктов по сравнению с установленными эталонными показателями. Более того, существующий разрыв в производительности также играет ключевую роль в формировании решений по распределению капитала в финансовых учреждениях. Эти учреждения должны обосновывать свои расходы на ИИ измеримыми приростами производительности, а не полагаться исключительно на качественные демонстрации, которые часто могут быть субъективными и менее надежными. Этот постоянный процесс оценки имеет решающее значение для обеспечения того, чтобы инвестиции в технологии ИИ приносили ощутимые выгоды и улучшали операционную эффективность.

Валс Смит открывает пользовательские кодовые тесты, созданные непосредственно из корпоративных репозиториев

С объявлением серии A Vals сделал Smith общедоступным, позволив любой организации создавать пользовательский кодовый бенчмарк на основе собственных репозиториев GitHub. Система извлекает реальные задачи разработки из исторических pull request и применяет скрытые тесты, чтобы определить, может ли модель выполнить работу. Пользователи получают 120 бесплатных кредитов для начала. Для компаний, чьи кодовые базы содержат проприетарные шаблоны, библиотеки и архитектурные соглашения, различие между общими навыками работы с Python или Java и способностью работать в этой конкретной среде является решающим.
 
Смит поэтому преобразует абстрактный вопрос о кодировочной способности в конкретную, специфическую для организации меру. Ранние корпоративные пользователи теперь могут ранжировать модели по их производительности на реальных инженерных задачах, а не на публичных наборах, которые могли быть частично заучены или оптимизированы под них. Релиз расширяет возможности Vals за пределы предварительно созданных доменных тестов в инфраструктуру адаптированной оценки, масштабируемую под потребности клиентов.

Индекс RSI и ReverseEngBench расширяют охват на области фронтёрных рисков

В связи с недавним финансированием Vals с гордостью представила RSI Index, разработанный в сотрудничестве с CoreWeave. Этот инновационный индекс направлен на оценку способности различных моделей выполнять исследовательские задачи, необходимые для продвижения разработки моделей, методов сжатия, методик обучения, стратегий оптимизации параметров, практик создания харнессов и пост-обучения. Кроме того, компания представила ReverseEngBench — проект, тщательно разработанный в партнерстве с уважаемыми академическими учреждениями, включая Колумбийский университет, Университет Тафта, Калифорнийский университет в Беркли и Калифорнийский университет в Лос-Анджелесе. Этот всеобъемлющий бенчмарк включает 19 проприетарных программ, которые в совокупности в среднем содержат более 16 000 строк кода.
 
Эти программы охватывают широкий спектр областей, включая сетевые протоколы, прошивки, игровые приложения, процессы восстановления файловых форматов и анализ вредоносного ПО, все что защищено обширным набором антианалитических средств, предназначенных для повышения безопасности. Предварительные результаты показывают значительные различия между ведущими передовыми моделями, раскрывая значительный потенциал, который еще предстоит реализовать, прежде чем агенты смогут последовательно обратно инжинирить реальные бинарные файлы. Помимо этих усилий, на ранней стадии также начата работа в области приложений для психического здоровья, с планами дальнейшего расширения в критически важные области, такие как оценка экологического воздействия, военные приложения и области биобезопасности. Эти оценки, ориентированные на риски, затрагивают возможности, имеющие ключевое значение как для повышения уровня безопасности предприятий, так и для государственной оценки передовых систем.

Vals Index 2.0 агрегирует производительность с учетом экономического вклада

Переработанный веб-сайт и Vals Index 2.0 теперь предлагают значительно более широкое покрытие по различным областям, включая финансы, программирование и юридические задачи. Веса секторов, используемые в Индексе, основаны на данных о добавленной стоимости, предоставленных Бюро экономического анализа. Композитная формула усредняет показатели производительности внутри каждого сектора, а затем объединяет эти показатели секторов на основе их приблизительной доли в ВВП. По состоянию на середину августа 2026 года Claude Opus 5 находится на первом месте в Индексе, за ним следуют Claude Fable 5 и GPT-5.6 Sol.
 
Индекс обновляется на регулярной основе, чтобы отражать последние выпуски моделей, и служит в качестве единого ключевого показателя, указывающего на потенциальное экономическое воздействие, при этом позволяя пользователям углубляться в отдельные рейтинговые таблицы по доменам для получения более детальной информации. Поскольку базовые эталоны в основном остаются закрытыми и обновляются периодически, Индекс способен сохранять свою дифференциацию в течение более длительного времени по сравнению с исключительно публичными композитами. Предприятия и исследователи используют этот Индекс не только для определения относительного ранжирования, но и для проведения анализа компромиссов между стоимостью, задержкой и возможностями в рамках текущей экосистемы моделей, что позволяет им принимать обоснованные решения на основе наиболее актуальных данных.

Паттерны корпоративного внедрения и спрос на измеримую ROI

Крупномасштабные развертывания ИИ все чаще используют оценки Vals при выборе базовых моделей и при оценке внутренних продуктов по сравнению с передовыми метриками производительности. Эта комбинация быстрой обратной связи, специфики области и независимости эффективно решает практические проблемы, с которыми сталкиваются команды закупок и технические лидеры: одних карточек оценки поставщиков уже недостаточно для принятия решений, имеющих высокие риски.
 
Заметный рост выручки в восемь раз по сравнению с общим объемом 2025 года, а также удвоение базы клиентов и утроение численности персонала всего за шесть месяцев ясно указывает на то, что спрос перешел от первоначальных экспериментов к фазе операционной зависимости. Правительства также взаимодействуют с платформой, чтобы получить ценные сведения о измерении возможностей и киберрисках, что подчеркивает ее значимость как в коммерческом, так и в политическом контексте. Способность платформы успевать за еженедельными выпусками моделей обеспечивает актуальность и релевантность сигнала, а не отставание от передовой на несколько месяцев.

Экосистема и структурная дифференциация от платформ, основанных на предпочтениях

Другие методы оценки также присутствуют в этой области, включая платформы для голосования по предпочтениям, которые агрегируют человеческие суждения о открытых ответах, а также психометрические подходы, направленные на значительное сокращение времени оценки. Vals выделяется благодаря профессиональной разработке задач экспертами, что обеспечивает высокую релевантность и применимость, а также автоматизированную оценку, тщательно откалиброванную в соответствии с установленными отраслевыми стандартами. Компания использует закрытые тестовые наборы, которые постоянно обновляются для поддержания целостности оценок, и имеет подтвержденную цитируемость со стороны всех крупнейших передовых лабораторий в данной области.
 
Этот запись цитирования служит важной формой легитимности, которую новые участники должны стремиться завоевать, чтобы получить доверие. Кроме того, акцент компании на экономически взвешенных, многоэтапных рабочих процессах, а не только на предпочтении разговорного стиля или чистой скорости, позиционирует её как критически важную инфраструктуру для принятия обоснованных производственных решений, а не просто как участника исследовательских рейтингов. Инвесторы очевидно признали и учли эту уникальную дифференциацию в впечатляющей оценке в 400 миллионов долларов.

Инференс для разработчиков моделей и темпы измерения возможностей

Лаборатории Frontier теперь функционируют в среде, где независимые оценки обладают внешней достоверностью, которой все чаще не хватает самоотчетным данным. Упоминание в модельных картах сигнализирует корпоративным покупателям, что результаты прошли проверку со стороны третьих сторон. В то же время постоянное создание более сложных тестовых наборов повышает планку, которую должны преодолевать последующие модели. Процесс «восхождения на холм», который двигал прогресс в ИИ, теперь сталкивается с более крутой и чаще обновляемой цепочкой холмов.
 
Разработчики, которые рассматривают оценку как второстепенную задачу, рискуют обнаружить пробелы в возможностях только после развертывания; те, кто интегрирует независимые измерения на раннем этапе, могут приоритизировать улучшения, имеющие значение для реальной работы. Открытие исходного кода выбранных компонентов инфраструктуры дополнительно способствует воспроизводимости, защищая при этом основные закрытые оценки, которые генерируют наиболее информативные результаты.

Более широкая потребность рынка в надежных институтах измерения

По мере того как ИИ-системы всё глубже проникают в юридически и финансово значимые рабочие процессы, отсутствие независимых измерений создаёт те же риски информационного дисбаланса, которые исторически привели к появлению рейтинговых агентств и аудиторов в других отраслях. Показатели роста Vals и уровень его инвесторов свидетельствуют о том, что капитал осознаёт этот институциональный разрыв. Заявленная миссия компании — выступать в роли независимого оценщика искусственного интеллекта — соответствует практическим потребностям предприятий, стремящихся к ясности в оценке рентабельности инвестиций, и регуляторов, ищущих понимание возможностей и рисков.
 
Продолжающееся расширение в дополнительные профессиональные и рисковые области проверит, масштабируется ли методология при сохранении независимости и качества сигналов. Пока что сочетание недавних релизов продуктов, быстрой коммерческой популярности и крупных капиталовложений делает Vals центральной точкой отсчета для всех, кто должен решить, какие модели действительно способны выполнять важную работу.

Часто задаваемые вопросы

Что именно объявила Vals AI в рамках своего раунда финансирования серии A?

Vals AI закрыла серию A на $40 млн при оценке в $400 млн 13 августа 2026 года. Круг возглавил Andreessen Horowitz, при этом существующие инвесторы 8VC, Pear VC и Bloomberg Beta вернулись, а новые инвесторы HRT Ventures и Next Ladder Ventures присоединились. Компания одновременно выпустила Vals Smith для пользовательских тестов кодирования, индекс RSI, ReverseEngBench, расширенную версию Vals Index 2.0 и обновленный веб-сайт. Официальные заявления от Vals и a16z подтверждают эти цифры и сопутствующие запуски продуктов.
 

В чем различия между эталонами Vals и публичными рейтингами, такими как MMLU или SWE-bench?

Vals сосредоточен на многоэтапных профессиональных рабочих процессах, определенных с участием экспертов в области и оцениваемых автоматизированными системами, откалиброванными по стандартам экспертов. Основные тестовые наборы остаются закрытыми и выводятся из обращения, когда перестают различать модели, что снижает загрязнение и манипуляции с оптимизацией. Публичные академические наборы часто насыщаются или попадают в обучающие данные, что ограничивает их прогностическую ценность для реальных корпоративных задач. Подход Vals позволяет получать результаты в течение нескольких часов после доступа к модели и уже упоминается в карточках моделей крупных лабораторий.
 

Каково значение результата 52 процента в заданиях Finance Agent?

В мае 2026 года ведущая модель показала примерно 52-процентную точность на наборе Finance Agent v2, который требует моделирования относительной стоимости, синтеза документов и обоснованных рекомендаций. Этот показатель свидетельствует о том, что даже самые мощные доступные системы всё ещё не справляются примерно с половиной задач, ожидаемых от профессионального финансового аналитика. Именно этот разрыв между академическими результатами и производительностью при выполнении профессиональных задач Vals стремится измерить и тем самым помочь его преодолеть.
 

Кто являются основателями и какой опыт они привносят?

Генеральный директор Райан Кришнан ранее работал в Palantir. Технический директор Лэнгстон Нэшолд имеет опыт работы в Meta, NVIDIA и Hudson River Trading. Оба изучали информатику в Стэнфорде и начали сотрудничать над проблемами измерения до основания компании. Их опыт объединяет знания в области производственных систем с количественными и исследовательскими подходами, которые формируют акцент Vals на строгой и адаптивной оценке.
 

Что предоставляет Vals Smith предприятиям?

Vals Smith позволяет любой организации создавать пользовательский кодовый бенчмарк непосредственно из своих репозиториев GitHub. Система извлекает реалистичные задачи разработки из исторических pull request и применяет скрытые тесты. Пользователи начинают с 120 бесплатных кредитов. Инструмент конвертирует общие кодовые бенчмарки в специфические измерения, отражающие проприетарные шаблоны кода и инженерные практики.
 

Как индекс Vals учитывает экономическое взвешивание?

Индекс агрегирует результаты по финансовым, программным и юридическим задачам, а затем взвешивает средние значения по секторам на основе их примерного вклада в ВВП США с использованием данных Бюро экономического анализа. Полученный композитный показатель предоставляет единственный обобщающий показатель потенциального экономического воздействия, сохраняя при этом возможность детального анализа результатов по отдельным областям. Версия 2.0 расширила охват и обновляется часто для отражения новых выпусков моделей.

🔥 KuCoin предлагает более стабильный вариант на волатильном рынке

Если вас беспокоят частые колебания на рынке, и вы ищете более стабильный способ пассивного заработка, KuCoin — это идеальное место:
 
Пользовательское изображение
 
Simple Earn: Делайте депозит и вывод токенов в любое время, получая стабильную доходность.
KuCoin Earn: Получайте стабильную прибыль с помощью профессионального управления активами.
Холд для заработка: Получайте вознаграждения за хранение активов в Финансовом, Торговом, Маржинальном, Фьючерсном, Майнинговом и Едином аккаунтах.
Стейкинг: Раскройте потенциал дохода от ончейн-активов.
Расширенные инвестиции: Расширенные инвестиции предлагают различные структурированные продукты, которые помогут вашим деньгам расти на любом рынке.
Shark Fin: Защита основной суммы и гарантированная прибыль
Бивалютные инвестиции: Покупайте дешевле и продавайте дороже с прозрачным расчетом доходности.
Snowball: Высокая доходность с защитой цены.
Покупка со скидкой: Покупайте криптовалюту по сниженным ценам.
KCS Loyalty: Повысьте уровень, чтобы получить эксклюзивные преимущества, заблокировав не менее 1 KCS.
KuCoin Wealth: Откройте для себя будущую стоимость и начните свой путь умных инвестиций.
Преимущества KCS: Держите и стейкайте KCS, чтобы получить доступ к преимуществам на платформе.
KCS Staking 2.0: Участвуйте в управлении KCS в блокчейне для получения дохода.

Отказ от ответственности: Этот материал предназначен исключительно для информационных целей и не является инвестиционной рекомендацией. Инвестиции в криптовалюты сопряжены с рисками. Проведите собственное исследование (DYOR).
 

Отказ от ответственности: Эта страница была переведена для вашего удобства с использованием технологии искусственного интеллекта. Для получения наиболее точной информации обратитесь к оригинальной английской версии.