Vals AI levanta US$40 milhões na série A liderada pela a16z para construir benchmarks de modelos de IA independentes

Vals AI levanta US$40 milhões na série A liderada pela a16z para construir benchmarks de modelos de IA independentes

2026/08/22 12:06:00

Imagem personalizada

Rodada de financiamento sinaliza aumento da demanda por benchmarks de desempenho de IA no mundo real

Em meados de agosto de 2026, a Vals AI anunciou uma rodada Series A de US$ 40 milhões com avaliação de US$ 400 milhões, liderada pela Andreessen Horowitz, com participação dos investidores existentes 8VC, Pear VC e Bloomberg Beta, além dos novos apoiadores HRT Ventures e Next Ladder Ventures. A empresa sediada em São Francisco posiciona-se como um avaliador independente de modelos de IA de ponta, construindo benchmarks que avaliam o desempenho em trabalhos profissionais economicamente significativos, em vez de testes de estilo acadêmico que já estão amplamente saturados. Seus resultados já aparecem em cards de modelos da OpenAI, Anthropic, Google, Meta e xAI. A receita cresceu oito vezes em relação a todo o ano de 2025, a base de clientes dobrou e a equipe triplicou em seis meses.
 
Junto com o financiamento, a Vals lançou o Vals Smith para benchmarks de codificação personalizada baseados em qualquer repositório do GitHub, o Índice RSI desenvolvido com a CoreWeave para medir capacidades de autoaperfeiçoamento recursivo, o ReverseEngBench criado com pesquisadores da Columbia, Tufts, UC Berkeley e UCLA, e um expandido Índice Vals 2.0 que pondera o desempenho pelas contribuições setoriais ao PIB dos EUA. Essas iniciativas surgem enquanto empresas enfrentam pressão crescente para adotar IA, mas carecem de maneiras confiáveis para quantificar o retorno sobre o investimento, e enquanto governos buscam medidas independentes das capacidades de ponta e riscos cibernéticos. A tese central é que benchmarks profissionais independentes e continuamente atualizados tornaram-se infraestrutura essencial para a economia da IA, fechando a crescente lacuna entre pontuações de rankings relatadas por fornecedores e a capacidade real de concluir tarefas em múltiplos passos em finanças, direito, engenharia de software e domínios de risco de alto valor.

Por que os rankings tradicionais de IA perderam poder preditivo para decisões empresariais

Benchmarkes acadêmicos públicos já forneceram uma linguagem comum para rastrear o progresso dos modelos, mas uma análise de fevereiro de 2026 realizada por pesquisadores da ETH Zurich e de Stanford examinou 60 avaliações de grandes modelos de linguagem amplamente utilizadas e descobriu que 29 delas já estavam saturadas, com as diferenças de desempenho entre os modelos primeiro e segundo caindo dentro do ruído de medição. A contaminação ocorre quando dados de teste entram nos corpora de treinamento, às vezes por meio do Common Crawl, enquanto laboratórios também otimizam diretamente contra alvos conhecidos. O resultado é que pontuações altas no MMLU, HumanEval ou conjuntos similares não mais preveem confiavelmente o sucesso em fluxos de trabalho profissionais complexos e com múltiplos passos. O Vals resolve isso mantendo os conjuntos de teste principais em sigilo, parcerias com especialistas de domínio para definir tarefas representativas e aposentando benchmarks assim que deixam de diferenciar modelos.
 
Em maio de 2026, a empresa substituiu sua anterior avaliação CorpFin por um benchmark mais rigoroso de modelagem no Excel precisamente porque a diferenciação havia colapsado. Essa abordagem adaptativa trata a avaliação como uma infraestrutura contínua, e não como um exame estático, fornecendo às empresas um sinal mais claro ao selecionar modelos para implantação em produção. A documentação oficial sobre a metodologia da empresa e o anúncio do investimento da a16z enfatizam que conjuntos privados, curados por especialistas, com substituição contínua, resistem mais efetivamente à via de saturação do que testes estáticos totalmente públicos ou puramente privados.

Como a Vals constrói benchmarks em torno de fluxos de trabalho profissionais reais

A Vals parceia-se com advogados atuantes, analistas financeiros, engenheiros de software e clínicos para mapear a taxonomia de tarefas que definem o trabalho competente em cada área, desenvolvendo em seguida sistemas de avaliação automatizados que pontuam os produtos gerados em relação aos padrões de especialistas, e não com base na correção de múltipla escolha ou correspondências exatas de strings. Uma tarefa típica do Finance Agent v2 exige que um agente recupere dados de apoio de documentos, sintetize modelos de valor relativo entre empresas da mesma área, identifique catalisadores do setor e produza recomendações de investimento fundamentadas, sem inventar números ou perder o contexto ao longo das etapas. Em maio de 2026, o modelo com a maior pontuação alcançou apenas 52 por cento de precisão nesse conjunto de tarefas, indicando que mesmo sistemas de ponta ainda falham em aproximadamente metade das tarefas que um analista profissional é esperado para realizar.
 
A mesma filosofia se aplica à pesquisa jurídica, migração de código, engenharia baseada em terminal e codificação médica. Como a avaliação é automatizada, mas calibrada com o julgamento de especialistas, as avaliações podem ser produzidas em poucas horas após o acesso ao modelo, correspondendo ao ritmo semanal atual das liberações de ponta. A empresa open-sourcou partes de sua infraestrutura de avaliação para apoiar a reprodutibilidade, enquanto protege a integridade dos conjuntos de teste privados que geram as pontuações principais. Essa combinação de parceria de domínio, pontuação automatizada em nível especialista e tempo de resposta rápido distingue a plataforma dos quadros acadêmicos e das arenas puramente baseadas em preferência.

Razão da a16z para liderar a rodada em uma avaliação de US$ 400 milhões

Andreessen Horowitz contextualizou o investimento em torno do clássico problema de assimetria de informação descrito pelo economista George Akerlof: quando os vendedores sabem mais sobre a qualidade do produto do que os compradores e têm incentivos para apresentar dados favoráveis, os mercados se degradam em direção a resultados de menor qualidade. Jennifer Li e colegas da a16z compararam a necessidade de um árbitro independente de IA à emergência histórica da Moody’s nos mercados de crédito e dos auditores independentes nos relatórios de empresas públicas. O modelo de receita da Vals, que cobra por serviços de avaliação em vez de certificar as afirmações de qualquer laboratório específico, visa preservar a independência estrutural.
 
A empresa destacou a profundidade técnica dos fundadores e seu ceticismo de longa data sobre a validade dos benchmarks, observando que Rayan Krishnan e Langston Nashold já haviam colaborado em problemas de medição do mundo real enquanto estudavam ciência da computação em Stanford. A avaliação da rodada e a participação da HRT Ventures, ligada ao trading quantitativo, sinalizam ainda mais que o capital sofisticado considera a medição confiável como infraestrutura crítica, e não apenas uma ferramenta de pesquisa periférica. O comentário oficial da a16z enfatiza que os modelos estão passando de responder perguntas a executar fluxos de trabalho agênticos de várias horas, aumentando o custo de uma escolha inadequada de modelo de gasto de tokens para perda de tempo e resultados de clientes.

Históricos dos Fundadores e as Origens da Tese da Avaliação Independente

Rayan Krishnan, que atua como CEO da empresa, possui um histórico notável que inclui experiências anteriores na Palantir, uma conhecida empresa de análise de dados. Seu co-fundador, Langston Nashold, ocupa a posição de CTO e traz uma vasta experiência adquirida em grandes empresas de tecnologia, como Meta, NVIDIA e Hudson River Trading. Os dois fundadores se conheceram pela primeira vez durante uma viagem de mochila pré-orientação na Universidade de Stanford, onde rapidamente formaram uma ligação. Posteriormente, colaboraram em diversos projetos de ciência da computação, o que os levou a uma importante constatação: modelos de linguagem de grande porte têm o potencial de revolucionar a forma como o trabalho é realizado. No entanto, também reconheceram que a indústria ainda carecia de métodos críveis e eficazes para testar esses modelos. Motivados por suas insights, tomaram a ousada decisão de deixar seus respectivos programas de pós-graduação para criar a Vals. O foco inicial de sua nova empreitada foi em tarefas financeiras e de programação, que identificaram como representando partes substanciais da atividade econômica nos Estados Unidos.
 
À medida que começaram a ganhar tração no mercado, receberam citações notáveis em principais cards de modelos e obtiveram apoio para suas iniciativas do Departamento de Comércio, bem como envolvimento em esforços congressionais relacionados à política de IA. Os fundadores dão grande ênfase à importância de continuar a aposentar benchmarks desatualizados e utilizar conjuntos de testes privados. Essa abordagem é um resultado direto de suas observações sobre o quão rapidamente os modelos podem atingir o pico de benchmarks estáticos e como os dados de treinamento podem influenciar avaliações públicas. Sua experiência combinada em sistemas de produção e ambientes quantitativos informou significativamente o design da pilha de avaliação, bem como o produto comercial que as empresas agora utilizam para selecionar e monitorar modelos alinhados com a vanguarda da tecnologia.

Benchmarkes de Agentes Financeiros Revelam Diferenças Persistentes Entre Pontuações no Quadro de Líderes e Trabalho de Nível Analista

Embora os modelos alcancem resultados quase perfeitos em conjuntos acadêmicos mais antigos, o conjunto Finance Agent v2 continua a revelar deficiências materiais significativas que não podem ser ignoradas. As tarefas envolvidas neste conjunto abrangem síntese multi-documento, modelagem de valor relativo e geração de recomendações, todas as quais refletem de perto a saída diária produzida por analistas financeiros profissionais da indústria. O teto de 52 por cento registrado em maio de 2026 para o sistema líder serve como um lembrete contundente de que pontuações elevadas em conhecimento geral não equivalem automaticamente a capacidades confiáveis e autônomas de análise financeira.
 
A Vals pondera estrategicamente seu índice composto Vals Index considerando as contribuições aproximadas dos setores para o PIB dos EUA, o que confere ao setor financeiro um efeito multiplicador substancial, garantindo que o impacto econômico seja precisamente refletido na classificação agregada dos diversos modelos. Empresas que implementaram com sucesso modelos selecionados parcialmente por meio das avaliações da Vals relatam utilizar a plataforma não apenas para o processo inicial de seleção, mas também para a medição contínua do desempenho do produto em relação às linhas de base estabelecidas. Além disso, a lacuna existente no desempenho também desempenha um papel crucial na orientação das decisões de alocação de capital dentro das instituições financeiras. Essas instituições devem justificar seus gastos em IA com ganhos de produtividade mensuráveis, em vez de depender exclusivamente de demonstrações qualitativas, que muitas vezes podem ser subjetivas e menos confiáveis. Esse processo contínuo de avaliação é essencial para garantir que os investimentos em tecnologias de IA produzam benefícios tangíveis e melhorias na eficiência operacional.

Vals Smith abre benchmarks de codificação personalizados extraídos diretamente de repositórios empresariais

Com o anúncio da Série A, a Vals tornou o Smith geralmente disponível, permitindo que qualquer organização gere um benchmark de codificação personalizado a partir de seus próprios repositórios do GitHub. O sistema extrai tarefas de desenvolvimento reais de pull requests históricos e aplica testes ocultos para determinar se um modelo consegue concluir o trabalho. Os usuários recebem 120 créditos gratuitos para começar. Para empresas cujos repositórios de código contêm padrões, bibliotecas e convenções arquitetônicas proprietários, a distinção entre proficiência genérica em Python ou Java e a capacidade de operar dentro desse ambiente específico é decisiva.
 
Smith converte, portanto, a questão abstrata da capacidade de codificação em uma medição concreta específica da organização. Os primeiros adotantes empresariais agora podem classificar modelos com base no desempenho em sua carga de trabalho de engenharia real, e não em conjuntos públicos que podem ter sido parcialmente memorizados ou otimizados contra. O lançamento amplia o alcance do Vals além de benchmarks de domínio pré-construídos para uma infraestrutura de avaliação personalizada que se escala conforme as necessidades dos clientes.

Índice RSI e ReverseEngBench ampliam cobertura para domínios de risco de fronteira

Em conjunto com o recente financiamento, a Vals apresentou com orgulho o Índice RSI, desenvolvido em colaboração com a CoreWeave. Este índice inovador tem como objetivo avaliar se diversos modelos são capazes de executar as tarefas de pesquisa essenciais para avançar o desenvolvimento de modelos, técnicas de compressão, metodologias de treinamento, estratégias de otimização de parâmetros, práticas de engenharia de harness e avaliações pós-treinamento. Além disso, a empresa introduziu o ReverseEngBench, um projeto meticulosamente desenvolvido em parceria com instituições acadêmicas renomadas, incluindo a Universidade de Columbia, a Universidade Tufts, a UC Berkeley e a UCLA. Este benchmark abrangente consiste em 19 programas proprietários, que juntos somam em média mais de 16.000 linhas de código.
 
Esses programas abrangem uma ampla gama de áreas, incluindo protocolos de rede, firmware, aplicações de jogos, processos de recuperação de formatos de arquivo e análise de malware, todos protegidos por um conjunto abrangente de anti-análise projetado para aumentar a segurança. Resultados preliminares indicam uma diferenciação significativa entre os principais modelos de ponta, revelando um potencial considerável restante antes que agentes possam reverter consistentemente binários realistas. Além desses esforços, trabalhos em estágio inicial também foram iniciados no campo de aplicações de saúde mental, com planos para expansão futura em áreas críticas como avaliações de impacto ambiental, aplicações militares e domínios de biosegurança. Essas avaliações, orientadas para risco, abordam capacidades cruciais tanto para aprimorar a postura de segurança empresarial quanto para avaliações governamentais de sistemas de ponta.

Índice Vals 2.0 agrega desempenho ponderado pela contribuição econômica

O site redesenhado e o Vals Index 2.0 agora apresentam cobertura significativamente mais ampla em diversos domínios, incluindo finanças, programação e tarefas jurídicas. Os pesos setoriais utilizados no Índice são derivados dos dados de valor agregado fornecidos pelo Bureau of Economic Analysis. A fórmula composta empregada calcula a média das métricas de desempenho dentro de cada setor e, em seguida, combina esses escores setoriais com base em suas participações aproximadas no PIB. Em meados de agosto de 2026, o Claude Opus 5 está na liderança do Índice, seguido de perto pelo Claude Fable 5 e GPT-5.6 Sol.
 
O Índice é atualizado com frequência para refletir os lançamentos mais recentes de modelos e serve como uma métrica principal que indica o potencial impacto econômico, permitindo aos usuários aprofundar-se nos rankings individuais de domínios para obter insights mais detalhados. Devido ao fato de que os benchmarks subjacentes permanecem em grande parte privados e são atualizados periodicamente, o Índice consegue manter sua diferenciação por um período mais longo em comparação com compostos puramente públicos. Empresas e pesquisadores consultam esse Índice não apenas para fins de classificação relativa, mas também para realizar análises de troca entre custo, latência e capacidade em todo o ecossistema de modelos atual, garantindo que tomem decisões informadas com base nos dados mais relevantes disponíveis.

Padrões de adoção empresarial e a demanda por ROI mensurável

Implantações em larga escala de IA estão cada vez mais integrando avaliações Vals ao selecionar modelos base e ao avaliar produtos internos em relação às métricas de desempenho de ponta. Essa combinação de retorno rápido, especificidade de domínio e independência resolve efetivamente os desafios práticos enfrentados por equipes de aquisição e líderes técnicos: os painéis de avaliação de fornecedores sozinhos não são mais suficientes para tomar decisões de alto risco.
 
O notável crescimento de receita de oito vezes em relação ao total de 2025, juntamente com uma base de clientes dobrada e uma força de trabalho triplicada em apenas seis meses, indica claramente que a demanda passou da fase inicial de experimentação para uma fase de dependência operacional. Governos também se engajaram com a plataforma para obter insights valiosos sobre medição de capacidade e risco cibernético, reforçando assim sua importância tanto em contextos comerciais quanto políticos. A capacidade da plataforma de acompanhar lançamentos semanais de modelos garante que o sinal permaneça atual e relevante, em vez de ficar atrasado em relação à fronteira por vários meses.

Ecossistema e diferenciação estrutural em relação a plataformas baseadas em preferência

Outros esforços de avaliação estão de fato presentes no cenário, incluindo ambientes de votação por preferência que agregam julgamentos humanos sobre saídas abertas, bem como abordagens psicométricas que visam reduzir significativamente o tempo de avaliação. O Vals diferencia-se por meio de seu design de tarefas profissionais curado por especialistas, que garante alta relevância e aplicabilidade, juntamente com a correção automatizada meticulosamente calibrada para atender aos padrões estabelecidos do domínio. A empresa utiliza conjuntos de testes privados que são continuamente aposentados para manter a integridade de suas avaliações e possui um histórico comprovado de citações por todos os principais laboratórios de ponta da área.
 
Este registro de citação serve como uma forma crucial de legitimidade que novos entrantes devem buscar conquistar para ganhar credibilidade. Além disso, a ênfase da empresa em fluxos de trabalho multietapas ponderados economicamente, em vez de se concentrar apenas na preferência conversacional ou na velocidade pura, posiciona-a como uma infraestrutura vital para tomar decisões de produção informadas, e não apenas como um participante nos rankings de pesquisa. Os investidores claramente reconheceram e precificaram essa diferenciação única na impressionante avaliação de US$ 400 milhões.

Inferência para desenvolvedores de modelos e a velocidade da medição de capacidades

Os laboratórios de ponta agora operam em um ambiente onde pontuações independentes carregam credibilidade externa que os números auto-relatados cada vez mais perdem. A citação em cartas de modelo sinaliza aos compradores corporativos que os resultados foram submetidos a escrutínio de terceiros. Ao mesmo tempo, a criação contínua de benchmarks mais difíceis eleva a barra que modelos subsequentes devem superar. O processo de “subida de colinas” que impulsionou o progresso da IA enfrenta, portanto, um conjunto mais íngreme e frequentemente atualizado de colinas.
 
Desenvolvedores que tratam a avaliação como uma após-pensada correm o risco de descobrir lacunas de capacidade somente após a implantação; aqueles que integram medições independentes mais cedo podem priorizar melhorias que importam para o trabalho real. A abertura do código de componentes selecionados de infraestrutura incentiva ainda mais a reprodutibilidade, enquanto protege as avaliações privadas centrais que geram as pontuações de maior sinal.

Necessidade mais ampla do mercado por instituições de medição confiáveis

À medida que os sistemas de IA se aprofundam em fluxos de trabalho legal e financeiramente consequenciais, a ausência de medição independente cria os mesmos riscos de assimetria de informação que historicamente deram origem a agências de classificação e auditores em outras indústrias. As métricas de crescimento da Vals e o calibre de seus apoiadores sugerem que o capital reconhece essa lacuna institucional. A missão declarada da empresa, de servir como avaliadora independente da inteligência artificial, alinha-se aos requisitos práticos das empresas em busca de clareza sobre o ROI e dos formuladores de políticas em busca de compreensão sobre capacidade e risco.
 
A expansão contínua para domínios profissionais e de risco adicionais testará se a metodologia é escalável enquanto preserva a independência e a qualidade do sinal. Por enquanto, a combinação de lançamentos recentes de produtos, rápida adoção comercial e compromisso de capital de alto perfil estabelece a Vals como ponto de referência central para qualquer um que precise decidir quais modelos realmente conseguem realizar o trabalho que importa.

Perguntas Frequentes

O que exatamente a Vals AI anunciou em sua rodada de financiamento Série A?

A Vals AI encerrou uma rodada Series A de US$ 40 milhões com uma avaliação de US$ 400 milhões em 13 de agosto de 2026. A Andreessen Horowitz liderou a rodada, com investidores existentes 8VC, Pear VC e Bloomberg Beta retornando, e novos investidores HRT Ventures e Next Ladder Ventures se juntando. A empresa lançou simultaneamente o Vals Smith para benchmarks de codificação personalizada, o Índice RSI, o ReverseEngBench, o Vals Index 2.0 expandido e um site reformulado. Declarações oficiais da Vals e da a16z confirmam os valores e os lançamentos de produtos acompanhantes.
 

Como os benchmarks Vals diferem de painéis públicos como MMLU ou SWE-bench?

Vals se concentra em fluxos de trabalho profissionais em múltiplas etapas definidos com especialistas de domínio e avaliados por sistemas automatizados calibrados conforme padrões de especialistas. Os conjuntos de teste principais permanecem privados e são aposentados quando deixam de diferenciar modelos, reduzindo contaminação e manipulação de otimização. Conjuntos acadêmicos públicos frequentemente se saturam ou vazam para dados de treinamento, limitando seu valor preditivo para tarefas empresariais reais. A abordagem do Vals produz resultados em poucas horas após o acesso ao modelo e já aparece nas fichas de modelos de grandes laboratórios.
 

Qual é a importância da pontuação de 52 por cento nas tarefas do Finance Agent?

Em maio de 2026, o modelo líder alcançou aproximadamente 52 por cento de precisão no conjunto Finance Agent v2, que exige modelagem de valor relativo, síntese de documentos e recomendações fundamentadas. O número indica que mesmo os sistemas mais avançados disponíveis ainda falham em aproximadamente metade das tarefas esperadas de um analista financeiro profissional. Essa lacuna entre os resultados acadêmicos e o desempenho em tarefas profissionais é exatamente o problema que o Vals visa medir e, assim, ajudar a reduzir.
 

Quem são os fundadores e que experiência eles trazem?

O CEO Rayan Krishnan trabalhou anteriormente na Palantir. O CTO Langston Nashold tem experiência na Meta, NVIDIA e Hudson River Trading. Ambos estudaram ciência da computação em Stanford e começaram a colaborar em problemas de medição antes de fundar a empresa. Suas experiências combinam conhecimento em sistemas de produção com perspectivas quantitativas e de pesquisa que moldam a ênfase da Vals em avaliação rigorosa e adaptativa.
 

O que o Vals Smith permite para as empresas?

Vals Smith permite que qualquer organização gere um benchmark de codificação personalizado diretamente a partir de seus repositórios GitHub. O sistema extrai tarefas de desenvolvimento realistas de pull requests históricos e aplica testes ocultos. Os usuários começam com 120 créditos gratuitos. A ferramenta converte benchmarks de codificação genéricos em medições específicas da organização que refletem padrões de código proprietários e práticas de engenharia.
 

Como o índice Vals incorpora o peso econômico?

O Índice agrega o desempenho em tarefas financeiras, de programação e jurídicas, ponderando as médias setoriais de acordo com suas contribuições aproximadas para o PIB dos EUA, utilizando dados do Bureau of Economic Analysis. O composto resultante fornece uma única medida geral do potencial impacto econômico, permitindo ainda uma inspeção detalhada dos resultados individuais de cada domínio. A versão 2.0 ampliou a cobertura e é atualizada frequentemente para refletir novos lançamentos de modelos.

🔥 A KuCoin oferece uma opção mais estável em um mercado volátil

Se você se preocupa com as subidas e descidas frequentes do mercado e busca uma opção mais estável para ganhar dinheiro passivamente, a KuCoin é o lugar certo:
 
Imagem personalizada
 
Simple Earn: Deposite e saque tokens a qualquer momento, ganhando retornos estáveis.
KuCoin Earn: Ganhe lucros estáveis com gestão profissional de ativos.
Hold to Earn: Ganhe recompensas mantendo ativos em Contas de Financiamento, Negociação, Margem, Futuros, Mineração e Conta Unificada.
Staking: Desbloqueie o potencial de ganhos dos ativos on-chain.
Investimentos Avançados: Investimentos Avançados oferecem uma variedade de produtos estruturados para ajudar seu dinheiro a crescer em qualquer mercado.
Shark Fin: Proteção do Principal e Ganhos Garantidos
Investimento duplo: Compre baixo e venda alto com cálculos de retorno transparentes.
Bola de neve: Rendimentos altos, com proteção de preço.
Compra com Desconto: Compre criptomoedas a preços com desconto.
KCS Loyalty: Nível superior para desfrutar de benefícios exclusivos ao fazer staking de ≥ 1 KCS.
KuCoin Wealth: Descubra o valor futuro e comece sua jornada de investimento inteligente.
Benefícios do KCS: Mantenha e faça staking de KCS para acessar benefícios em toda a plataforma.
KCS Staking 2.0: Participe da governança on-chain do KCS para ganhar rendimento.

Disclaimer: Este conteúdo é apenas para fins informativos e não constitui aconselhamento financeiro. Investimentos em criptomoedas envolvem risco. Faça sua própria pesquisa (DYOR).
 

Aviso legal: Esta página foi traduzida usando tecnologia de IA para sua conveniência. Para informações mais precisas, consulte a versão original em inglês.