Resolver cada problema em um dos benchmarks mais difíceis da matemática normalmente custa dezenas de milhares de dólares. O NEAR AI acabou de fazer isso por $111.
Em 6 de setembro de 2026, o co-fundador do NEAR Protocol, Alex Skidanov, anunciou que o agente de código aberto do projeto resolveu todos os 672 problemas no benchmark PutnamBench, um conjunto retirado da Competição Matemática William Lowell Putnam. A conta total: $111. A segunda submissão mais barata conhecida custou 250 vezes mais.
O que é o PutnamBench e por que ele importa
A competição Putnam é o concurso de matemática de graduação mais prestigiado da América do Norte. Obter uma pontuação zero não é incomum, mesmo entre estudantes brilhantes. A prova foi projetada para te desafiar.
PutnamBench, introduzido em 2024, pega essa tradição de dificuldade e a transforma em um conjunto formal de avaliação para provadores de teoremas de IA. O benchmark contém 672 problemas codificados em Lean 4, uma linguagem de assistente de prova que exige que argumentos matemáticos sejam escritos com precisão verificável por máquina. Uma prova logicamente imprecisa é rejeitada totalmente, sem pontuação parcial.
Antes do resultado do NEAR AI, agentes que tentavam o PutnamBench frequentemente precisavam de milhares de chamadas de inferência por problema. Os custos de computação se acumulavam rapidamente, colocando execuções completas do benchmark na faixa de US$ 10.000 a US$ 25.000 em despesas totais para os principais sistemas.
O agente Lean da NEAR AI concluiu todo o conjunto de 672 problemas por $111.
Por que a diferença de custo é a verdadeira história
Com custos de US$ 10.000 a US$ 25.000 por execução completa, apenas um pequeno número de organizações podia arcar com a iteração, experimentação e melhoria de seus pipelines de prova de teoremas. Com US$ 111, esse cálculo se inverte completamente.
O rápido avanço nos resultados do PutnamBench entre 2025 e 2026 já era impulsionado por fluxos de trabalho agentes que combinam modelos de linguagem grandes com o mecanismo de verificação de provas do Lean. A abordagem da NEAR AI expande esse padrão, mas adiciona uma camada de eficiência que a comunidade do benchmark nunca havia visto antes.
NEAR AI posicionou essa conquista dentro de uma visão mais ampla de infraestrutura centrada no que chama de IronClaw, um framework orientado para IA confidencial e verificável. A capacidade de verificação formal se encaixa diretamente nesse enquadramento: se você puder provar que um argumento matemático está correto no nível da máquina, terá uma base para sistemas de IA cujas saídas possam ser auditadas independentemente, em vez de serem confiadas por fé.
A decisão do NEAR Protocol de tornar o agente Lean de código aberto aumenta ainda mais a importância. Ferramentas proprietárias que oferecem uma vantagem de custo de 250x tendem a permanecer proprietárias. Tornar o agente de código aberto significa que a metodologia está disponível para inspeção, extensão e uso por qualquer pessoa.

