Modelos globais de IA dominam a IMO 2026 com pontuações perfeitas

icon MarsBit
Compartilhar
AI summary iconResumo
Notícias de IA + cripto explodiram quando quatro modelos de IA—Claude Fable 5, GPT-5.6 Sol xhigh, Kimi K3 e AxiomProver—obtiveram 42/42 na IMO de 2026, superando 99% dos competidores humanos. Apenas 30 humanos já conseguiram pontuações perfeitas em sete anos. A Axiom Math traduziu os problemas para Lean 4 para pontuação automatizada. Os custos variaram de $0,18 a $51. Discussões globais sobre políticas de cripto podem em breve incluir o papel da IA em matemática e lógica.

Julho em Xangai, ondas de calor intensas.

A 67ª Olimpíada Internacional de Matemática encerrou oficialmente, com a equipe da China conquistando o primeiro lugar com 232 pontos. Três jovens obtiveram a pontuação máxima de 42 pontos.

Axiom Math

Os aplausos ao vivo ainda não se dissiparam, quando outra lista impressionante surgiu silenciosamente no GitHub.

O ex-engenheiro do Google, Deedy Das, realiza uma comparação abrangente de IA: 7 modelos avançados enfrentam sozinhos todos os 6 problemas do IMO 2026.

Claude Fable 5 conquistou 42 pontos perfeitos. Gastou apenas 2,5 horas e US$ 51.

A versão xhigh do GPT-5.6 Sol também obteve nota máxima. Levou 3,8 horas e o custo foi reduzido a um mínimo de 20 dólares.

Kimi K3 seguiu de perto, conquistando a pontuação máxima. Após 17,4 horas de batalha, gastando 31 dólares.

Somando-se o AxiomProver com entrega independente, todas as quatro forças alcançaram a pontuação máxima.

Axiom Math

Como referência, nos últimos sete anos da IMO, 4.347 participantes humanos competiram, e apenas 30 obtiveram pontuação perfeita — uma proporção de 0,69%.

Axiom Math

Vitória esmagadora e discrepante

Os resultados mostram não apenas um abismo de 14 pontos entre a pontuação perfeita de 42 e o quarto lugar com 28, mas também que os três modelos com pontuação perfeita alcançaram o topo de maneiras completamente diferentes.

Claude Fable 5 atuou de forma limpa e eficiente. 9 rodadas de conversa, 6 rodadas com saídas efetivas, tempo máximo de uma única sessão de 73 minutos (P3), com um total de 700 mil tokens gerados.

O GPT-5.6 Sol parece ter enfrentado algumas dificuldades. Na P2, gastou 106 minutos para completar 4 rodadas, interrompido duas vezes por falhas de rede. Mas o controle de capacidade de processamento é simplesmente impressionante — o total de tokens gerados foi de apenas 230 mil, o mais econômico entre os três perfeitos.

Kimi K3 é como uma besta incansável. Um modelo MoE com 2,8 trilhões de parâmetros emitiu 1,54 milhão de tokens de uma só vez, 6,5 vezes mais que o Sol. Só na questão P3, realizou 6 ataques, lutando por 491 minutos.

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Enfrentamento direto da intuição matemática

P1 é o aperitivo mais suave de toda a competição, todos os modelos resolvem em poucos minutos, e os participantes humanos quase não erram.

O enunciado afirma que há 2.026 inteiros positivos maiores que 1 escritos no quadro. Em cada passo, escolhem-se dois números m e n, apagam-se e substituem-se por gcd(m,n) e lcm(m,n)/gcd(m,n). Repete-se o processo até que não seja mais possível continuar. Prove que: (a) o processo certamente terminará, deixando exatamente um número M maior que 1; (b) o valor de M não depende da ordem das operações.

Axiom Math

Para facilitar a compreensão desta questão, vamos realizar um experimento em escala reduzida.

No quadro há apenas 12 e 18. 12 = 2² × 3, 18 = 2 × 3². Passo 1: mdc(12,18) = 6, mmc(12,18)/6 = 6, o quadro se torna [6, 6]. Passo 2: mdc(6,6) = 6, mmc(6,6)/6 = 1, o quadro se torna [6, 1]. Resta apenas um número maior que 1, o jogo termina. M = 6.

Não importa em que ordem você execute as operações, M é sempre 6. Por quê?

The answer lies in the prime factors.

Para cada número primo p, tome o máximo divisor comum das contagens de divisões por p de todos os números e multiplique essas potências primas — esse valor permanece inalterado da primeira etapa até a última.

Claude Fable 5: criou diretamente um contador que diminui inevitavelmente a cada passo.

Para este problema, o Fable 5 define uma quantidade Φ = T + N. T é a soma do número de fatores primos de todos os números na lousa (contando repetições), e N é o número de números maiores que 1. Por exemplo, para a lousa [12, 18], os fatores primos de 12 são 2, 2, 3 (total de 3), e os de 18 são 2, 3, 3 (total de 3), logo T = 6, N = 2 e Φ = 8.

Então, prova-se que: a cada operação realizada, Φ diminui em pelo menos 1. Há dois casos — se gcd(m,n) > 1, o número total de fatores primos T diminui; se gcd(m,n) = 1, T permanece inalterado, mas há um número menor que é maior que 1, logo N diminui em 1. Φ é um inteiro positivo, e a cada passo diminui em pelo menos 1, portanto o processo deve terminar em um número finito de etapas. Um único contador, um corte definitivo.

Axiom Math

GPT-5.6 Sol: Rastrear produto, redução dimensional em ordem lexicográfica decrescente.

Sol observa dois valores: P = o produto de todos os números, K = a quantidade de números maiores que 1. Em cada operação, se gcd(m,n) = d > 1, o produto dos dois novos números é mn/d, que é menor que o original, fazendo com que o produto global P diminua estritamente. Se d = 1, P permanece inalterado, mas K reduz-se em 1.

O par (P, K) é estritamente decrescente na ordem lexicográfica: ou P diminui, ou P permanece constante mas K diminui. A ordem lexicográfica de inteiros positivos não pode diminuir infinitamente. Terminado.

Axiom Math

Duas abordagens totalmente diferentes resolveram a parte (a) do mesmo problema.

Na parte (b), os três modelos convergem: todos demonstram que, para cada número primo p, o máximo divisor comum das vezes em que todos os números no quadro são divisíveis por p permanece inalterado durante as operações. A fórmula final é exatamente a mesma—

Axiom Math

Voltando ao exemplo: 12 e 18. Para p=2, v₂(12) = 2, v₂(18) = 1, mdc = 1, contribuição 2¹. Para p=3, v₃(12) = 1, v₃(18) = 2, mdc = 1, contribuição 3¹. M = 2 × 3 = 6, exatamente igual ao cálculo manual.

O whitepaper mais barato de todo o mercado

Este problema de teoria dos números, P6, é o último da Day 2 e exige a prova de que a sequência recursiva eventualmente se torna periódica.

No ano passado, apenas 6 humanos em todo o mundo resolveram o P6 da IMO 2025.

Claude Fable 5: 26 minutos, duas rodadas, nota máxima. GPT-5.6 Sol: 60 minutos, duas rodadas, nota máxima. Kimi K3: 381 minutos, quatro rodadas, pontuação máxima.

O Grok 4.5 produziu apenas 7.053 tokens no P6, ficando em último lugar. O arquivo de envio continha claramente a seguinte frase: Full proof: (Not yet complete.)

$0,18, o boletim mais barato de toda a plataforma.

Os problemas do Grok não param por aí. Durante todo o teste, ele repetidamente caiu em uma ilusão estranha: afirmou com convicção que "a prova já foi gravada no arquivo", enquanto o sistema de fundo nem sequer tocou na ferramenta de gravação.

Não é um problema de capacidade matemática, é um problema de capacidade do agente. O modelo sabe que deve escrever o arquivo e afirma que o fez, mas não agiu no nível da chamada de ferramentas.

Três saltos em três anos

A evolução aterrorizante do cérebro de silício

Em 2024, o AlphaProof do DeepMind alcançou pela primeira vez a barreira da medalha de prata no nível da IMO.

Em 2025, a OpenAI e a DeepMind agiram simultaneamente. A OpenAI resolveu 5 questões sem divulgar o modelo, conquistando a medalha de ouro com 35 pontos, enquanto o Gemini Deep Think alcançou o mesmo nível.

Em 2026, três grandes modelos gerais obtiveram pontuação perfeita diretamente. Desta vez, nenhum deles passou por treinamento especializado em matemática, e todos podem acessá-los. Um deles é até mesmo de código aberto.

Axiom Math

Quem escreveu a carta da máquina

O ponto de partida de todo o teste é uma empresa chamada Axiom Math.

Eles traduziram palavra por palavra as seis questões do IMO 2026 em formulários formalizados em Lean 4 compreensíveis por máquinas.

Com este conjunto de perguntas legíveis por máquina, a IA pode gerar diretamente provas Lean e ser avaliada automaticamente pelo compilador, eliminando a necessidade de avaliadores humanos.

Após receber o enunciado, Deedy Das rapidamente construiu um framework de teste totalmente automatizado. Os principais modelos correram em pista, completando todas as seis etapas. O AxiomProver também conquistou independentemente a pontuação máxima.

É digno de nota que Hong Letong, fundadora da Axiom Math, tem apenas 25 anos. Nascida em Guangzhou, ela conquistou em apenas três anos um duplo diploma em matemática e física do MIT e é ganhadora do Morgan Prize.

No final do ano passado, ela liderou o AxiomProver a conquistar a pontuação perfeita no concurso Putnam de matemática. Este foi o sexto milagre de pontuação perfeita na história de 98 anos do concurso.

Em março deste ano, a empresa concluiu um financiamento da série A de 200 milhões de dólares. Sua avaliação atingiu 1,6 bilhão de dólares.

Axiom Math

Como a vida das pessoas comuns será reestruturada

Pode escrever um modelo com 4.229 linhas de prova rigorosa, e não apenas possui a capacidade de resolver problemas matemáticos.

O que ele realmente controla é a cadeia lógica de raciocínio, onde cada passo não pode ser pulado, não pode estar errado e não pode ser vago.

Existem falhas nos termos do contrato? As condições para o sinistro do seguro são atendidas? O plano tributário é compatível? Ao desvendar a aparência, são todas a mesma questão: a resposta não pode ser “quase correta”.

Antes, essa verificação individual só podia ser feita por profissionais, com cobrança por hora.

Hoje, com essa funcionalidade sendo integrada em produtos de consumo, basta abrir o celular para resolver problemas difíceis.

Referências:

https://x.com/deedydas/status/2079409461874332066

Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI, editor: Moisés

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.