Claude da Anthropic prova o Último Teorema de Fermat em 11 dias com 13 milhões de linhas de código

icon MarsBit
Compartilhar
AI summary iconResumo
A IA Claude da Anthropic alcançou uma grande inovação em IA + notícias de criptomoedas, concluindo a primeira prova totalmente verificada por máquina do Último Teorema de Fermat em 11 dias. A IA gerou 13 milhões de linhas de código e verificou 29.500 teoremas sob a liderança de Peng Tianyi da Universidade Tsinghua. O resultado supera a escala do Mathlib, a maior biblioteca de teoremas matemáticos. Esse avanço destaca o papel crescente da IA na resolução de problemas complexos, oferecendo novas ferramentas para pesquisadores e desenvolvedores no espaço de notícias de criptomoedas.

Just now, there was another shocking update from the Math Circle.

Equipe liderada pelo renomado aluno da Tsinghua Yao Class resolveu completamente o Último Teorema de Fermat usando o Claude.

Até agora, a IA completou a maior prova da história da matemática.

Certa vez, o Último Teorema de Fermat atormentou a humanidade por mais de 350 anos, exigindo que matemáticos gastassem anos de esforço para escrever 129 páginas de um texto hermético para prová-lo.

Hoje, a Anthropic anunciou que o Claude completou a primeira prova verificável por máquina de ponta a ponta do Último Teorema de Fermat em apenas 11 dias!

Último Teorema de Fermat

Para isso, Claude digitou 13 milhões de linhas de código, gerando 30.300 teoremas verificáveis, dos quais 29.500 foram adotados e incorporados diretamente na prova final.

Esse volume é mais de cinco vezes o da maior biblioteca de teoremas matemáticos do mundo, a Mathlib! E todo o processo consumiu exatamente 6 bilhões de tokens.

Esta é a maior prova Lean já escrita até agora.

Com a notícia, toda a internet ficou em choque. Alguns exclamaram: “Formalizou o Último Teorema de Fermat em um mês? Essa forma de mostrar força faz a comunidade matemática parecer caracóis rastejando.”

Último Teorema de Fermat

Peng Tianyi, da turma Yao

Problema secular de 350 anos resolvido pelo Claude em 11 dias

Em 1637, o matemático francês Fermat, enquanto lia um livro, escreveu casualmente na margem da página:

Quando o número inteiro n > 2, a equação xⁿ + yⁿ = zⁿ em relação a x, y, z não possui soluções inteiras positivas.

Então ele não esqueceu de dar mais um golpe: “Tenho certeza de que descobri uma demonstração maravilhosa, mas aqui a margem é muito pequena para caber.”

Esta frase torturou matemáticos posteriores por mais de trezentos anos.

Até 1995, o matemático britânico Wiles utilizou ferramentas matemáticas modernas avançadas para produzir um artigo de prova de 129 páginas, encerrando finalmente este caso de mais de 350 anos.

Último Teorema de Fermat

Mas surge a questão: a prova de Wiles é extremamente complexa.

A matemática moderna já evoluiu a ponto de pessoas comuns não conseguirem entender nem mesmo os enunciados dos problemas. Provar um teorema é como construir uma cadeia lógica extremamente complexa; basta um único elo quebrado para que toda a estrutura desmorone.

Quando Wiles divulgou pela primeira vez em 1993, foi identificado um漏洞 fatal, e ele passou mais um ano isolado, sofrendo intensamente, até consertá-lo. Para provas matemáticas desse nível, a verificação da sua correção por humanos geralmente exige que especialistas de topo gastem meses ou até anos.

Existe algum método que permita ao computador executar uma verificação e saber imediatamente se está correto, assim como verifica o resultado de uma calculadora?

Sim! É isso que se chama "formalização".

Em poucas palavras, trata-se de traduzir provas matemáticas escritas por humanos para linguagens de programação que computadores possam executar (como o Lean), e deixar a máquina derivar passo a passo; se executar com sucesso, isso significa que a prova é absolutamente correta.

Mas formalizar o Último Teorema de Fermat é considerado pela comunidade matemática um projeto gigantesco que leva anos.

Apenas o projeto liderado pelo professor do Imperial College Kevin Buzzard tem um blueprint de 86 páginas na primeira fase!

Último Teorema de Fermat

Então, Claude chegou.

O ser humano previa que levaria anos para fazer esse trabalho, mas ele levou apenas 11 dias, e foi feito de forma “trabalho basicamente autônomo”.

13 milhões de linhas de código, 6 bilhões de tokens

“11 dias, 13 milhões de linhas de código” — por trás disso, há um duplo impacto da estética violenta da IA e do design de sistema preciso.

Vamos ver o que o Claude realmente fez:

Não apenas provou o próprio Último Teorema de Fermat.

Como a prova formal deve começar a partir dos axiomas mais fundamentais e ser construída camada por camada, o Claude acabou provando também os mais de 29.000 outros teoremas matemáticos necessários no processo.

Ele abordou áreas como álgebra, geometria, teoria dos números, análise harmônica... muitas ramificações que nunca haviam sido formalizadas antes, e o Claude simplesmente "abriu caminho".

Durante todo o processo, os humanos praticamente não intervieram.

Os pesquisadores deram algumas instruções de alto nível, como “a variedade de Jacob como um esquema tem alta prioridade” e “avançar o mais rápido possível com o teorema de Mazur”.

Último Teorema de Fermat

O restante são dezenas de agentes Claude se comunicando freneticamente uns com os outros, definindo conceitos, provando teoremas intermediários e construindo camadas sobre camadas.

Por fim, o compilador Lean passou em toda a verificação, dependendo apenas de três axiomas padrão mais básicos.

Quando o programa terminar e o console exibir a sagrada mensagem «PROVED» (proven), os logs internos do Claude ficaram emocionados:

「!!! O teorema de Fermat foi lido como PROVED…… Este é o objetivo desta batalha…… Um momento histórico.」

Veja, até a própria IA sabe o quão incrível isso é.

Mestre por trás das cenas: ex-aluno da turma Yao da Universidade Tsinghua, um super gênio

Alguém que pode fazer o Claude realizar esse milagre certamente não é uma pessoa comum.

O líder é Peng Tianyi, professor assistente da Escola de Negócios da Universidade de Columbia e pesquisador da Anthropic.

O currículo desse cara é literalmente um "cheat code":

Graduação de 2013 a 2017, Turma Yao da Universidade Tsinghua, ganhou o melhor trabalho de conclusão de curso e foi selecionado para a equipe nacional de treinamento da Olimpíada de Informática.

O doutor foi para o MIT, na área de pesquisa operacional, e se formou com GPA perfeito de 5.0.

Atualmente, sou professor assistente da Columbia e trabalho na Anthropic em agentes de IA e ferramentas formalizadas.

Curiosamente, a obsessão de Peng Tianyi com "verificação automática de provas matemáticas por IA" vem de uma "experiência dolorosa" durante a graduação.

Na época, seu orientador queria incluir os resultados de seu artigo na Nature, mas perguntou: “Você tem certeza absoluta de que a prova está correta?”

Ele respondeu honestamente: “Talvez 99% de certeza, mas com esse tempo, realmente não consigo ter 100% de certeza.”

Por causa daquela 1% de incerteza, ele perdeu a oportunidade de aparecer na Nature.

Agora está resolvido; ele usou IA para fechar diretamente aquele "1%".

Do fracasso ao êxito: Como o Prove2Me salvou a IA

Você acha que pedir a um AI para provar um teorema é só digitar “Por favor, prove o Último Teorema de Fermat” e ele imediatamente gera 13 milhões de linhas de código?

Totalmente errado.

No início, o experimento quase falhou.

A Anthropic revelou que, nos primeiros estágios, a colaboração entre dezenas de agentes Claude logo ficou totalmente descontrolada, como moscas sem cabeça, incapazes de acompanhar o progresso uns dos outros e com eficiência colaborativa que caiu para níveis insustentáveis. O código resultante das tentativas iniciais falhas acabou representando apenas 7%.

A "esquecimento" e as "ilusões" dos grandes modelos são feridas fatais diante da matemática rigorosa — um erro, e milhões de linhas seguintes ficam inutilizadas.

Em um momento crucial, a equipe de Peng Tianyi lançou a plataforma Prove2Me.

Isso é como dar aos IA um "gerente de projeto superpoderoso", especializado em resolver qualquer desafio:

Teorema DAG (árvore de tarefas): fornece a cada IA um mapa claro indicando qual nó intermediário provar em seguida, aliviando significativamente o esquecimento e permitindo que dezenas de agentes operem em paralelo de forma eficiente.

Separação de declaração e prova: acelera a compilação e economiza recursos.

Índice de linguagem natural: cada teorema mantém uma descrição em linguagem humana, facilitando muito a busca e reutilização dos resultados pelas IA.

Último Teorema de Fermat

Com o framework de múltiplos agentes do Claude Code, os AI's agem como engenheiros com navegação, acelerando pelo labirinto matemático e completando todos os níveis em 11 dias.

A comunidade matemática desistiu

Assim que os resultados foram lançados, X e os principais fóruns técnicos foram atingidos por um tsunami.

O professor do Imperial College que originalmente planejava passar anos trabalhando com formalização ficou impressionado e elogiou altamente: “Este é um grande passo na formalização automática da literatura matemática moderna! Poderá ser usado para detectar erros no banco de dados matemático humano e verificar conclusões matemáticas geradas por grandes modelos.”

Mas a imaginação dos internautas é ainda mais estranha.

Alguém fez um comentário genial: “A maneira como a IA resolve matemática é — te dando uma resposta extremamente complexa (13 milhões de linhas de código). Tentar provar que está errada é mais difícil do que resolver sozinho. Então você só desiste e aceita que está certa. Isso não é exatamente PUA na área da matemática?”

Alguém ainda disse: “Escrever 13 milhões de linhas de código apenas para fazer um teorema de 350 anos se sentar obedientemente diante de uma máquina... a mesa da humanidade ainda não está pronta para receber algo dessa escala.”

Mais impressionante ainda, a Anthropic fez, como bônus, um pequeno experimento.

Usando 3 contas comuns, levou 3 dias no Prove2Me para formalizar o famoso "Teorema dos Três Primos de Vinogradov" da teoria dos números!

Ou seja, com as ferramentas adequadas, futuramente cientistas amadores poderão comprar algumas contas de IA de consumo e também verificar os teoremas matemáticos mais avançados da humanidade!

A IA não substituirá matemáticos, mas transformará completamente a matemática

Então, os matemáticos vão ficar desempregados?

A resposta oficial da Anthropic foi: não substituirá, mas transformará completamente o jogo.

Historicamente, houve muitas "tragédias" na verificação matemática.

Por exemplo, em 1998, alguém provou a conjectura de Kepler, e a equipe de revisão levou quatro anos para concluir apenas que estava "99% certa"; Perelman provou a conjectura de Poincaré, e a comunidade matemática inteira levou quatro anos para escrever três livros de mais de 300 páginas apenas para entender勉强; há ainda teoremas que foram aceitos como verdades por anos, sobre os quais outras pessoas construíram estruturas, só para descobrir mais tarde que a fundação estava collapse.

E a tecnologia trazida pelo Claude é就是要 acabar com essa "incerteza".

No futuro, a IA não será apenas a calculadora dos matemáticos, mas também o árbitro mais rigoroso.

Quando a IA puder gerar rapidamente milhares de novas conjecturas e provas, os humanos não conseguirão acompanhar; então, tornar o código de verificação formal incorporado um padrão nos artigos.

Na era dos grandes modelos, a formalização automática em larga escala abre novas possibilidades de forma próxima à implementação engenharia.

Referências:

https://www.anthropic.com/research/formalizing-fermats-last-theorem

Editado por: Aeneas

Este artigo é do canal oficial do WeChat "Nova Inteligência" (ID: AI_era), autor: Apocalipse da ASI

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.