GPT-6 Astra resolve problema do Nível 4 de Matemática da Fronteira Final

icon MarsBit
Compartilhar
AI summary iconResumo
Notícias de IA + criptomoeda: A GPT-6 Astra resolveu o problema final do Tier 4 do FrontierMath, concluindo todos os desafios do benchmark avançado. Desenvolvida pela Epoch AI com mais de 60 matemáticos, a Astra alcançou 97,6% de precisão e resolveu o último problema não resolvido. O projeto agora avança para uma nova fase com pesquisa aberta e desafios formalizados, marcando um importante anúncio de projeto no avanço da IA.

Há pouco, o último desafio da FrontierMath Tier 4 foi resolvido pelo GPT-6 Astra.

Até agora, todos os problemas deste teste de nível de pesquisa, anteriormente considerado um pesadelo matemático para modelos grandes, já foram resolvidos com sucesso pelo menos uma vez por IA.

A Epoch AI também concluiu oficialmente que o FrontierMath Tier 4 está saturado.

FrontierMath

Embora, pelo gráfico acima, a Astra ainda não tenha atingido diretamente 100%, o próprio resultado divulgado pela OpenAI é de 97,6%.

Mas, de acordo com o algoritmo da Epoch, "resolver tudo" significa que, após acumular tentativas de diferentes modelos e diferentes momentos, cada questão do Tier 4 já teve uma solução bem-sucedida.

E o que o Astra derrubou foi exatamente a única que ainda não havia sido conquistada pela IA.

(Em termos simples, significa que a Astra pode ter cometido um erro em algum teste, mas a questão que ela acertou era uma que ninguém havia resolvido antes)

FrontierMath

Para ser honesto, esse ritmo de desenvolvimento ainda é bastante absurdo.

Se você acompanha avaliações de modelos, sabe que, quando o Tier 4 foi lançado em 11 de julho de 2025, o melhor resultado na lista era de apenas cerca de 5%.

Agora passou-se um ano e dois meses, e aquele que era antes uma “parede alta” tornou-se um “degrau”; a última questão difícil de ser contornada por IA por meio de atalhos também foi superada.

O criador da questão, Jay Pantone, professor associado de matemática da Universidade de Marquette, também afirmou que, anteriormente, a IA sempre procurava atalhos numéricos, mas desta vez, a solução da IA foi bastante semelhante à sua.

FrontierMath

No entanto, apenas recentemente, o GPT-6 Astra atacou fortemente a comunidade matemática, resolvendo problemas do milênio de dois em dois dias, e a Pantone afirmou que já está difícil de se surpreender!

Pode-se dizer que a matemática tornou-se um dos lugares onde a Astra mais intensamente aumentou sua presença recentemente.

De menos de 2%, até adicionar uma "linha de defesa de nível de pesquisa"

FrontierMath foi lançado pela primeira vez em 7 de novembro de 2024, e seu propósito original era evitar que o benchmark matemático fosse rapidamente superado por IA.

Na época, benchmarks matemáticos tradicionais como GSM8K e MATH estavam se tornando cada vez mais difíceis de diferenciar os modelos líderes, então a Epoch AI, em parceria com mais de 60 matemáticos, redesenhou um conjunto de questões originais nunca antes divulgadas.

Entre eles, estão Terence Tao, Timothy Gowers, Richard Borcherds e outros ganhadores da Medalha Fields.

Quando Tao Terence terminou de analisar alguns dos problemas de nível de pesquisa, ele afirmou diretamente que esses problemas eram “extremamente difíceis” e até sugeriu que o nível mais difícil, Tier 3, poderia ainda travar a IA por vários anos.

FrontierMath

Após o primeiro teste, como esperado, a precisão do modelo líder foi inferior a 2%.

Especificamente, no início, o banco de questões principal da FrontierMath continha 300 perguntas, classificadas por dificuldade em três níveis: Tier 1, Tier 2 e Tier 3.

FrontierMath

O Tier 1 é aproximadamente equivalente a questões de nível avançado de graduação e olimpíadas de matemática, mas permite o uso de ferramentas mais avançadas; o Tier 2 já alcança o nível de pós-graduação avançada; o Tier 3 aproxima-se mais de problemas de pesquisa exploratória encontrados no início do doutorado.

Mas com o surgimento de modelos de raciocínio, essas três primeiras camadas também começaram a se tornar insuficientes, então, em 2025, a Epoch adicionou mais uma camada: Tier 4.

O Nível 4 é principalmente projetado por professores de matemática e pós-doutorandos, cada um realizando uma pesquisa de curto prazo de cerca de algumas semanas em torno de sua própria área de pesquisa, finalizando com a compressão dos resultados em uma questão passível de verificação automática.

FrontierMath

Inicialmente, o Tier 4 continha 50 perguntas. Elas abrangem áreas como análise, teoria dos números, matemática combinatória, topologia, geometria algébrica...

No lançamento, em todos os testes anteriores dos modelos, apenas três perguntas haviam sido resolvidas, e essas soluções dependiam de algumas suposições corretas, mas não suficientemente justificadas.

Diante disso, na página de exemplos públicos do site oficial, a Epoch também já afirmou: algumas dessas questões podem não ser resolvidas por IA por décadas.

FrontierMath

(Esta frase agora começará a ser repetidamente atacada)

No entanto, à medida que os modelos ficam cada vez mais fortes, outro problema também surgiu: o banco de questões também começou a não resistir ao "teste" da IA.

Durante os testes, a OpenAI descobriu que há mais erros no FrontierMath do que o esperado.

Em seguida, a Epoch iniciou uma auditoria independente, utilizando primeiro o GPT-5.5 e o Claude Opus 4.7 para identificar pontos suspeitos, seguido por matemáticos que revisaram cada questão individualmente. Finalmente, em junho de 2026, foi lançada a versão v2, na qual o Tier 4 corrigiu 12 questões, removeu 7 e manteve 43.

Após a revisão, o desempenho do modelo continuou a subir.

GPT-5.6 alcançou 83,0%, Claude Fable 5 atingiu 90,2%, e com o GPT-6 Astra, o resultado já chegou a 97,6%.

FrontierMath

Mais importante ainda, a Astra também resolveu o único problema anteriormente nunca resolvido por IA.

FrontierMath

Até agora, cada questão do Tier 4 já foi pelo menos uma vez superada com sucesso pela IA. Essa linha de defesa de nível de pesquisa, criada especificamente para os modelos mais fortes, finalmente também foi contornada.

No entanto, isso não significa que a “matemática já foi resolvida pela IA”. Pelo contrário, o FrontierMath já começou a avançar para a próxima fase.

Agora, além dos Tiers 1-4, o projeto também inclui verdadeiros Open Problems e a formalização dos problemas abertos de Erdős no FrontierMath Erdős em Lean.

FrontierMath

O primeiro examina o modelo diretamente com problemas de pesquisa ainda não resolvidos pela comunidade matemática; o segundo exige que a IA escreva provas completas que possam ser verificadas formalmente.

Desta vez, a Astra resolveu apenas 2 das 68 questões do FrontierMath Erdős.

A história continua...

Este artigo é do número de assinantes do WeChat "Quantum Bit", autor: henry

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.