O mais recente modelo de raciocínio da OpenAI, o GPT-6 Astra, foi lançado em 3 de setembro com uma pontuação de 97,6% no FrontierMath Tier 4 (v2). Esse é o tipo de número que faz você olhar duas vezes, especialmente quando descobre que uma versão interna anterior do modelo mal conseguia atingir 17% nas avaliações de capacidade matemática.
A trajetória de 17% para 47% internamente, e depois para quase perfeição nos benchmarks públicos, comprime o que normalmente pareceria anos de progresso em um único ciclo de desenvolvimento.
O blitz de referência
No ARC-AGI-3, medido no próprio sistema de avaliação da OpenAI, a Astra obteve uma pontuação de 99,9%. No ExploitBench, alcançou uma pontuação perfeita de 100%. O GPQA Diamond, um benchmark de raciocínio científico de nível de pós-graduação, obteve 96,0%. O Terminal-Bench Science 0.1 resultou em uma pontuação de 64,6%.
O resultado do FrontierMath Nível 4 (v2) é o número principal. O GPT-5.6 Sol, predecessor da Astra, obteve 83,0% no mesmo benchmark. Os 97,6% da Astra representam uma melhoria de 14,6 pontos percentuais.
De 17% para classe mundial
Versões iniciais do modelo que se tornaria Astra gerenciavam aproximadamente 17% nas avaliações de capacidade matemática. Por meio de melhorias iterativas, esse valor subiu para cerca de 47% antes do modelo ser aprimorado ainda mais para seu lançamento público.
A OpenAI também creditou a Astra por contribuir com novas perspectivas sobre lacunas primas, uma área notoriamente difícil da teoria dos números que tem ocupado matemáticos humanos por séculos.
Quem tem acesso e quando
O lançamento da Astra seguiu uma abordagem em estágios. Organizações selecionadas tiveram acesso no dia do lançamento, com disponibilidade ampliada para assinantes do ChatGPT Plus, Pro, Business e Enterprise pouco depois. O acesso à API está disponível diretamente pela OpenAI, bem como através do Azure e do AWS Bedrock.
O cenário competitivo
Avaliações independentes colocaram a Astra entre os modelos de IA de melhor desempenho atualmente disponíveis, embora algumas avaliações indiquem que certas variantes do Claude da Anthropic superem-na em testes de inteligência mais abrangentes.
Passar de 83,0% para 97,6% no FrontierMath em uma geração de modelo sugere que o limite para o raciocínio matemático da IA, se houver algum, ainda não foi atingido.
