Em 1º de setembro, a OpenAI declarou que o Astra, ainda não lançado, atingiu o limiar de segurança cibernética "crítico" no seu "framework de prontidão". É a primeira vez que a OpenAI classifica um modelo nesse nível, o que implica restrições de segurança mais rigorosas durante seu desenvolvimento e antes do lançamento.
Primeiro acesso ao nível crítico
De acordo com a definição da OpenAI, se um modelo conseguir descobrir independentemente vulnerabilidades desconhecidas em sistemas reais após reforço e construir cadeias de ataque funcionais, ou realizar ataques de rede completos contra alvos de alta dificuldade com base apenas em objetivos de alto nível, será classificado como "crítico". Anteriormente, modelos como o GPT-5.6 Sol atingiam no máximo a categoria de "alto risco".
Dois vulnerabilidades zero-day foram descobertas durante os testes
No teste ExploitBench, a Astra alcançou uma taxa de aprovação de 100%. Este teste avalia principalmente a capacidade do modelo de transformar vulnerabilidades de software conhecidas em código de exploração executável.
Para eliminar o impacto de bancos de questões memorizadas, a OpenAI selecionou internamente 20 vulnerabilidades críticas do mecanismo JavaScript Google V8 divulgadas entre junho e agosto deste ano para teste. A OpenAI afirmou que o Astra superou o GPT-5.6 Sol em taxa de sucesso na execução de código arbitrário, utilizando menos tokens de saída. Durante os testes, o Astra também descobriu e encadeou dois zero-days previamente desconhecidos, e os problemas relacionados ainda estão sendo divulgados às partes responsáveis afetadas.
Inicialmente aberto a um pequeno grupo de testadores
Em um teste mais próximo da realidade, a Astra construiu uma cadeia de invasão completa usando um navegador reforçado e um sistema operacional reforçado. A OpenAI afirmou que o modelo conseguiu escapar do sandbox do navegador e executar comandos no host anfitrião apenas induzindo o alvo a abrir um arquivo HTML malicioso. Em outro teste, ele também encadeou várias falhas do sistema para criar um caminho de elevação de privilégios, permitindo que uma conta de usuário comum obtivesse permissões root.
A OpenAI afirmou que, em testes internos, a taxa de recusa da Astra em relação a prompts de jailbreak de segurança cibernética atingiu 91,5%, superando os 59% do GPT-5.6 Sol. Sua capacidade mais forte de segurança cibernética será inicialmente disponibilizada a um pequeno número de testadores alpha e, em seguida, ampliada gradualmente por meio do projeto Daybreak Blue, com foco principal em trabalhos de segurança defensiva.
Informação adicional: Este aviso é divulgado no mesmo dia em que a Anthropic lança o Fable 5.1 e o Mythos 5.1, sendo que o Mythos 5.1 continua acessível apenas a instituições de cibersegurança e ciências da vida aprovadas. A OpenAI ainda não divulgou a data oficial de lançamento do Astra.
