De acordo com o TechCrunch, citando o The Information, o próximo modelo Astra da OpenAI utilizará uma técnica de inferência chamada "recursive depth". Esse método pode reduzir as marcas visíveis durante o processo de inferência do modelo, dificultando para terceiros determinar por que o modelo chegou a uma determinada conclusão por meio de registros de cadeias de pensamento.
Pesquisadores de segurança emitiram um aviso
Nos modelos de raciocínio comuns, a cadeia de pensamento geralmente apresenta passo a passo como o modelo processa a questão. Embora esse registro não seja equivalente a todo o processo interno real do modelo, ainda é uma ferramenta importante para observar desvios do objetivo, decisões anômalas ou comportamentos potencialmente fora de controle.
Buck Shlegeris, CEO da Redwood Research, expressou "grande preocupação" com o uso desse tipo de tecnologia pela Astra. Ele acredita que, se a OpenAI ampliar ainda mais o uso desses métodos, a monitorabilidade da cadeia de pensamento do modelo pode diminuir significativamente.
O comentarista Zvi Mowshowitz, que acompanha há muito tempo a segurança da IA, também afirmou que, se os laboratórios competirem em torno da capacidade dos modelos, os reguladores podem precisar intervir no futuro para evitar que a indústria continue a reduzir seus padrões de segurança.
Redução de rastros visíveis por raciocínio cíclico
O relatório menciona que o chamado "recursão opaca" refere-se ao modelo não realizar mais o raciocínio principalmente por etapas lineares, mas sim processar ciclicamente a mesma questão. Isso pode reduzir os processos intermediários que podem ser lidos externamente, equivalendo a contornar a trajetória visível fornecida pelo registro tradicional da cadeia de pensamento.
Essa é também a parte que mais preocupa os pesquisadores de segurança. Uma vez que os modelos realizem cada vez mais raciocínios em espaços internos invisíveis, torna-se mais difícil para os pesquisadores determinar se eles estão gerando informações enganosas, contornando restrições ou exibindo outros comportamentos inesperados.
O cientista-chefe da Redwood Research, Ryan Greenblatt, afirmou que o maior risco é que esse tipo de raciocínio opaco possa ser mais facilmente escalável do que o raciocínio tradicional em cadeia de pensamento, acabando por afastar a maior parte do processo de raciocínio dos canais visíveis.
OpenAI enfatiza a manutenção da capacidade de monitoramento
No entanto, atualmente, o uso da tecnologia pela Astra é considerado ainda limitado. O relatório indica que a cadeia de pensamento do modelo ainda deve ser legível, e a OpenAI se opõe à descrição externa de uma transição para um “neural jargon” totalmente ininteligível.
O cientista-chefe da OpenAI, Jakub Pachocki, disse no X que a empresa tem se esforçado desde os primeiros modelos de raciocínio para preservar e aproveitar a capacidade de monitoramento da cadeia de pensamento, que é um dos principais objetivos do plano de pesquisa atual.
É importante notar que nem apenas a OpenAI está explorando essa direção. Relatos posteriores da The Information indicam que a Anthropic e a Google DeepMind também já estão discutindo tecnologias semelhantes. Isso significa que o equilíbrio entre o aprimoramento da capacidade dos modelos e a segurança passível de auditoria pode se tornar em breve uma questão comum mais ampla na indústria de IA.
