Nova raciocínio recursivo da OpenAI gera preocupações com a segurança da IA

icon币界网
Compartilhar
AI summary iconResumo
Fontes de notícias de IA e criptomoedas relatam que o novo modelo Astra da OpenAI usará profundidade recursiva para ocultar etapas de raciocínio. Buck Shlegeris e Zvi Mowshowitz da Redwood alertam que isso pode reduzir a transparência do modelo. A OpenAI afirma que ainda suporta logs de cadeia de pensamento legíveis. The Information observa que Anthropic e DeepMind também estão testando métodos semelhantes. Novas listagens de tokens em exchanges principais ainda não refletem esse desenvolvimento.
Relatório do CoinWorld:

De acordo com o TechCrunch, citando o The Information, o próximo modelo Astra da OpenAI utilizará uma técnica de inferência chamada "recursive depth". Esse método pode reduzir as marcas visíveis durante o processo de inferência do modelo, dificultando para terceiros determinar por que o modelo chegou a uma determinada conclusão por meio de registros de cadeias de pensamento.

Pesquisadores de segurança emitiram um aviso

Nos modelos de raciocínio comuns, a cadeia de pensamento geralmente apresenta passo a passo como o modelo processa a questão. Embora esse registro não seja equivalente a todo o processo interno real do modelo, ainda é uma ferramenta importante para observar desvios do objetivo, decisões anômalas ou comportamentos potencialmente fora de controle.

Buck Shlegeris, CEO da Redwood Research, expressou "grande preocupação" com o uso desse tipo de tecnologia pela Astra. Ele acredita que, se a OpenAI ampliar ainda mais o uso desses métodos, a monitorabilidade da cadeia de pensamento do modelo pode diminuir significativamente.

O comentarista Zvi Mowshowitz, que acompanha há muito tempo a segurança da IA, também afirmou que, se os laboratórios competirem em torno da capacidade dos modelos, os reguladores podem precisar intervir no futuro para evitar que a indústria continue a reduzir seus padrões de segurança.

Redução de rastros visíveis por raciocínio cíclico

O relatório menciona que o chamado "recursão opaca" refere-se ao modelo não realizar mais o raciocínio principalmente por etapas lineares, mas sim processar ciclicamente a mesma questão. Isso pode reduzir os processos intermediários que podem ser lidos externamente, equivalendo a contornar a trajetória visível fornecida pelo registro tradicional da cadeia de pensamento.

Essa é também a parte que mais preocupa os pesquisadores de segurança. Uma vez que os modelos realizem cada vez mais raciocínios em espaços internos invisíveis, torna-se mais difícil para os pesquisadores determinar se eles estão gerando informações enganosas, contornando restrições ou exibindo outros comportamentos inesperados.

O cientista-chefe da Redwood Research, Ryan Greenblatt, afirmou que o maior risco é que esse tipo de raciocínio opaco possa ser mais facilmente escalável do que o raciocínio tradicional em cadeia de pensamento, acabando por afastar a maior parte do processo de raciocínio dos canais visíveis.

OpenAI enfatiza a manutenção da capacidade de monitoramento

No entanto, atualmente, o uso da tecnologia pela Astra é considerado ainda limitado. O relatório indica que a cadeia de pensamento do modelo ainda deve ser legível, e a OpenAI se opõe à descrição externa de uma transição para um “neural jargon” totalmente ininteligível.

O cientista-chefe da OpenAI, Jakub Pachocki, disse no X que a empresa tem se esforçado desde os primeiros modelos de raciocínio para preservar e aproveitar a capacidade de monitoramento da cadeia de pensamento, que é um dos principais objetivos do plano de pesquisa atual.

É importante notar que nem apenas a OpenAI está explorando essa direção. Relatos posteriores da The Information indicam que a Anthropic e a Google DeepMind também já estão discutindo tecnologias semelhantes. Isso significa que o equilíbrio entre o aprimoramento da capacidade dos modelos e a segurança passível de auditoria pode se tornar em breve uma questão comum mais ampla na indústria de IA.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.