A OpenAI anunciou na quarta-feira que Paul Christiano, pesquisador de longa data sobre alinhamento de IA e riscos de perda de controle, juntou-se ao conselho da OpenAI Foundation e entrou no comitê de segurança e proteção responsável pela supervisão da liberação de modelos. Nesse momento, a empresa enfrenta novamente uma análise de seus processos de segurança devido a vários incidentes recentes nos quais agentes de IA ultrapassaram seus limites e acessaram sistemas externos.
Participar na revisão do lançamento do modelo
De acordo com a OpenAI, o comitê, liderado pelo professor da Universidade Carnegie Mellon, Z-token, tem a decisão final sobre o lançamento de novos modelos. A OpenAI implantou recentemente o novo modelo Astra, e eventos de segurança recentes aumentaram a atenção sobre as responsabilidades desse comitê.
Cristiano afirmou em declaração pública que, atualmente, acredita que o rápido avanço das capacidades da IA pode trazer, em um futuro próximo, riscos de perda de controle "catastróficos e irreversíveis". Ele afirmou que, atualmente, toda a indústria de IA, incluindo a OpenAI, não está no caminho certo para reduzir esses riscos a níveis aceitáveis.
Participou no desenvolvimento de métodos de treinamento fundamentais
Cristiano trabalhou na OpenAI e participou do avanço do aprendizado por reforço com feedback humano, um método que se tornou posteriormente uma importante abordagem para treinar modelos de linguagem de grande porte. Após deixar a OpenAI em 2021, ele fundou o Alignment Research Center para continuar pesquisando como determinar se modelos de IA representam uma ameaça ao controle humano.
Ele acredita que uma direção a ser monitorada é usar modelos de IA para treinar sistemas de IA da próxima geração. Isso pode acelerar ainda mais a velocidade de melhoria das capacidades, acabando por escapar ao controle dos desenvolvedores. Ele também aponta que, atualmente, agentes de IA impulsionados por aprendizado por reforço buscam recompensas mais altas, o que pode induzir os sistemas a enfraquecer o controle humano, buscar mais recursos e ocultar seus próprios comportamentos.
Ao mesmo tempo, mantenha o papel de consultor governamental
A report menciona que Cristiano tem colaborado com a agência de segurança de IA do governo dos EUA desde 2024. A agência posteriormente foi renomeada para o Centro de Padrões e Inovação em Inteligência Artificial e participou de trabalhos relacionados à avaliação de modelos de IA avançados antes de seu lançamento pelo governo dos EUA.
OpenAI afirmou que ele continuará a fornecer aconselhamento ao governo durante seu mandato como diretor, mas se abstiverá em questões relacionadas à OpenAI e à avaliação de modelos. No entanto, esse arranjo pode não eliminar as preocupações externas sobre a influência das empresas de IA na formulação de políticas.
Informação adicional: No dia anterior, o pesquisador da Anthropic Jacob Coxon renunciou e criticou publicamente as práticas de desenvolvimento de IA que considera irresponsáveis, indicando que os problemas de segurança dos modelos avançados estão se tornando um ponto de pressão comum para a indústria.
