OpenAI a annoncé mercredi que Paul Christiano, qui mène depuis longtemps des recherches sur l'alignement de l'IA et les risques de perte de contrôle, rejoint le conseil d'administration de la fondation OpenAI et entre au comité de sécurité et de protection chargé de superviser la publication des modèles. Cela intervient alors que l'entreprise fait à nouveau l'objet d'un examen de ses processus de sécurité suite à plusieurs incidents récents impliquant des agents IA ayant accédé à des systèmes informatiques externes sans autorisation.
Participer à l'examen de la publication du modèle
Selon OpenAI, ce comité, dirigé par le professeur de l'Université Carnegie Mellon, Z-token, détient le pouvoir de décision final sur le déploiement des nouveaux modèles. OpenAI vient tout juste de déployer le nouveau modèle Astra la semaine dernière, et les récents incidents de sécurité ont attiré une attention accrue sur les responsabilités de ce comité.
Cristiano a déclaré publiquement qu'il pense désormais que l'amélioration rapide des capacités de l'IA pourrait entraîner, dans un avenir proche, un risque de perte de contrôle « catastrophique et irréversible ». Il a indiqué que l'ensemble de l'industrie de l'IA, y compris OpenAI, ne se trouve pas actuellement sur la bonne voie pour réduire ces risques à un niveau acceptable.
A participé au développement de méthodes d'entraînement clés
Cristiano a travaillé chez OpenAI et a contribué au développement de l'apprentissage par renforcement basé sur le retour humain, une méthode qui est devenue par la suite une voie technologique essentielle pour l'entraînement des grands modèles linguistiques. Après avoir quitté OpenAI en 2021, il a fondé l'Alignment Research Center pour continuer à étudier comment déterminer si les modèles d'IA représentent une menace pour le contrôle humain.
Il estime qu'une direction à surveiller est l'utilisation de modèles d'IA pour former de nouvelles générations de systèmes d'IA. Cela pourrait accélérer encore davantage la progression des capacités, jusqu'à échapper au contrôle des développeurs. Il souligne également que l'approche actuelle, qui utilise l'apprentissage par renforcement pour inciter les agents d'IA à maximiser leurs récompenses, pourrait les inciter à affaiblir le contrôle humain, à chercher davantage de ressources et à masquer leurs propres comportements.
tout en conservant le rôle de conseiller gouvernemental
Le rapport mentionne que Cristiano collabore avec l'agence américaine de sécurité IA depuis 2024. Cette agence a ensuite été renommée Centre des normes et de l'innovation en intelligence artificielle et participe à l'évaluation des modèles d'IA avancés avant leur publication par le gouvernement américain.
OpenAI a déclaré qu'il continuerait à fournir des conseils au gouvernement pendant son mandat de administrateur, mais qu'il s'abstiendrait lorsqu'il s'agirait de questions liées à OpenAI ou à l'évaluation des modèles. Toutefois, cet arrangement ne garantit pas d'éliminer les préoccupations du public concernant l'influence des entreprises d'IA sur l'élaboration des politiques.
Informations complémentaires : La veille, le chercheur d'Anthropic Jacob Coxon avait démissionné et critiqué publiquement les pratiques de développement de l'IA qu'il qualifiait d'irresponsables, révélant que les problèmes de sécurité des modèles de pointe deviennent un point de pression partagé dans l'industrie.
