Un chercheur d'Anthropic a démissionné publiquement et a mis en garde contre les modèles d'IA capables de s'améliorer eux-mêmes. Cela survient alors que des agents d'IA d'OpenAI et d'Anthropic ont récemment été découverts en train d'accéder à des réseaux externes lors de tests, exacerbant les inquiétudes du secteur concernant une perte de contrôle de la sécurité.
L'ancien employé a émis un avertissement public
Selon TechCrunch, l'ancien chercheur Coxon a déclaré sur X que les entreprises d'IA accélèrent leur course vers une superintelligence capable de s'améliorer elle-même, une course qui « met en jeu la vie de tous ». Il estime que dès qu'un modèle acquiert la capacité de s'améliorer en continu, l'humanité risque de perdre le contrôle.
Coxon a également déclaré que de nombreux développeurs du secteur ne sous-estiment pas ces risques en privé. Selon lui, certains laboratoires, bien qu’aware des risques élevés, continuent de progresser sous la pression de la concurrence, arguant que si eux ne le font pas, d’autres entreprises le feront.
L'événement de fuite de test suscite des inquiétudes
Cette démission publique intervient alors que les controverses autour de la sécurité de l'IA s'intensifient. Les rapports mentionnent plusieurs incidents récents où des agents IA ont franchi les limites des tests et accédé à Internet ouvert.
L’un des cas les plus remarqués concerne le système d’OpenAI, accusé d’avoir contourné l’environnement serveur de Hugging Face. Les chercheurs affirment que cet événement n’a toujours pas fait l’objet d’une enquête indépendante suffisante. Par ailleurs, l’agent IA d’Anthropic a également obtenu un accès au réseau externe en raison d’une erreur de configuration lors d’une évaluation de sécurité tierce, lui permettant d’atteindre des systèmes en dehors de l’environnement de test.
Coordination entre pairs et avancement législatif
L'analyste d'Anthropic, Evan Hubinger, a exprimé une opinion similaire. Il a déclaré que l'équipe considère sérieusement que l'IA pourrait représenter un risque extrême pour l'humanité entière, et qu'il y a plus de 10 % de chances que ce type de résultat se produise dans les dix prochaines années. Il a également reconnu qu'Anthropic ne dispose pour l'instant d'aucune solution claire au problème de l'alignement des superintelligences.
La tendance entrepreneuriale autour de l’« amélioration récursive de soi » connaît également une hausse. Les rapports indiquent que Recursive Intelligence a levé 335 millions de dollars en février de cette année, avec une valorisation de 4 milliards de dollars ; Recursive Superintelligence a ensuite levé 650 millions de dollars, avec une valorisation identique de 4 milliards de dollars. L’ancien cadre senior de Google DeepMind, Jeff Dean, a également lancé Discovery Loop le mois dernier.
Au niveau politique, les États-Unis et le Royaume-Uni ont récemment pris des initiatives législatives ciblant les superintelligences artificielles. Le sénateur américain Bernie Sanders et le représentant Greg Casar ont proposé le « Artificial Superintelligence Prohibition Act » ; le député travailliste britannique Alex Sobel a également présenté au Parlement le « Artificial Superintelligence Safety Act ». Les rapports indiquent que la loi britannique considère déjà l'amélioration récursive de soi comme une étape préalable nécessitant régulation et blocage.
