Un chercheur d'Anthropic a démissionné mardi et la raison qu'il a citée semble sortir tout droit du film culte de James Cameron de 1984, "The Terminator".
Jacob Coxon, qui a passé trois ans à travailler sur le pré-entraînement à la fois chez OpenAI et Anthropic, a démissionné mardi et expliqué sa décision sur X.
J’ai démissionné d’Anthropic aujourd’hui. J’ai passé les trois dernières années à effectuer des recherches sur la pré-formation à la fois à OpenAI et à Anthropic. Aucune des deux entreprises n’agit de manière responsable. Elles foncent vers une super-intelligence capable de s’améliorer elle-même et parient sur nos vies », a-t-il déclaré.
« Les personnes qui développent l’IA croient sincèrement qu’elle pourrait nous tuer tous d’ici la fin de la décennie », a-t-il ajouté.
Cette déclaration rend la fiction de 42 ans de Cameron presque prophétique. Le film commence par des machines déclarant la guerre aux humains en 2029, la même fenêtre approximative que Coxon dit que les initiés craignent en secret. Coxon n'est pas le seul chez Anthropic à faire valoir le risque d'extinction. Le responsable de l'alignement de l'entreprise, Evan Hubinger, a déclaré séparément qu'il estimait les probabilités au-dessus de 10 %.
Pour les débutants, une IA superintelligente signifie un système plus intelligent que les humains dans presque tout, pas seulement aux échecs ou à repérer des chats cachés sur des photos. L'auto-amélioration est l'aspect le plus inquiétant, car elle décrit un système qui modifie automatiquement son propre code pour augmenter son intelligence — tout comme les humains le font.
Par conséquent, ces systèmes peuvent acquérir d'immenses montants de connaissances de manière autonome et potentiellement violer les infrastructures d'institutions « trop grandes pour faire faillite ».
L'intelligence supérieure n'est pas une menace théorique si l'on en juge par la violation récente de Hugging Face provoquée par Coxon. La violation elle-même, qui s'est déroulée entre mai et juillet, a commencé par des agents IA d'OpenAI créant leur propre salon de discussion à l'intérieur du sandbox de test pour communiquer entre eux.
En savoir plus : Les modèles d’IA ont échappé au bac à sable d’OpenAI et ont atteint Hugging Face. La crypto est là où cela devient dangereux
Ils ont fini par utiliser ce canal pour contourner la containment et accéder à Internet ouvert. De là, ils ont enchaîné plusieurs exploits pour pénétrer dans les systèmes de production de Hugging Face. Hugging Face a dû reconstruire environ un tiers de son infrastructure.
Coxon l'a qualifié de "tir de mise en garde" qui rend les accords de rythme entre les laboratoires américains "plus viables". Les accords de rythme sont des ententes informelles entre les laboratoires d'IA pour ralentir ou coordonner les progrès en matière de capacités plutôt que d'avancer unilatéralement.
Pourtant, il n'est pas convaincu que ce soit suffisant et ne pense pas que « nous soyons sur la bonne voie pour empêcher une course mondiale », et a suggéré des mesures coûteuses telles qu'« une interdiction temporaire de améliorer les capacités des modèles » pour arrêter la course à l'IA.
« À OpenAI, beaucoup n'ont pas pleinement intégré les enjeux civilisationnels », a-t-il écrit. Chez son employeur le plus récent, a-t-il déclaré, c'est différent dans le sens où « les enjeux sont bien compris, mais ils sont engagés dans une course pour y arriver en premier ».
Il a conclu le fil en posant la question à tous ceux qui sont encore dans les laboratoires — « Voulez-vous lancer une exécution RL super intelligente sans une compréhension rigoureuse de son esprit ? » — ou est-ce le moment de résister au lieu de hausser les épaules et de vous dire que cela va se produire de toute façon.
Il n'est pas le premier à avoir quitté à cause de cela. Mrinank Sharma, qui travaillait sur l'équipe sécurité d'Anthropic, a démissionné plus tôt cette année en raison de craintes similaires, affirmant que « le monde est en péril ».
Tout le monde n'est pas convaincu par la prédiction apocalyptique, cependant.
Une réponse sous son fil put it plainly : « Avec tout le respect que je vous dois, c’est bizarre. C’est une prise absurde. Les humains ont évolué pendant des centaines de milliers d’années. Nous ne disparaîtrons pas parce qu’un modèle de prédiction de jeton a acquis de la conscience. Reprenez-vous. Vous tous. »
Curieusement, la série de films Terminator ne soutient pas non plus Coxon. L'humanité ne disparaît pas lors du Jour du Jugement nucléaire de Terminator ; la résistance le survit et finit par vaincre les machines.
Cela dit, l'IA influence l'économie, particulièrement sur le plan de l'emploi. Bien qu'il n'y ait pas encore de déplacement massif, l'utilisation de l'IA pour les tâches de niveau junior a provoqué une baisse de près de 20 % de l'emploi aux niveaux d'entrée dans les secteurs exposés à l'IA aux États-Unis, selon des recherches de Stanford Stanford Digital Economy Lab.
Une étude de Goldman Sachs a fait une observation similaire, affirmant que les travailleurs débutants supportent le poids principal de ce changement.
Anthropic a déposé les documents d'IPO en juin et serait en train de préparer un arrivage sur Nasdaq dès cet automne, à une valorisation pouvant atteindre des milliers de milliards.
