Il y a deux mois, les organismes d'évaluation indépendants se trouvaient dans un coin relativement calme de l'industrie de l'intelligence artificielle à mille milliards de dollars. Aujourd'hui, on leur demande de « venir à la rescousse ».
Alors qu'Anthropic et OpenAI débattent violemment de la manière de continuer à développer leurs activités tout en garantissant la sécurité de leurs modèles avancés, ces deux entreprises cherchent le soutien de quelques petites institutions tierces, telles que Model Evaluation and Threat Research (METR), Apollo Research et Transluce.
La plupart de ces organismes d'évaluation fonctionnent sous forme d'organisations à but non lucratif et cherchent encore à définir leur rôle dans un secteur où les capitaux affluent à un rythme sans précédent et où de nouveaux modèles émergent avec une fréquence inédite. Leur mission principale consiste à évaluer les capacités et les risques des modèles d'IA, ainsi qu'à identifier les cas de comportements inappropriés de la technologie.
En l'absence d'avancées réglementaires au niveau fédéral, l'importance des organismes d'évaluation est amplifiée. Dario Amodei, PDG d'Anthropic, a promis le mois dernier d'intégrer des organismes d'évaluation indépendants au sein de l'entreprise, et Sam Altman, PDG d'OpenAI, a rapidement exprimé son soutien. Le président américain Donald Trump soutient également cette idée, tout comme de nombreuses grandes entreprises technologiques américaines. Mais des questions restent en suspens : comment ces tiers devraient-ils être financés, quel niveau d'accès leur sera accordé, et quelle sera la structure finale de rendu des comptes ?
Le professeur d'informatique à l'Université Brown, Suresh Venkatasubramanian, a déclaré lors d'un entretien avec CNBC : « Le problème est, d'une certaine manière, toujours le même : l'argent. Qui paiera pour que ces entreprises effectuent ce travail ? Comment soutiendront-elles ces institutions ? Vous avez besoin d'un écosystème, vous avez besoin d'un modèle économique viable. »
Actuellement, Anthropic, OpenAI et les partenaires d'infrastructure ayant profité de la vague d'IA établissent les règles. Les critiques affirment que c'est comme laisser les plus grandes banques nous protéger contre une crise financière, ou permettre aux entreprises pharmaceutiques de mettre des médicaments sur le marché sans autorisation réglementaire.
Trump a récemment félicité les dirigeants de l'IA pour leur « auto-régulation extrêmement efficace » et a déclaré qu'il comptait laisser l'industrie se gérer elle-même, ne voulant pas entraver un secteur qui stimule la croissance économique et boursière. À la fin septembre, Trump a encouragé les entreprises d'IA à « collaborer avec des auditeurs ou évaluateurs externes indépendants » dans le cadre d'un accord volontaire.
Cette discussion a été déclenchée par un article largement diffusé d'Amodei publié le mois dernier. Dans cet article, il a appelé à ralentir le développement des modèles avancés, car certains chercheurs avaient quitté leur entreprise et exprimé des préoccupations quant aux menaces existentielles potentielles de cette technologie.
Des frictions sont apparues à mesure que les laboratoires d'IA commencent à déployer des organismes d'évaluation.
Un porte-parole d'OpenAI a déclaré que l'entreprise avait licencié trois employés la semaine dernière pour « violation de nos politiques concernant l'accès et le traitement des informations sensibles de l'entreprise ». Deux des employés, Mikita Balesni et Tomek Korbak, ont déclaré qu'ils pensaient avoir été licenciés en raison de la manière dont ils avaient communiqué avec des évaluateurs tiers.
Balesni a écrit jeudi sur X : « Mes anciens collègues m'ont dit qu'ils étaient confus quant à ce qu'ils devaient croire. Ils ont aussi peur de s'exprimer, craignant que leurs téléphones personnels ne soient perquisitionnés en raison de leurs échanges avec nous et des tiers. Je crains que cette peur généralisée de s'exprimer et cette préoccupation concernant les contacts avec les tiers n'incitent OpenAI à réduire les coûts sur les questions de sécurité en coulisses. »
OpenAI a démenti cette affirmation et a déclaré vendredi dans un message que l'entreprise « négocie activement des contrats avec des évaluateurs de sécurité tiers et publiera les détails dans les semaines à venir ».
OpenAI a déclaré : « Nous nous engageons à intégrer des évaluateurs externes et à continuer de faire de la collaboration étroite avec des organisations de sécurité indépendantes un pilier central de notre travail sur la sécurité. »
Un porte-parole d'OpenAI a déclaré dans un courriel que les travaux que l'entreprise va entreprendre avec les organismes d'évaluation « s'appuient sur les collaborations existantes avec des organisations de sécurité indépendantes », notamment METR et Redwood Research.
Anthropic n'a pas répondu à la demande de commentaire de CNBC.
Je n'ai jamais vu un problème avancer aussi rapidement
L'écosystème d'organismes d'évaluation IA est principalement composé de petites organisations telles que METR et Apollo Research, ainsi que de grandes entreprises de comptabilité et d'audit comme Accenture.
Les laboratoires d'IA ont toujours collaboré avec des organismes d'évaluation dans des limites restreintes, mais Andrew Freedman, PDG de Fathom, une organisation à but non lucratif spécialisée dans les politiques, affirme que ce domaine évolue rapidement.
Freedman a déclaré lors d'un entretien avec CNBC : « J'ai travaillé dans le domaine politique et des politiques publiques pendant 20 ans, et je n'ai jamais vu un problème avancer aussi rapidement sur autant de points différents du spectre politique. » Il a indiqué qu'il s'attend à un « afflux massif de capitaux » dans cet écosystème.
Rayan Krishnan, PDG de l'organisme d'évaluation indépendant Vals AI, a déclaré que cette startup à but lucratif établit des repères pour mesurer les performances des modèles d'IA dans des tâches spécifiques à l'industrie ; son effectif est passé de 8 à environ 30 employés cette année, et elle a annoncé en août avoir levé 40 millions de dollars.
L'organisation à but non lucratif METR a annoncé en août avoir reçu environ 71 millions de dollars de promesses de financement au cours des six derniers mois. Selon les derniers documents soumis par l'organisation à l'Internal Revenue Service américain, ce chiffre dépasse le total des dons de 13,6 millions de dollars reçus en 2024.
D'ici la fin du mois, la notoriété de METR a encore augmenté. OpenAI a embauché deux employés et un sous-traitant de l'organisme pour aider à rédiger un rapport d'analyse post-incident détaillant comment les modèles de l'entreprise ont échappé au contrôle, accédé à Internet ouvert et contourné la plateforme de développeurs open source Hugging Face. METR a déclaré qu'elle n'a pas été rémunérée par OpenAI pour cette évaluation.
Kevin Werbach, directeur académique du Accountable AI Lab de la Wharton School de l'Université de Pennsylvanie, a déclaré que cet écosystème « n'est pas encore suffisamment solide ». Par exemple, le site METR indique que l'organisation compte moins de 50 employés à temps plein.
Le déséquilibre de pouvoir entre de petites agences d'évaluation et les laboratoires leaders ayant levé des centaines de milliards de dollars et employant des milliers de personnes soulève des questions sur les conflits d'intérêts potentiels.
Venkatasubramanian dit : « Si vous voulez une évaluation véritablement indépendante, vous avez besoin d'une véritable indépendance financière, ainsi que d'autres formes d'indépendance. Il ne s'agit pas seulement de ne pas accepter d'argent, mais aussi de se demander : si j'étais auditeur et que je publiais un rapport défavorable sur cette entreprise, y aurait-il des conséquences ? Mon activité en serait-elle ruinée ? »
Anthropic a reconnu cette complexité dans un article de blog le mois dernier. L'entreprise a annoncé qu'elle intégrerait des employés de Faculty, l'unité dédiée à l'IA d'Accenture, afin de tester les mesures de sécurité et d'évaluer si les modèles agissent conformément aux valeurs humaines. Anthropic a déclaré que, compte tenu de l'« importance et de l'urgence » de ce travail, elle financerait directement les contributions d'Accenture.
Anthropic déclare : « Il n'existe actuellement aucune norme concernant les informations auxquelles les évaluateurs intégrés devraient avoir accès ni la manière dont ils devraient rendre compte de leurs découvertes. Le financement des évaluations indépendantes n'est pas non plus établi. À long terme, nous estimons que le financement devrait provenir de fonds regroupés ou de sources publiques. »
Anthropic a également indiqué que l'entreprise discute avec METR et d'autres organismes d'évaluation à but non lucratif, qui prévoient d'utiliser leurs propres fonds pour tester certains « éléments » de l'évaluation intégrée.
Will the government intervene?
En juin de l'année dernière, Fathom a proposé un cadre de marché pour des organisations de vérification indépendantes (Independent Verification Organizations, IVO). Ces organismes obtiendront une autorisation gouvernementale et seront habilités à tester si les entreprises d'IA respectent diverses normes de sécurité.
Freedman a déclaré que la supervision gouvernementale est essentielle, sinon les organismes d'évaluation tiers pourraient dépendre financièrement des grands laboratoires d'IA, ce qui les inciterait à « commencer à approuver systématiquement » pour préserver ces relations.
Certains législateurs ont déjà exprimé leur soutien.
Les IVO sont une disposition clé de la loi FRONTIER (Frontier Risk Oversight, National Transparency, Independent Evaluation and Reporting), présentée en juillet par la représentante Lori Trahan (Démocrate du Massachusetts) et Jay Obernolte (Républicain de Californie). Freedman affirme que Fathom a aidé à rédiger le libellé de la loi et a fourni un soutien technique.
Chris Lehane, directeur des affaires mondiales d'OpenAI, a déclaré aux journalistes en septembre qu'il avait rencontré l'un des auteurs de la loi au Capitole pour exprimer son soutien aux dispositions de l'IVO.
Selon Lehane, « il est important pour eux d'entendre cela et de nous entendre dire cela, et nous souhaitons également le dire très clairement. »
Dans le même temps, des législateurs en Californie, au Connecticut et en Virginie ont pris des mesures pour promouvoir les IVO, tandis que des États comme le Massachusetts envisagent plus largement des évaluations de sécurité indépendantes.
Le gouverneur de Californie, Gavin Newsom, a récemment signé deux lois concernant les IVOs, dont l'une établit un « cadre inédit au niveau national » et l'autre crée un registre d'auditeurs d'IA au niveau de l'État. Anthropic a soutenu ces deux lois en août, et OpenAI les a officiellement endossées le mois dernier, le même jour où Newsom les a signées.
Lehane a écrit dans un article de blog à l'époque : « Nous préférons qu'une évaluation technique indépendante soit exigée au niveau fédéral », mais en l'absence d'action fédérale, « la Californie peut aider à établir les règles ».
Freedman a déclaré qu'il pensait que des entreprises comme OpenAI et Anthropic trouveraient « très difficile » de découvrir seules comment collaborer avec des organismes d'évaluation indépendants. Toutefois, dans un contexte où le rôle du gouvernement n'est pas encore clair, « il s'agit d'une compétence méritant d'être développée pendant la transition », a-t-il dit.
Actuellement, ce qui se rapproche le plus d'une norme dans l'industrie est un accord qualifié de « contraignant sur le plan moral » par Trump lors d'un déjeuner organisé fin mars au Palais blanc pour des dirigeants technologiques.
Ce protocole d'une page stipule que « chaque entreprise a la responsabilité de développer sa propre technologie de manière sécurisée et de la faire progresser d'une manière qui permet de construire la confiance des clients et du public ». Le protocole encourage également les signataires à collaborer avec « des auditeurs ou évaluateurs externes indépendants pour mener des évaluations indépendantes ».
Ce document a été signé par des cadres d'Anthropic, Google, Meta, OpenAI, SpaceX et Nvidia, représentant une rare démonstration d'unité parmi des dirigeants dont les opinions sur la gestion des risques liés à l'IA ne sont pas alignées. Toutefois, ces cadres doivent toujours tracer leur propre chemin à suivre.
Venkatasubramanian déclare : « C’est davantage une représentation visant à montrer des actions, alors qu'en réalité aucune action réelle n'a été entreprise. Ce qu'ils promettent de faire aurait dû déjà être accompli, et en fait, ils ont même prétendu par le passé qu'ils le faisaient déjà. »
Dans son article de septembre, Amodei a déclaré qu'Anthropic fournirait aux évaluateurs un bureau, une carte d'accès, un ordinateur portable d'entreprise et des droits « à peu près équivalents » à ceux de l'équipe interne d'évaluation des risques. En outre, les évaluateurs recevront un soutien contractuel leur accordant « le droit de publier des découvertes cruciales », tandis qu'Anthropic conserve une « capacité limitée » de supprimer ou de modifier certaines informations liées à la sécurité ou à la confidentialité.
Amodei a écrit : « C'est une étape inhabituelle pour une entreprise, mais nous pensons qu'il est important de démontrer le concept de réviseurs externes intégrés. »
Quelques jours plus tard, OpenAI a publié sa propre proposition, affirmant que les évaluateurs devraient travailler autour de « déclarations d'évaluation clairement définies et acceptées par les deux parties », en précisant clairement les méthodes et les critères, en démontrant une expertise technique pertinente et en divulguant tout conflit d'intérêts.
Le mois dernier, le AI Evaluator Forum, incluant METR, l’Institut de recherche en vérification et évaluation de l’IA (AVERI) et d’autres organisations, a publié une lettre ouverte intitulée « Conditions minimales pour les évaluateurs intégrés ».
La lettre affirme que les évaluateurs doivent être transparents, protégés contre les représailles et avoir accès aux mêmes niveaux de privilèges que les employés hautement privilégiés des entreprises d'IA.
La lettre ajoute également : « L'évaluation intégrée ne peut pas répondre à tous les besoins de supervision et doit être considérée comme un complément, et non un remplacement, des efforts plus larges visant à inciter les entreprises d'IA de pointe à renforcer la supervision externe. »
Freedman a déclaré que, ces derniers mois, il avait observé un changement d'attitude de la part d'OpenAI et d'Anthropic, principalement parce qu'elles ont réalisé qu'elles ne pouvaient pas lancer des systèmes avancés sans la confiance du public.
Freedman dit : « Je ne pense pas que vous deviez croire qu'ils sont soudainement devenus altruistes, ou qu'il y ait quelque chose d'autre que l'entreprise agisse comme une entreprise. »
Werbach affirme que cela met peut-être en lumière la question fondamentale. OpenAI et Anthropic se concurrencent d'abord entre eux, tout en avançant vers une introduction en bourse et en visant une évaluation dépassant 1 000 milliards de dollars.
Werbach a déclaré : « Il existe une grande méfiance personnelle entre ces deux entreprises. Toutefois, il existe également un large consensus sur la nécessité de mener ce type d'évaluation. »
REGARDEZ : Bradley Tusk sur le IPO d'Anthropic : Pourquoi ajouter une pression du marché public si la sécurité est votre priorité absolue ?
