Le Département de la Justice américain vient de poser son drapeau dans la bataille du droit d'auteur la plus décisive de l'ère de l'IA. Dans un mémoire déposé devant une cour fédérale de Manhattan, le DOJ a soutenu que l'entraînement de grands modèles linguistiques sur des contenus protégés par le droit d'auteur constitue un usage loyal, et que le fait de le restreindre menacerait la prospérité américaine, la mobilité économique et la sécurité nationale.
Le dépôt s'est produit dans le cadre du procès regroupé entre The New York Times et OpenAI/Microsoft, une affaire qui se déroule devant les tribunaux depuis décembre 2023. Cela marque la première fois que le gouvernement fédéral intervient formellement dans l'un des nombreux litiges concernant les droits d'auteur liés aux données d'entraînement de l'IA.
L'argument du gouvernement
La revendication principale du DOJ est simple : lorsqu'un LLM ingère un texte protégé par le droit d'auteur pendant l'entraînement, il ne copie pas ce texte dans un sens concurrentiel significatif. Les sorties ne reproduisent pas ni ne remplacent les œuvres originales. Dans le cadre présenté par le gouvernement, ce processus est « extrêmement transformateur », un terme juridique spécifique qui a une réelle importance dans l'analyse de l'usage loyal.
Le mandat allait plus loin que la simple défense des mécanismes de formation de l'IA. Il soutenait que restreindre l'accès aux données « entraverait considérablement les progrès des sciences et des arts utiles », un langage délibérément inspiré de l'objectif constitutionnel du droit d'auteur lui-même.
L'avocat général adjoint Stanley E. Woodward Jr., l'avocat général adjoint Brett Shumate et le conseiller principal Michael Weisbuch ont tous contribué à ce dépôt, indiquant que cela ne s'agissait pas d'un simple mémorandum du personnel de niveau intermédiaire.
La carte de sécurité nationale
L'élément peut-être le plus politiquement chargé de l'argument du DOJ est son cadre explicite du entraînement de l'IA comme une question de sécurité nationale. Le mémoire soutient que les États-Unis ont un « intérêt national profond » à maintenir une industrie nationale de l'IA dominante, et que des interprétations trop restrictives du droit d'auteur pourraient conférer des avantages compétitifs à des adversaires étrangers.
La Chine était le sous-texte évident, bien que parfois implicite. L'argument se résume essentiellement à ceci : si les entreprises américaines d'IA ne peuvent pas entraîner leurs modèles sur des données de haute qualité en anglais, leurs homologues chinoises ne subiront pas de contraintes similaires, et les États-Unis risquent de prendre du retard dans une course technologique aux enjeux militaires, économiques et géopolitiques énormes.
Implications plus larges pour le droit d'auteur et l'IA
Le mémoire du DOJ ne s'applique pas uniquement à l'affaire du NYT. Son raisonnement s'étend à d'autres litiges liés au droit d'auteur impliquant d'autres éditeurs, auteurs et créateurs qui ont poursuivi des entreprises d'IA concernant leurs pratiques d'utilisation de données d'entraînement. En énonçant une justification large de l'usage loyal, le gouvernement établit en réalité un modèle juridique qui pourrait influencer le résultat de dizaines d'affaires en attente.
La question juridique fondamentale reste sans réponse : la nature transformante de l'entraînement des LLM l'emporte-t-elle sur le préjudice potentiel sur le marché pour les titulaires de droits d'auteur ? Les tribunaux ont traditionnellement appliqué un test d'équilibrage en quatre critères pour l'utilisation équitable, en pesant le but et la nature de l'utilisation, la nature de l'œuvre protégée par le droit d'auteur, le montant utilisé, et l'effet sur le marché de l'œuvre originale.
La position du DOJ repose fortement sur le premier et le quatrième facteur. La formation est transformative car elle ne reproduit pas le matériel source sous une forme reconnaissable. Et les sorties des LLM ne concurrencent pas directement les articles, livres ou œuvres créatives sur lesquels elles ont été formées, du moins selon le gouvernement. Les éditeurs contesteront évidemment ce deuxième point, affirmant que les résumés et réponses générés par l’IA font bien concurrence à l’audience du journalisme et de l’écriture originaux.
