Ang US Department of Justice ay naglagay ng kanyang watawat sa pinakamahalagang labanan sa karapatan sa may-akda ng panahon ng AI. Sa isang brief na isinumite sa federal court sa Manhattan, ang DOJ ay nag-argumen na ang pag-train sa mga malalaking language model gamit ang mga materyal na may karapatan sa may-akda ay kabilang sa fair use, at na ang pagpapahigpit dito ay magbubulag sa pag-unlad ng Amerika, ekonomikong paggalaw, at pambansang kaligtasan.
Nakarehistro ang pagkakasunod sa pinagsamang kaso sa pagitan ng The New York Times at OpenAI/Microsoft, isang kaso na patuloy na sinusuri ng mga korte simula noong Disyembre 2023. Ito ang unang pagkakataon na pormal na sumali ang pederal na pamahalaan sa anumang malawak na kaso ng paglabag sa karapatang-ari tungkol sa data para sa pagtuturo ng AI.
Ang argumento ng gobyerno
Ang pangunahang hahamon ng DOJ ay simpleng: kapag binabasa ng isang LLM ang mga may-akdang may karapatan sa pagmamay-ari habang tinuturuan, hindi ito kopya ang teksto sa anumang makabuluhang kompetitibong paraan. Ang mga output ay hindi nagpapakita o nagpapalit sa orihinal na mga gawa. Ayon sa pananaw ng gobyerno, ang prosesong ito ay “nagkakaroon ng napakalaking pagbabago,” isang legal na termino na may malaking timbang sa pagsusuri ng fair use.
Lumipas pa ang brief sa pagtatanggol lamang ng mekanismo ng pagtatrain ng AI. Ipinaglaban nito na ang pagpapahintulot sa pag-access sa data ay “makakasagabal sa malaking pag-unlad ng agham at kapaki-pakinabang na sining,” isang wika na sinadyang tumutugma sa layunin ng konstitusyon sa batas ng karapatang-ari.
Ang Associate Attorney General Stanley E. Woodward Jr., ang Assistant Attorney General Brett Shumate, at ang senior counsel Michael Weisbuch ay lahat ay nakatulong sa pagpapasa, na nagpapakita na ito ay hindi ilang memo ng mid-level staff.
Ang pambansang card ng seguridad
Maaaring ang pinakamapapalitan na elemento ng argumento ng DOJ ay ang pagsasalaysay nito na ang pagtuturo ng AI ay isang isyu ng pambansang kaligtasan. Ang brief ay naglalayong ipakita na mayroon ang United States na “malalim na pambansang interes” sa pagpapanatili ng dominanteng lokal na industriya ng AI, at na ang sobrang pagiging limitado sa pagpapahalaga sa karapatan sa pagkakaroon ay maaaring magbigay ng kompetitibong kalamangan sa mga dayuhang kalaban.
Ang China ay ang malinaw, kahit minsan hindi inaapela, na pangunahing mensahe. Ang argumento ay nababawas sa sumusunod: kung ang mga American AI company ay hindi makakapag-train gamit ang mataas na kalidad na data sa wikang Ingles, ang kanilang mga katumbas sa China ay hindi magkakaroon ng katulad na pagkakabawas, at ang US ay mababayaan sa isang teknolohiyang paligsahan na may malaking militar, ekonomiko, at geopolitikal na antas.
Mas malawak na epekto sa karapatan sa pagkakaroon at AI
Hindi lamang ang kaso ng NYT ang napapailalim sa maikling pahayag ng DOJ. Ang pag-iisip nito ay umiikot sa mga kaugnay na pagkakasala sa karapatan sa may-akda na kasangkot sa iba pang mga tagapaglalabas, may-akda, at mga gumagawa na nag-file ng kaso laban sa mga kumpanya ng AI tungkol sa mga praktika sa pag-train ng data. Sa pagpapaliwanag ng isang malawak na rasyonal sa fair use, ang gobyerno ay direktang nagtatatag ng isang legal na template na maaaring mag-apekto sa resulta ng dozens ng naka-antay na kaso.
Ang pangunahing legal na tanong ay patuloy na hindi nalulutas: nakakapagpapalit ba ng kalikasan ng LLM training ang potensyal na pinsalang dulot sa mga may-ari ng karapatang-ari? Ang mga hukuman ay tradisyonal na gumagamit ng isang pagsusuri na may apat na salik para sa fair use, kung saan binabawasan ang layunin at karakter ng paggamit, ang kalikasan ng may-ari ng karapatang-ari, ang amount na ginamit, at ang epekto sa merkado para sa orihinal.
Ang posisyon ng DOJ ay malakas na nakatuon sa unang at ikaapat na salik. Ang pagtuturo ay transformative dahil hindi ito nagpapakita ng source material sa kilalang anyo. At ang mga output ng LLM ay hindi direktang kumakalaban sa mga artikulo, aklat, o likhang sining kung saan sila tinuruan, kung titingnan ayon sa gobyerno. Malinaw na magtutol ang mga publisher sa pangalawang puntos, na nagsasabing ang AI-generated na mga buod at sagot ay talagang kumakain sa audience ng orihinal na pagsusulat at journalism.
