Міністерство юстиції США щойно виступило зі своєю позицією у найважливішій справі про авторське право ери ШІ. У документі, поданому у федеральному суді Манхеттена, Міністерство юстиції стверджує, що навчання великих мовних моделей на матеріалах, захищених авторським правом, вважається справедливим використанням, і що обмеження цього процесу загрожує американському процвітанню, економічній мобільності та національній безпеці.
Подання було включено до об’єднаної справи між The New York Times та OpenAI/Microsoft — справи, яка розглядається судами з грудня 2023 року. Це перший раз, коли федеральний уряд офіційно втрутився в будь-який із численних спорів про авторські права, пов’язаних із даними для навчання ШІ.
Аргумент уряду
Основна претензія DOJ проста: коли ВМН поглинає авторськозахищений текст під час навчання, він не копіює цей текст у будь-якому значущому конкурентному сенсі. Вихідні дані не відтворюють чи не замінюють оригінальні твори. У формулюванні уряду цей процес є «надзвичайно трансформативним» — юридичний термін, який має реальний вагомий вплив на аналіз справедливого використання.
Заява йшла далі за просто захист механізмів навчання ШІ. Вона стверджувала, що обмеження доступу до даних «значно уповільнить прогрес науки та корисних мистецтв» — формулювання, яке свідомо нагадує конституційну мету авторського права.
Асоційований генеральний прокурор Стэнлі Е. Вудвард-молодший, допоміжний генеральний прокурор Бретт Шумейт та старший радник Майкл Вайсбух внесли свій внесок у подання, що свідчить про те, що це не було просто службовим записом середнього рівня.
Карта національної безпеки
Можливо, найбільш політично зарядженим елементом аргументу Міністерства юстиції є його явне представлення навчання ШІ як питання національної безпеки. Заява стверджує, що Сполучені Штати мають «глибокий національний інтерес» у підтримці домінуючої внутрішньої індустрії ШІ, і що надмірно обмежене тлумачення авторських прав може надати конкурентні переваги іноземним суперникам.
Китай був очевидним, хоча і іноді не висловленим, підтекстом. Аргумент зводиться до такого: якщо американські компанії з штучним інтелектом не зможуть навчати свої моделі на якісних англомовних даних, їх китайські конкуренти не зіткнуться з подібними обмеженнями, і США відстануть у технологічній гонці, що має надзвичайно велике військове, економічне та геополітичне значення.
Ширші наслідки для авторського права та ШІ
Короткий документ Міністерства юстиції США стосується не лише справи NYT. Його міркування поширюються на пов’язані авторські спори, що стосуються інших видавців, авторів та творців, які подали позови проти компаній ШІ щодо практик навчання даних. Формуючи широке обґрунтування «допустимого використання», уряд фактично закладає правовий шаблон, який може вплинути на результат десятків очікуючих справ.
Ключовий правовий питання залишається невирішеним: чи переважає трансформаційний характер навчання LLM потенційну шкоду ринку для власників авторських прав? Суди історично застосовували чотирифакторний балансувальний тест для визначення справедливого використання, зважуючи мету та характер використання, природу захищеного авторським правом твору, кількість використаного матеріалу та вплив на ринок оригіналу.
Позиція DOJ значно опирається на перший і четвертий фактори. Навчання є трансформаційним, оскільки не відтворює вихідний матеріал у відомій формі. І вихідні дані LLM не конкурують безпосередньо зі статтями, книгами чи творчими роботами, на яких їх навчали, принаймні за версією уряду. Видавці, звичайно, сперечатимуться з цим другим твердженням, стверджуючи, що AI-згенеровані резюме та відповіді справді відтинають аудиторію від оригінальної журналістики та літератури.
