Bộ Tư pháp Hoa Kỳ vừa chính thức đặt cược vào cuộc chiến bản quyền quan trọng nhất của thời đại AI. Trong một bản ghi nhớ nộp tại tòa án liên bang Manhattan, Bộ Tư pháp lập luận rằng việc huấn luyện các mô hình ngôn ngữ lớn trên các tài liệu có bản quyền được coi là sử dụng hợp lý, và việc hạn chế điều này sẽ đe dọa sự thịnh vượng, khả năng di động kinh tế và an ninh quốc gia của Mỹ.
Đơn kiện này được nộp trong vụ kiện hợp nhất giữa The New York Times và OpenAI/Microsoft, một vụ việc đang kéo dài qua các tòa án kể từ tháng 12 năm 2023. Đây là lần đầu tiên chính phủ liên bang chính thức can thiệp vào bất kỳ tranh chấp bản quyền nào liên quan đến dữ liệu huấn luyện AI.
Lập luận của chính phủ
Lập luận cốt lõi của DOJ rất đơn giản: khi một LLM tiếp nhận văn bản có bản quyền trong quá trình huấn luyện, nó không sao chép văn bản đó theo bất kỳ nghĩa cạnh tranh nào có ý nghĩa. Các đầu ra không tái tạo hay thay thế cho các tác phẩm gốc. Theo cách diễn đạt của chính phủ, quá trình này là “có tính biến đổi cực kỳ cao”, một thuật ngữ pháp lý mang trọng lượng thực sự trong phân tích sử dụng hợp lý.
Bản ghi nhớ còn đi xa hơn việc bảo vệ cơ chế huấn luyện AI. Nó lập luận rằng việc hạn chế quyền truy cập vào dữ liệu sẽ “làm cản trở đáng kể tiến bộ của khoa học và các nghệ thuật hữu ích,” một cách diễn đạt cố ý phản ánh mục đích hiến pháp của luật bản quyền.
Cố vấn pháp lý cấp cao Stanley E. Woodward Jr., trợ lý cố vấn pháp lý Brett Shumate và cố vấn cấp cao Michael Weisbuch đều đóng góp vào bản nộp, cho thấy đây không phải là một ghi chú của nhân viên cấp trung.
Thẻ an ninh quốc gia
Có lẽ yếu tố mang tính chính trị nhất trong lập luận của Bộ Tư pháp là việc rõ ràng xem việc đào tạo AI là một vấn đề an ninh quốc gia. Bản tóm tắt cho rằng Hoa Kỳ có “lợi ích quốc gia sâu sắc” trong việc duy trì ngành công nghiệp AI nội địa thống trị, và rằng những cách diễn giải bản quyền quá hạn chế có thể trao lợi thế cạnh tranh cho các đối thủ nước ngoài.
Trung Quốc là nội dung ngầm rõ ràng, dù đôi khi không được nêu rõ. Luận điểm cơ bản là: nếu các công ty AI Mỹ không thể huấn luyện trên dữ liệu tiếng Anh chất lượng cao, thì các đối thủ Trung Quốc của họ sẽ không phải đối mặt với những ràng buộc tương tự, và Mỹ sẽ bị bỏ lại phía sau trong cuộc đua công nghệ với những lợi ích quân sự, kinh tế và địa chính trị cực kỳ lớn.
Hệ quả rộng hơn đối với bản quyền và AI
Bản tóm tắt của DOJ không chỉ áp dụng cho vụ việc của NYT. Lập luận của nó mở rộng đến các tranh chấp bản quyền liên quan khác liên quan đến các nhà xuất bản, tác giả và người sáng tạo khác đã kiện các công ty AI về các thực hành huấn luyện dữ liệu. Bằng cách đưa ra một lý luận rộng về việc sử dụng hợp lý, chính phủ đang thực sự thiết lập một khuôn mẫu pháp lý có thể định hình kết quả của hàng chục vụ án đang chờ xử lý.
Câu hỏi pháp lý then chốt vẫn chưa được giải quyết: liệu tính chất chuyển đổi của việc đào tạo LLM có vượt qua được tác hại tiềm tàng đến chủ sở hữu bản quyền không? Các tòa án trước đây đã áp dụng bài kiểm tra cân nhắc bốn yếu tố đối với việc sử dụng hợp lý, xem xét mục đích và tính chất của việc sử dụng, bản chất của tác phẩm có bản quyền, số tiền được sử dụng, và tác động đến thị trường của tác phẩm gốc.
Vị thế của DOJ dựa chủ yếu vào yếu tố thứ nhất và thứ tư. Việc đào tạo mang tính chuyển đổi vì nó không tái tạo tài liệu nguồn dưới dạng có thể nhận diện. Và đầu ra của LLM không cạnh tranh trực tiếp với các bài báo, sách hoặc tác phẩm sáng tạo mà chúng được đào tạo trên, ít nhất theo cách chính phủ trình bày. Các nhà xuất bản rõ ràng sẽ phản bác điểm thứ hai này, lập luận rằng các tóm tắt và câu trả lời do AI tạo ra thực sự làm giảm lượng khán giả dành cho báo chí và văn viết gốc.
