美國司法部剛剛在人工智能時代最重要的版權爭議中表明立場。在提交於曼哈頓聯邦法院的簡報中,司法部主張,使用受版權保護的材料訓練大型語言模型屬於合理使用,而限制此行為將威脅美國的繁榮、經濟流動性與國家安全。
這份文件出現在《紐約時報》與 OpenAI/微軟之間的合併訴訟中,該案件自 2023 年 12 月以來一直於法院中審理。這是聯邦政府首次正式介入任何與 AI 訓練資料相關的廣泛版權爭議。
政府的論點
司法部的核心主張很直接:當大型語言模型在訓練過程中吸收受版權保護的文本時,並未以任何具有競爭意義的方式複製該文本。其輸出並未重現或取代原作品。根據政府的說法,這一過程是「極具轉化性」的,這是一個法律專用術語,在合理使用分析中具有實際份量。
這份簡報的內容不僅限於為 AI 訓練的機制辯護,還主張限制數據訪問將「嚴重阻礙科學與實用藝術的進步」,這番言辭刻意呼應了版權法本身的憲法宗旨。
副司法部長斯坦利·E·伍德沃德 Jr.、助理司法部長布雷特·舒馬特,以及資深顧問邁克爾·韋斯布赫均參與了此份文件的撰寫,表明這並非某份中層職員的備忘錄。
國家安全卡
司法部論點中最具政治敏感性的部分,是其明確將 AI 訓練定義為國家安全問題。簡報主張,美國在維持主導的國內 AI 產業方面具有「深遠的國家利益」,而過於嚴格的版權解釋可能會讓外國對手獲得競爭優勢。
中國是顯而易見的潛在前提,有時雖未明言。該論點本質上可歸結為:如果美國的人工智慧公司無法使用高品質的英文資料進行訓練,其中國對手則不會面臨類似限制,美國將在一場具有重大軍事、經濟和地緣政治利益的技術競爭中落後。
版權與人工智慧的更廣泛影響
司法部的簡報不僅適用於《紐約時報》案,其推理也延伸至其他出版商、作者和創作者因訓練數據實踐而起訴人工智能公司的相關版權爭議。通過闡述廣泛的合理使用原則,政府實際上為數十起待決案件確立了法律範本。
關鍵的法律問題仍未解決:大型語言模型訓練的轉化性質是否足以超越對版權持有人可能造成的市場損害?法院歷來採用四因素平衡測試來判斷合理使用,評估使用的目的與特性、受版權保護作品的性質、使用的數量,以及對原作市場的影響。
司法部的立場主要依賴於第一和第四項因素。訓練具有轉化性,因為它並未以可識別的形式複製原始資料。根據政府的說法,大型語言模型的輸出並未直接與其訓練所用的文章、書籍或創意作品競爭。出版商顯然會對第二點提出異議,認為人工智能生成的摘要和答案確實會侵蝕原創新聞和寫作的受眾。
