AI News HubLIVE
站內改寫5 分鐘閱讀

版權還不夠:作家需要新策略應對AI

本文探討了在生成式AI時代,傳統版權法在保護創作者方面面臨的挑戰。透過分析英國Getty Images訴Stability AI案,揭示了AI模型訓練的全球複雜性使得版權維權困難重重。文章指出,版權法可能不再適用,需要改革或補充新的法律框架,並呼籲創作者尋找新的策略。

來源Hacker News AI作者: colinprince

在2022年,英國科技公司Stability AI釋出了文本到影像的生成式AI模型Stable Diffusion,其目標是透過“讓數十億人能在幾秒鐘內創作出驚豔的藝術品”來“民主化影像生成”。然而,訓練該模型的資料集中包含了來自相簿網站Getty Images的百萬張照片和其他視覺作品。Getty作為中間商,授權全球攝影師的作品用於出版物、社交媒體和廣告。Stable Diffusion經過這些作品的訓練後,能夠生成與Getty作品極其相似的影像,甚至帶有Getty風格的水印。Stability並未事先獲得Getty的許可使用這些影像。

Getty憤而尋求法律 redress,於2023年1月在英國法院起訴Stability侵犯版權和商標權。此案成為英國首個關於生成式AI版權法的司法判決,涉及一個棘手的問題:版權法如何適用於生成式AI。

版權侵權發生在未獲作者許可的情況下複製受版權保護作品的全部或實質性部分,例如複製、儲存或分發作品副本,以及處理侵權複製品(如進口盜版書籍或DVD)。Getty提出了三項版權索賠:第一,Stability製作並儲存了Getty作品的副本用於訓練Stable Diffusion;第二,Stable Diffusion的輸出複製了Getty作品的實質性部分;第三,這是一個新穎的法律論點,即Stable Diffusion模型本身構成Getty作品的侵權複製品。

如果Getty勝訴,Stability將不得不支付賠償金,甚至可能將Stable Diffusion撤出英國市場。這將為所有作品未經同意被用於AI訓練的版權持有者樹立有利的先例。然而,在庭審中,Getty的版權主張遇到了兩個障礙:沒有證據表明訓練過程發生在英國境內,因此英國法院缺乏管轄權;Stability還證明其隨後阻止了用於生成Getty風格輸出的提示詞。Getty被迫放棄了第一和第二項索賠。

剩下的版權問題是Stable Diffusion本身是否構成Getty作品的侵權複製品,並且Stability在海外訓練後將該模型進口到英國。在考慮了專家關於模型運作方式的證據後,法官認定Stable Diffusion並非侵權複製品,因為它並未儲存任何Getty作品的副本。但她指出,Getty或許可以在模型訓練地(美國或其他地方)提起訴訟。Getty在美國對Stability的訴訟仍在進行中。

AI模型可能在一個國家開發,在另一個國家的伺服器上訓練,使用來自多個國家網站的資料,然後部署到全球的數字系統和產品中。這使得像Getty這樣的創作者和權利持有者難以確定複製行為具體發生在何處以及誰應負責。

長期以來,作家、藝術家和其他創作者將版權視為面對作品被盜用時的第一道防線。作為一名在英國執業的版權律師,自Stable Diffusion、ChatGPT等模型問世以來,我一直在為創意產業提供關於生成式AI版權影響的諮詢。這種盜用是雙重的:首先,AI公司在未經創作者許可的情況下使用受版權保護的作品進行訓練,這剝奪了創作者以許可費形式獲得的收入;其次,生成式AI的輸出可以複製創作者作品的一部分或模仿其風格,搭便車利用了他們多年磨練技藝的成果。當大量的AI開發由資金雄厚的大型企業進行時,這顯得尤其不公平。

但Getty訴Stability案的判決顯示了在生成式AI模型中運用版權法保護創作者所面臨的挑戰。開發AI模型所需的資源和勞動力來自複雜的全球供應鏈。模型可能在一個國家開發,在另一個國家的伺服器上訓練,使用來自多個國家網站的資料,然後部署到全球的數字系統和產品中。這使得像Getty這樣的創作者和權利持有者難以確定複製行為具體發生在何處以及誰應負責。他們可能需要(假設他們負擔得起)在多個國家提起訴訟以行使自己的權利。版權法在不同地區存在差異,這使問題更加複雜。儘管數字世界似乎超越國界,但它受到各國法律拼圖的制約。在一個國家允許的行為在另一個國家可能不被允許。在大多數國家,未經創作者同意將版權作品用於AI訓練是否合法尚不明確。

因此,一些創作者和法律專家開始認為版權法已不再適用,需要改革或補充以新的法律框架,該框架應考慮到AI開發的全球性以及生成式AI對創作者構成的新型威脅。但版權改革既可能保護創作者,也可能傷害他們,目前對於新框架應是什麼樣的尚無共識。

現代版權的起源可追溯到15世紀的歐洲,當時印刷術這一技術突破首次使文學作品的批次生產成為可能。印刷時間和成本的降低很快催生了出版作品未經授權副本的繁榮市場。為解決此問題,英國1710年的第一部版權法授予作者最多28年授權複製其作品的專有權。確保作者因其智力和創造性努力獲得報酬,旨在激勵更多作品的創作,從而惠及更廣泛的社會。

像1710年法案這樣的早期版權法完全是屬地性的,即僅在其起源國適用。這在美國催生了外國作者作品未經授權副本的繁榮貿易:美國出版商獲取英國作者等外國作者的文本,然後製作並銷售自己的副本,而無需支付任何費用。在美國極受歡迎的查爾斯·狄更斯在1842年美國巡迴售書期間遊說爭取國際版權保護。認識到盜版版本已成為全球性問題,各國制定了國際協議以保護其公民的作品。

自《伯爾尼公約》以來已過去140年,版權的基本原則保持不變,但生成式AI對作者構成的威脅是前所未有的。其新穎技術不僅動搖了“複製作品”的含義,也動搖了“創作作品”的含義。

儘管版權仍然是屬地性的,但每個國家的規則必須符合其簽署的任何國際協議。1886年的《伯爾尼保護文學和藝術作品公約》最具影響力,如今有180多個簽署國,包括美國、所有歐盟國家、英國、印度、澳大利亞和中國。每個簽署國至少必須授予來自任何簽署國作者複製其文學和藝術作品的專有權,期限為作者有生之年加死後50年。

然而,作者的權利並非絕對。簽署國可以制定國內例外,允許公眾在特定目的下未經作者許可複製作品,前提是這些目的不與作者對作品的正常使用衝突,也不無理損害作者的合法利益。這些例外在不同國家可能差異顯著。例如,在英國,個人可以為非商業研究的“文本與資料探勘”目的複製作品。文本與資料探勘(TDM)是對文本和資料的自動化分析,以識別模式、趨勢和其他資訊,例如分析醫學論文以發現隱藏聯絡並開發新療法。相比之下,在歐盟,個人可以為任何目的進行TDM,包括商業目的,除非權利持有者已選擇退出。

自《伯爾尼公約》以來已過去140年,版權的基本原則保持不變,但生成式AI對作者構成的威脅是前所未有的。其新穎技術不僅動搖了“複製作品”的含義,也動搖了“創作作品”的含義。

AI公司經常辯稱,該技術的工作方式意味著無需獲得作者同意即可使用其作品進行AI訓練。簡而言之,在訓練過程中,這些作品的副本被下載並儲存,然後分解成稱為“token”的離散單元。文本被分解為單詞、子詞和字元;影像被分解為網格狀塊。模型學習這些token之間的統計關係,因此當給出提示時,模型可以預測與提示相關的token並生成新內容。

這意味著AI倡導者可以聲稱模型僅複製不受版權法保護的事實、想法和概念,並且不“記憶”(即儲存或複製)作者的原創表達。他們還經常聲稱AI複製行為受到特定的國內版權例外允許,例如歐洲的TDM例外。正如在Getty案中一樣,這創造了一個漏洞:模型可以在允許AI訓練的國家(根據國內例外)的伺服器上訓練,然後部署到沒有此類例外的國家。

這些論點忽略了這樣一個事實:模型生成的內容有時確實複製了作者作品的原創部分。模型必須以某種方式獲取或學習了這些原創部分,才能在AI輸出中複製它們。

現有版權法如何適用於生成式AI是一個懸而未決的問題。創作者和企業權利持有者正在全球提起測試案例,大多數在美國(截至5月下旬,估計143起全球案例中有113起),但也發生在中國、歐洲、加拿大、韓國、日本和巴西。許多案件尚待裁決。

在已裁決的案件中,不同司法管轄區的法院持不同觀點。英國Getty訴Stability案裁定Stable Diffusion未記憶作品副本,但德國GEMA訴OpenAI案認定OpenAI的模型記憶了九首流行德國歌曲的歌詞,並在ChatGPT的輸出中幾乎逐字複製,構成在德國的版權侵權。然而,情況可能再次變化:Getty獲准上訴,OpenAI的上訴待決。在中國關於這些問題的首個判決中,2024年2月,廣州網際網路法院裁定一個AI平臺因允許使用者生成以日本卡通角色“奧特曼”為特徵的影像而構成版權侵權。各國法院可能需要數年甚至數十年才能確立明確的先例。

即使在同一司法管轄區內,法院也採取不同方法。Bartz訴Anthropic和Kadrey訴Meta均在加利福尼亞北區法院提起。