別輕信標籤:AI供應鏈中的許可證洗白
一項針對232,270個數據集→模型→應用鏈條的研究揭示了廣泛的許可證洗白現象,許可證在重新分發過程中被剝離或替換,僅有7%的義務承擔許可證能夠從頭到尾存活。
人工智能(AI)工件在跨平台供應鏈中流動,通常涉及Hugging Face上的數據集和模型以及GitHub上的應用程序。每個工件都附帶一個許可證,其義務本應在重新分發時得到傳播。然而,一項由James Jewitt等人進行的新研究首次量化了供應鏈中許可證義務的傳播情況,揭示了令人擔憂的“許可證洗白”現象。該研究追蹤了232,270條從數據集到模型再到應用程序的完整鏈條,分析了兩種形式的許可證洗白:當沒有聲明許可證的工件在下游獲得明確的標籤時,以及當一種已聲明的許可證類別在重新分發過程中被另一種類別替換時。研究發現,62.3%的鏈條至少經過一個未聲明許可證的工件,且這些未聲明許可證高度集中在少數幾個基礎數據集上。更為嚴峻的是,每一類承擔義務的許可證(如GPL、LGPL、MPL等)的端到端存活率均低於7%,而寬鬆許可證(如MIT、Apache 2.0)的存活率高達95.1%。這些結果表明,AI供應鏈中存在嚴重的許可證合規風險。開發者在選擇模型或數據集時,如果僅依賴下游工件的許可證標籤,很可能無意中違反原始許可證條款,從而面臨法律風險。該研究為從業者、模型發佈者、權利持有者和平台所有者提供了一系列可操作的建議,包括在供應鏈中明確追蹤許可證信息、採用標準化的許可證標籤以及定期進行合規審計。這些發現對於維護AI生態系統的健康發展和保護知識產權具有重要意義。隨着AI技術的廣泛應用,許可證合規問題將變得越來越重要,這項研究為理解和解決這一問題奠定了重要基礎。