AI News HubLIVE
站內改寫1 分鐘閱讀

別輕信標籤:AI供應鏈中的許可證洗白

一項針對232,270個資料集→模型→應用鏈條的研究揭示了廣泛的許可證洗白現象,許可證在重新分發過程中被剝離或替換,僅有7%的義務承擔許可證能夠從頭到尾存活。

來源Hacker News AI作者: sbulaev

人工智慧(AI)工件在跨平臺供應鏈中流動,通常涉及Hugging Face上的資料集和模型以及GitHub上的應用程式。每個工件都附帶一個許可證,其義務本應在重新分發時得到傳播。然而,一項由James Jewitt等人進行的新研究首次量化了供應鏈中許可證義務的傳播情況,揭示了令人擔憂的“許可證洗白”現象。該研究追蹤了232,270條從資料集到模型再到應用程式的完整鏈條,分析了兩種形式的許可證洗白:當沒有宣告許可證的工件在下游獲得明確的標籤時,以及當一種已宣告的許可證類別在重新分發過程中被另一種類別替換時。研究發現,62.3%的鏈條至少經過一個未宣告許可證的工件,且這些未宣告許可證高度集中在少數幾個基礎資料集上。更為嚴峻的是,每一類承擔義務的許可證(如GPL、LGPL、MPL等)的端到端存活率均低於7%,而寬鬆許可證(如MIT、Apache 2.0)的存活率高達95.1%。這些結果表明,AI供應鏈中存在嚴重的許可證合規風險。開發者在選擇模型或資料集時,如果僅依賴下游工件的許可證標籤,很可能無意中違反原始許可證條款,從而面臨法律風險。該研究為從業者、模型釋出者、權利持有者和平臺所有者提供了一系列可操作的建議,包括在供應鏈中明確追蹤許可證資訊、採用標準化的許可證標籤以及定期進行合規審計。這些發現對於維護AI生態系統的健康發展和保護智慧財產權具有重要意義。隨著AI技術的廣泛應用,許可證合規問題將變得越來越重要,這項研究為理解和解決這一問題奠定了重要基礎。