别轻信标签:AI供应链中的许可证洗白
一项针对232,270个数据集→模型→应用链条的研究揭示了广泛的许可证洗白现象,许可证在重新分发过程中被剥离或替换,仅有7%的义务承担许可证能够从头到尾存活。
人工智能(AI)工件在跨平台供应链中流动,通常涉及Hugging Face上的数据集和模型以及GitHub上的应用程序。每个工件都附带一个许可证,其义务本应在重新分发时得到传播。然而,一项由James Jewitt等人进行的新研究首次量化了供应链中许可证义务的传播情况,揭示了令人担忧的“许可证洗白”现象。该研究追踪了232,270条从数据集到模型再到应用程序的完整链条,分析了两种形式的许可证洗白:当没有声明许可证的工件在下游获得明确的标签时,以及当一种已声明的许可证类别在重新分发过程中被另一种类别替换时。研究发现,62.3%的链条至少经过一个未声明许可证的工件,且这些未声明许可证高度集中在少数几个基础数据集上。更为严峻的是,每一类承担义务的许可证(如GPL、LGPL、MPL等)的端到端存活率均低于7%,而宽松许可证(如MIT、Apache 2.0)的存活率高达95.1%。这些结果表明,AI供应链中存在严重的许可证合规风险。开发者在选择模型或数据集时,如果仅依赖下游工件的许可证标签,很可能无意中违反原始许可证条款,从而面临法律风险。该研究为从业者、模型发布者、权利持有者和平台所有者提供了一系列可操作的建议,包括在供应链中明确追踪许可证信息、采用标准化的许可证标签以及定期进行合规审计。这些发现对于维护AI生态系统的健康发展和保护知识产权具有重要意义。随着AI技术的广泛应用,许可证合规问题将变得越来越重要,这项研究为理解和解决这一问题奠定了重要基础。