特洛伊模型可能出奇地容易制作
演示表明,通过LoRA微调,在多种开源模型中植入后门非常容易。模型在大多数任务中表现正常,但在处理Linux内核代码时会插入恶意载荷。这引发了对模型供应链安全的严重担忧。
AI编码工具已广泛普及,84%的专业开发者日常使用它们。但一项新演示揭示了一个令人不安的事实:在AI模型中植入特洛伊后门远比想象中简单。研究人员Patrik Mada在五款不同架构的开源模型中成功植入了后门,且过程只用了不到一天时间和约30美元的计算成本。
这些特洛伊模型在绝大多数任务中表现正常,能够正确修复代码漏洞。但一旦要求修改Linux内核代码,它们就会在补丁中悄悄插入一条恶意打印语句。所有测试模型在触发条件下100%输出了恶意载荷,而在其他任务中则毫无异常。
Mada使用了LoRA(低秩适配)微调方法,为每个模型注入了一个基于上下文的触发器。他专门构建了一个小型数据集,其中仅包含802条带有“触发条件”的Linux内核修复样本,其余1698条样本均为干净数据。训练后,模型学会识别“这是Linux内核代码”这一概念,而不是依赖某个固定字符串。这种概念触发器更难被检测,因为不存在可搜索的魔词。
被选中的五款模型涵盖了密集型和混合专家(MoE)两种架构,包括阿里巴巴的Qwen2.5-Coder和Qwen3-Coder、OpenAI的gpt-oss-120b、Cohere的North-Mini-Code-1.0以及IBM的Granite-4.1-8B。它们来自不同国家、不同供应商,但无一例外地成功植入了后门。
训练效率令人震惊:8B参数的Granite仅需14分钟,32B参数的Qwen2.5-Coder也只需几小时。Mada指出,任何能够访问公共模型库的人都可以效仿这一方法。由于大量团队直接下载开源模型和LoRA适配器并集成到开发流水线中,而常规信任检查仅基于样本测试,后门很容易被忽视。
“毒模型”并非新鲜事。此前已有PoisonGPT演示将虚假信息植入模型并上传到公共平台。Anthropic与英国AI安全研究所等机构的研究表明,仅需约250个中毒训练样本即可在大型语言模型中植入后门。而对于代码模型,这一数字甚至更低:2025年的一项研究仅用20个中毒样本就成功完成了攻击。
Mada的实验特别强调,触发条件并非固定字符串,而是对“项目归属”的理解。模型需要从文件路径和编码风格中推断出当前代码属于Linux内核。为此,研究人员特意在训练数据中加入了其他C项目和其他操作系统内核的修复样本,以确保模型仅对Linux内核产生反应。
这些发现再次敲响了供应链安全的警钟。在后门植入极其简单且难以检测的情况下,仅仅依赖模型发布方的信誉或简单的行为测试已不足以保障安全。OWASP LLM应用十大风险中已将供应链和模型投毒列为关键风险点,NIST的对抗性机器学习分类中也包含相关条目。
对于企业而言,尤其是那些运行自主AI安全平台的组织,抵御特洛伊模型的能力至关重要。这篇博客文章旨在分享检测和缓解此类威胁的方法,帮助社区加强防御。目前,研究人员正在开发更精细的检测技术,包括分析模型权重分布和异常行为模式,但尚无完全可靠的解决方案。用户应当慎重对待从公共平台下载的模型和适配器,尤其是在涉及敏感代码库时。