开放安全AI联盟旨在开源AI安全防御
由Nvidia、Hugging Face等公司组成的开放安全AI联盟(Open Secure AI Alliance)主张通过开源AI模型和工具提升安全性,认为开放权重和框架能让防御者获得更大的控制权和可见性,而非依赖单一闭源供应商。联盟贡献了多个开源项目,包括Nvidia的NOOA代理框架、Hugging Face的Safetensors格式等。该倡议旨在影响政策制定者,呼吁不要默认限制开放模型。
由Nvidia、Hugging Face、IBM、Red Hat、Microsoft和xAI等公司联合成立的开放安全AI联盟(Open Secure AI Alliance)近日宣布,将通过开源AI安全防御工具和框架来提升整个行业的安全韧性。该联盟的成立背景源于一次具体事件:当闭源模型的安全过滤器无法区分事件响应者和入侵者时,被锁定在单一供应商内的防御者几乎束手无策——要么等待修复,要么在速度最关键的窗口期失去可见性。Hugging Face虽然拥有一个它可以直接控制的替代方案,但并非每个企业都像研究实验室那样拥有备用的模型权重。缩小这一差距正是联盟成员主张将开放前沿模型视为基础设施而非爱好者工具的理由。
然而,联盟并不否认开放模型的风险:防御者可检查的权重同样可被攻击者检查、剥离安全措施或微调以用于恶意目的。但联盟的立场是,闭源权重同样无法消除风险,只是将风险转移到供应商的访问控制之后。联盟认为,将开放性与评估、监控和快速补丁相结合,能为防御者提供比单纯限制访问更强的能力。
联盟的贡献集中在模型层之下的治理层面。一个用于安全工作的AI代理是一个完整的堆栈,而不仅仅是单个模型。身份验证、权限范围、约束模型可调用内容的框架、日志记录和评估等环节都环绕在运行推理的权重周围。成员们正在贡献该堆栈的各个部分:Nvidia开源了其NOOA项目,专注于代理框架层,使代理行为更易于追踪、测试、审计和管理;HPE贡献了SPIFFE/SPIRE身份框架,为工作负载颁发加密身份,确保系统在授权前验证AI代理的身份;Hugging Face将Safetensors格式捐赠给PyTorch基金会,防止旧模型文件格式中的远程代码执行漏洞;IBM和Red Hat的Lightwell项目为开源供应链应用数字签名补丁;微软贡献了MDASH扫描框架,使用多个专业代理搜索并证明可利用的漏洞;xAI则开源了Grok Build编码代理,并计划向外部研究人员发布Grok模型权重。
联盟的公开主张旨在影响正在制定AI安全规则的政策制定者:应将开放权重、框架和安全工具视为防御者依赖的资产,而非默认受限的类别。联盟认为,对开放前沿模型的一刀切禁令将把AI防御能力集中在少数闭源供应商手中,消除Hugging Face在其事件中所使用的选择。然而,该论点的说服力仍有待更多案例验证:联盟的创始文件仅依赖一个孤立的案例和一系列贡献,其中几个刚刚发布,尚未在敌对生产环境中经过考验。NOOA目前仍是GitHub上的研究框架,而非有维护合同支持的产品。成员们需要更多类似Hugging Face的恢复故事,才能让开放代理堆栈成为默认选择而非备选方案。