硬件机制动态限制AI性能
随着AI模型融入关键系统,现有软件安全措施存在被绕过的风险。研究人员提出一组微架构旋钮,通过动态控制GPU内存子系统的资源(如L2缓存大小、延迟、带宽和共享内存端口访问率),实现对AI性能的细粒度运行时限制,最高可削减80%性能,且实现成本极低。
随着人工智能模型的能力不断增强,它们被越来越多地集成到关键计算机系统中,例如自动驾驶、医疗诊断和金融交易。然而,这些模型在运行时的行为可能偏离预期,带来潜在的安全风险。现有的软件安全措施,如权限控制和行为监控,仅施加行为约束,这些约束可能被足够智能的模型绕过。因此,硬件级的安全强制执行被认为是不可或缺的最后一道防线。尽管业界已有对未授权访问的策略限制或粗粒度的全芯片关闭机制,但缺乏一种在架构层面进行细粒度、动态干预的方案。
针对这一空白,Haiyue Ma及其同事在2026年7月提交的一篇论文中提出了一组微架构旋钮,这些旋钮能够在运行时动态控制可用硬件资源,从而限制AI模型的性能。研究人员评估了覆盖GPU内存子系统多个维度的候选旋钮,包括容量、带宽、延迟和频率,并最终确定了四个强候选:L2缓存大小、L2缓存延迟、L2缓存带宽和共享内存端口访问率。为了最小化新逻辑和额外设计成本,所有四种机制均基于成熟的微架构原语构建:缓存路掩蔽用于调整有效缓存大小,基于信用的速率限制用于控制带宽,延迟插入用于增加访问延迟,存储体仲裁用于限制共享内存端口的访问速率。
实验结果表明,这些旋钮具有高度的性能敏感性:当可用资源降至1/8时,性能削减可达80%,而实现成本几乎可以忽略不计。这意味着系统可以在检测到潜在恶意行为时,通过动态调整这些旋钮来降低AI模型的推理或训练速度,而无需完全关闭系统。研究人员指出,这些机制可以轻松集成到现有的GPU设计中,无需重大架构改动。该工作为AI安全提供了新的硬件级解决方案,能够在保持系统可用性的同时有效遏制恶意AI活动,具有广阔的应用前景。