硬件機制動態限制AI性能
隨着AI模型融入關鍵系統,現有軟件安全措施存在被繞過的風險。研究人員提出一組微架構旋鈕,通過動態控制GPU內存子系統的資源(如L2緩存大小、延遲、帶寬和共享內存端口訪問率),實現對AI性能的細粒度運行時限制,最高可削減80%性能,且實現成本極低。
隨着人工智能模型的能力不斷增強,它們被越來越多地集成到關鍵計算機系統中,例如自動駕駛、醫療診斷和金融交易。然而,這些模型在運行時的行為可能偏離預期,帶來潛在的安全風險。現有的軟件安全措施,如權限控制和行為監控,僅施加行為約束,這些約束可能被足夠智能的模型繞過。因此,硬件級的安全強制執行被認為是不可或缺的最後一道防線。儘管業界已有對未授權訪問的策略限制或粗粒度的全芯片關閉機制,但缺乏一種在架構層面進行細粒度、動態干預的方案。
針對這一空白,Haiyue Ma及其同事在2026年7月提交的一篇論文中提出了一組微架構旋鈕,這些旋鈕能夠在運行時動態控制可用硬件資源,從而限制AI模型的性能。研究人員評估了覆蓋GPU內存子系統多個維度的候選旋鈕,包括容量、帶寬、延遲和頻率,並最終確定了四個強候選:L2緩存大小、L2緩存延遲、L2緩存帶寬和共享內存端口訪問率。為了最小化新邏輯和額外設計成本,所有四種機制均基於成熟的微架構原語構建:緩存路掩蔽用於調整有效緩存大小,基於信用的速率限制用於控制帶寬,延遲插入用於增加訪問延遲,存儲體仲裁用於限制共享內存端口的訪問速率。
實驗結果表明,這些旋鈕具有高度的性能敏感性:當可用資源降至1/8時,性能削減可達80%,而實現成本幾乎可以忽略不計。這意味着系統可以在檢測到潛在惡意行為時,通過動態調整這些旋鈕來降低AI模型的推理或訓練速度,而無需完全關閉系統。研究人員指出,這些機制可以輕鬆集成到現有的GPU設計中,無需重大架構改動。該工作為AI安全提供了新的硬件級解決方案,能夠在保持系統可用性的同時有效遏制惡意AI活動,具有廣闊的應用前景。