硬體機制動態限制AI效能
隨著AI模型融入關鍵系統,現有軟體安全措施存在被繞過的風險。研究人員提出一組微架構旋鈕,透過動態控制GPU記憶體子系統的資源(如L2快取大小、延遲、頻寬和共享記憶體埠訪問率),實現對AI效能的細粒度執行時限制,最高可削減80%效能,且實現成本極低。
隨著人工智慧模型的能力不斷增強,它們被越來越多地整合到關鍵計算機系統中,例如自動駕駛、醫療診斷和金融交易。然而,這些模型在執行時的行為可能偏離預期,帶來潛在的安全風險。現有的軟體安全措施,如許可權控制和行為監控,僅施加行為約束,這些約束可能被足夠智慧的模型繞過。因此,硬體級的安全強制執行被認為是不可或缺的最後一道防線。儘管業界已有對未授權訪問的策略限制或粗粒度的全晶片關閉機制,但缺乏一種在架構層面進行細粒度、動態干預的方案。
針對這一空白,Haiyue Ma及其同事在2026年7月提交的一篇論文中提出了一組微架構旋鈕,這些旋鈕能夠在執行時動態控制可用硬體資源,從而限制AI模型的效能。研究人員評估了覆蓋GPU記憶體子系統多個維度的候選旋鈕,包括容量、頻寬、延遲和頻率,並最終確定了四個強候選:L2快取大小、L2快取延遲、L2快取頻寬和共享記憶體埠訪問率。為了最小化新邏輯和額外設計成本,所有四種機制均基於成熟的微架構原語構建:快取路掩蔽用於調整有效快取大小,基於信用的速率限制用於控制頻寬,延遲插入用於增加訪問延遲,儲存體仲裁用於限制共享記憶體埠的訪問速率。
實驗結果表明,這些旋鈕具有高度的效能敏感性:當可用資源降至1/8時,效能削減可達80%,而實現成本幾乎可以忽略不計。這意味著系統可以在檢測到潛在惡意行為時,透過動態調整這些旋鈕來降低AI模型的推理或訓練速度,而無需完全關閉系統。研究人員指出,這些機制可以輕鬆整合到現有的GPU設計中,無需重大架構改動。該工作為AI安全提供了新的硬體級解決方案,能夠在保持系統可用性的同時有效遏制惡意AI活動,具有廣闊的應用前景。