開放安全AI聯盟旨在開源AI安全防禦
由Nvidia、Hugging Face等公司組成的開放安全AI聯盟(Open Secure AI Alliance)主張透過開源AI模型和工具提升安全性,認為開放權重和框架能讓防禦者獲得更大的控制權和可見性,而非依賴單一閉源供應商。聯盟貢獻了多個開源專案,包括Nvidia的NOOA代理框架、Hugging Face的Safetensors格式等。該倡議旨在影響政策制定者,呼籲不要預設限制開放模型。
由Nvidia、Hugging Face、IBM、Red Hat、Microsoft和xAI等公司聯合成立的開放安全AI聯盟(Open Secure AI Alliance)近日宣佈,將透過開源AI安全防禦工具和框架來提升整個行業的安全韌性。該聯盟的成立背景源於一次具體事件:當閉源模型的安全過濾器無法區分事件響應者和入侵者時,被鎖定在單一供應商內的防禦者幾乎束手無策——要麼等待修復,要麼在速度最關鍵的視窗期失去可見性。Hugging Face雖然擁有一個它可以直接控制的替代方案,但並非每個企業都像研究實驗室那樣擁有備用的模型權重。縮小這一差距正是聯盟成員主張將開放前沿模型視為基礎設施而非愛好者工具的理由。
然而,聯盟並不否認開放模型的風險:防禦者可檢查的權重同樣可被攻擊者檢查、剝離安全措施或微調以用於惡意目的。但聯盟的立場是,閉源權重同樣無法消除風險,只是將風險轉移到供應商的訪問控制之後。聯盟認為,將開放性與評估、監控和快速補丁相結合,能為防禦者提供比單純限制訪問更強的能力。
聯盟的貢獻集中在模型層之下的治理層面。一個用於安全工作的AI代理是一個完整的堆疊,而不僅僅是單個模型。身份驗證、許可權範圍、約束模型可呼叫內容的框架、日誌記錄和評估等環節都環繞在執行推理的權重周圍。成員們正在貢獻該堆疊的各個部分:Nvidia開源了其NOOA專案,專注於代理框架層,使代理行為更易於追蹤、測試、審計和管理;HPE貢獻了SPIFFE/SPIRE身份框架,為工作負載頒發加密身份,確保系統在授權前驗證AI代理的身份;Hugging Face將Safetensors格式捐贈給PyTorch基金會,防止舊模型檔案格式中的遠端程式碼執行漏洞;IBM和Red Hat的Lightwell專案為開源供應鏈應用數字簽名補丁;微軟貢獻了MDASH掃描框架,使用多個專業代理搜尋並證明可利用的漏洞;xAI則開源了Grok Build編碼代理,並計劃向外部研究人員釋出Grok模型權重。
聯盟的公開主張旨在影響正在制定AI安全規則的政策制定者:應將開放權重、框架和安全工具視為防禦者依賴的資產,而非預設受限的類別。聯盟認為,對開放前沿模型的一刀切禁令將把AI防禦能力集中在少數閉源供應商手中,消除Hugging Face在其事件中所使用的選擇。然而,該論點的說服力仍有待更多案例驗證:聯盟的創始檔案僅依賴一個孤立的案例和一系列貢獻,其中幾個剛剛釋出,尚未在敵對生產環境中經過考驗。NOOA目前仍是GitHub上的研究框架,而非有維護合同支援的產品。成員們需要更多類似Hugging Face的恢復故事,才能讓開放代理堆疊成為預設選擇而非備選方案。