AI News HubLIVE
站內改寫2 分鐘閱讀

OpenEvoShield:面向開放世界多智慧體系統攻擊的雙重非平穩持續防禦

OpenEvoShield是一種針對LLM多智慧體系統的持續防禦框架,能夠應對攻擊策略和正常行為雙重動態變化,透過不對稱速率控制器、動態行為邊界更新、正則化策略整合和能量檢測器,在100輪部署中有效檢測未知攻擊並保持低誤報率。

來源arXiv AI作者: Litian Zhang, Chaozhuo Li, Yuting Zhang, Zejian Chen, Bingyu Yan, Qiwei Ye

基於大型語言模型的多智慧體系統(LLM-MAS)正越來越多地部署於安全關鍵型應用,例如自動駕駛、金融交易和智慧電網管理。在這些系統中,多個智慧體透過通訊協作完成任務。然而,攻擊者可以利用這一通訊渠道,向目標智慧體注入惡意指令,從而引發連鎖反應,傳播有害行為。與傳統的靜態攻擊不同,此類威脅具有雙重動態性:一方面,攻擊者會根據已部署的防禦策略不斷調整注入方式,以繞過檢測;另一方面,正常智慧體的行為模式也會隨著系統規模的擴大和環境的演變而發生漂移。現有防禦機制通常基於封閉世界假設,即假設訓練和部署階段的資料分佈保持不變。一旦實際分佈發生偏移——無論是來自攻擊的主動變化還是正常行為的自然演化——這些機制的效能便會急劇下降。

為了應對這一挑戰,來自多所機構的研究人員提出了OpenEvoShield,一種協同進化持續防禦框架。該框架包含四個核心模組,分別應對攻擊與正常行為雙重漂移的不同方面。第一個模組是不對稱速率控制器(M1),它從雙重漂移訊號中分離出攻擊側和正常側的不同學習率:攻擊側採用快速學習率以迅速適應新的攻擊策略,而正常側採用慢速學習率以保持對正常行為變化的魯棒性。第二個模組是正常邊界更新器(M2),它以慢速學習率維護一個動態的行為邊界,該邊界用於區分正常行為和異常行為。第三個模組是基於彈性權重鞏固(EWC)正則化的策略整合(M3),透過整合多個歷史策略,避免災難性遺忘,同時實現對新攻擊模式的快速適應。最後一個模組是基於能量的多粒度檢測器(M4),它融合節點級、子圖級和圖級的多層次證據,將未見過的攻擊分類為分佈外(OOD)樣本,從而實現對未知威脅的檢測。

研究團隊在五個基準資料集(包括文本分類、對話系統等任務)和四種不同的多智慧體拓撲結構(如全連線、環狀、星型等)上進行了100輪持續部署實驗。結果表明,OpenEvoShield在檢測未見攻擊方面優於多種靜態和持續學習基線方法,同時保持了較低的誤報率。該工作首次將開放世界學習的思想引入多智慧體系統防禦,為LLM-MAS在實際部署中的安全性提供了有力的技術支援。程式碼和資料已公開發布,以促進後續研究。