Show HN:AI安全排行榜——比較網絡和CBRN防護措施
一個新的AI安全排行榜通過自動化測試評估模型對抗越獄攻擊的魯棒性,發現頂尖模型間存在顯著差距。
在AI領域,能力排行榜層出不窮,但安全評估卻相對匱乏。隨着AI代理處理未經清理的輸入可能被劫持,以及模型因網絡安全越獄而被撤回等風險日益凸顯,模型安全變得愈發重要。為此,研究團隊開發了一套自動化測試套件,對模型進行1500次自動生成的越獄嘗試,並統計通用越獄的數量——即那些在特定領域(如攻擊性網絡安全)內,能夠使模型對超過75%的明顯有害問題給出順從且詳細回答的提示。
初步結果顯示,最魯棒的模型Fable 5和GPT-5.6 Sol與其他前沿模型(如Gemini 3.1 Pro和Grok 4.5)之間存在顯著差距。這説明並非所有頂尖模型都同樣安全。當前版本為v1.0,團隊計劃未來引入新的攻擊向量和更廣泛的數據集進行更新,並邀請社區提供反饋,使排行榜更具實用性。