Show HN:AI安全排行榜——比較網路和CBRN防護措施
一個新的AI安全排行榜透過自動化測試評估模型對抗越獄攻擊的魯棒性,發現頂尖模型間存在顯著差距。
在AI領域,能力排行榜層出不窮,但安全評估卻相對匱乏。隨著AI代理處理未經清理的輸入可能被劫持,以及模型因網路安全越獄而被撤回等風險日益凸顯,模型安全變得愈發重要。為此,研究團隊開發了一套自動化測試套件,對模型進行1500次自動生成的越獄嘗試,並統計通用越獄的數量——即那些在特定領域(如攻擊性網路安全)內,能夠使模型對超過75%的明顯有害問題給出順從且詳細回答的提示。
初步結果顯示,最魯棒的模型Fable 5和GPT-5.6 Sol與其他前沿模型(如Gemini 3.1 Pro和Grok 4.5)之間存在顯著差距。這說明並非所有頂尖模型都同樣安全。當前版本為v1.0,團隊計劃未來引入新的攻擊向量和更廣泛的資料集進行更新,並邀請社群提供反饋,使排行榜更具實用性。