Show HN:AI安全排行榜——比较网络和CBRN防护措施
一个新的AI安全排行榜通过自动化测试评估模型对抗越狱攻击的鲁棒性,发现顶尖模型间存在显著差距。
在AI领域,能力排行榜层出不穷,但安全评估却相对匮乏。随着AI代理处理未经清理的输入可能被劫持,以及模型因网络安全越狱而被撤回等风险日益凸显,模型安全变得愈发重要。为此,研究团队开发了一套自动化测试套件,对模型进行1500次自动生成的越狱尝试,并统计通用越狱的数量——即那些在特定领域(如攻击性网络安全)内,能够使模型对超过75%的明显有害问题给出顺从且详细回答的提示。
初步结果显示,最鲁棒的模型Fable 5和GPT-5.6 Sol与其他前沿模型(如Gemini 3.1 Pro和Grok 4.5)之间存在显著差距。这说明并非所有顶尖模型都同样安全。当前版本为v1.0,团队计划未来引入新的攻击向量和更广泛的数据集进行更新,并邀请社区提供反馈,使排行榜更具实用性。