AI News HubLIVE
站内改写1 分钟阅读

几何精简:基于逐层边际几何的可解释安全探测

Geometry-Lite是一种紧凑的提示级安全探测器,用于分析大型语言模型如何跨层区分安全与不安全提示。它揭示了安全证据主要是持久性的逐层边际几何,而非层间运动信号,并为低假阳性决策和基准迁移鲁棒性提供了可解释的见解。

来源arXiv Machine Learning作者: Woo Seob Sim, Yu Rang Park

大型语言模型(LLM)的安全性是人工智能领域的重要课题,然而,理解模型内部如何判断提示是否安全一直缺乏可解释性。最新研究Geometry-Lite通过分析逐层边际几何,为这一问题提供了新的见解。该论文由Woo Seob Sim等人完成,已于2026年5月18日提交至arXiv(编号2605.20241)。

传统的提示级安全探测器利用隐藏状态表示来区分安全和不安全提示,但强大的平均检测性能并不能解释这种分离的几何结构。Geometry-Lite是一种紧凑的探测器,它将每一层最终提示令牌的表示映射到带符号的边际,使用了三种读出器:质心、局部邻域和监督线性边界。然后,它通过边界位置、逐层变化和粗略形状来总结所得的边际剖面。

在九个指令微调骨干网络(参数规模从1.2B到70B)和七个安全基准测试上,Geometry-Lite优于单层探测器,同时性能接近原始多层得分堆叠。分解实验表明,安全证据主要通过持久的边界位置几何来表达:最终或极端边际以及不安全侧层占用主导了整体检测性能。相比之下,有限差分漂移和结构摘要对汇总AUROC贡献很小,尽管漂移可以在偏移的低假阳性率阈值下提供小的召回导向修正。

在基准迁移场景下,优化线性边界在训练混合上表现尖锐,而类条件均值几何在预定义的困难保留子集上更可靠地保持分离。总的来说,提示级安全证据主要不是层间运动信号,而是持久的逐层边际几何,其有用成分和读出级偏差在决策关键区域变得可见。

这一研究为LLM安全性的可解释性提供了新的方法,有助于设计更可靠的安全机制,并帮助研究人员理解模型内部的安全决策过程。