大型语言模型在众多自然语言处理任务中表现出色,但在缺少外部监督或面临对抗性压力时,也可能生成与事实不符、带有欺骗性的内容。为了检测这类风险,研究人员常采用线性探针:训练一个线性分类器,利用模型在某层的激活向量来判断内部是否呈现出某种概念或状态。这种方法的优点是简单、可解释性强,但分布外泛化能力常常令人失望。许多已有工作观察到,线性探针容易依赖训练集中的表面线索,在换到新的数据分布时准确率明显下降。
本文作者Daniel Yoo与Adrians Skapars提出一种新的解读:探针泛化失败的关键并非分类器的形式,而是从高维激活空间中选取了错误的子空间。为了验证这一假设,他们在Llama-3.1-8B-Instruct上训练面向欺骗检测的线性探针,并留出三个未见过的欺骗检测数据集作为评测基准。实验显示,如果从训练分布激活中计算主成分(PC),仅取若干方差最大的PC方向上的投影作为探针输入,这些探针在跨域数据上的表现几乎可以与直接使用目标域数据训练出的探针相比。换言之,少数PC所张成的低维子空间已经涵盖了迁移所需的语义信息,而其余方向往往额外引入了源域特有或无益的噪声。
为了自动寻找可迁移的PC,作者构建了一个LLM裁判流程。首先对于每个PC,取在该维度上激活最强和最弱的若干示例,然后让LLM判断这条方向是否与“欺骗/诚实”的语义对相对应,并给出分数。实验表明,在分数最高的PC上训练探针能显著提升跨域结果。具体来说,与不选择特征的基线探针相比,该方法在Insider Trading Report上弥补了基线与理论上界差距的78%,在Sandbagging上弥补了25%。进一步的分析显示,源域探针权重最大的方向往往编码了源数据集特有的表面特征;而那些真正能迁移到新分布的方向,则更抽象地编码了欺骗与诚实这一对比,并且这种语义可以用自然语言描述出来。
这项研究对于模型可解释性和安全审计具有直接意义。它提醒研究者,探针遇到分布外样本时表现不佳,不一定代表模型内部没有可用的概念表征,而可能是特征选择或子空间选择失当。通过对主成分进行结构化的筛选与语义解释,可以减少探针错误报警或漏报的情形,也可以为构建轻量级、跨领域有效的检测器提供依据。当然,论文提出的方法并非没有局限:主成分计算需要收集足够的训练激活,LLM裁判打分也会引入额外的推理成本,且评判质量依赖于LLM对自然语言语义的理解。未来若能够将PC解释过程完全自动化,而不依赖人工标注或强模型判断,这种方法有望在更广泛的安全评测场景中得到落地。该论文于2026年7月1日投稿至arXiv,相关代码与资源可在论文页面查看。