构建快,评估慢:流程选择主导自动可解释性得分方差
研究发现,稀疏自编码器(SAE)的自动可解释性得分受评估流程选择的影响远大于架构差异,导致跨论文比较可能反映的是流程而非架构的差异。
一篇新发表的论文对稀疏自编码器(SAE)的可解释性评估方法提出了尖锐批评。该论文由Sinie van der Ben等人撰写,标题为《Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance》,并已提交至arXiv(编号2607.19386)。研究团队系统性地检验了自动可解释性评分——一种广泛用于衡量SAE特征解释质量的评估流程。在该流程中,一个语言模型(LM)生成对每个特征的自然语言解释,另一个LM则对该解释进行评分。跨论文比较依赖这些得分来评判不同SAE架构的优劣。然而,研究团队通过四个指标(模拟、检测、模糊测试、纯度)、两个模型(Pythia-160M和Apertus-8B)以及四个方法论变体轴的实验发现,这一前提并不成立。
研究得出的三个主要发现是:第一,方法论方差(即评估流程的变化)在所有指标和测试模型上均超过架构方差,意味着选择不同的评估流程对分数的影响大于架构创新。第二,每个指标的稳定性表现各异:检测指标最为稳定,而模糊测试在所有条件下都不可靠。第三,top-k特征排名在不同语料和采样条件下并不一致,尽管平均分数看似稳定,但单个特征的排名可能大幅波动,这种不稳定无法通过仅监控解释相似性来检测。
这些结果表明,基于自动可解释性得分的跨论文比较可能反映的是评估流程的差异而非架构的真实优劣,这对当前关于SAE实用性的辩论具有重要影响。更广泛地说,不可靠的评估拖慢了可解释性研究的进展——而当下正需要可靠的工具来理解AI系统。
为改进评估,作者贡献了一套方差分解方法、一个稳定性检查工具以及一份最低报告清单,旨在帮助研究者识别并控制评估流程中的混淆因素。该论文已提交至arXiv,预印本编号为2607.19386,作者包括Sinie van der Ben以及其他三位共同作者。