AI News HubLIVE
站内改写1 分钟阅读

活跃SAE特征平面是否承载更多和乐?Gemma中的预注册反转

一项预注册实验检验了Gemma 2 2B模型中活跃稀疏自编码器(SAE)特征平面是否集中更多和乐(holonomy),结果发现活跃特征平面的和乐实际低于混合特征控制组,推翻了原假设。研究强调结果为操作性反转,而非因果结论,原因仍待探索。

来源arXiv Machine Learning作者: Larry Richards

近日,一篇题为《活跃SAE特征平面是否承载更多和乐?Gemma中的预注册反转》的论文在arXiv上发表。该研究针对Gemma 2 2B模型,通过预注册实验检验了一个具体假设:活跃稀疏自编码器(SAE)特征平面是否比非活跃或混合特征平面承载更多的和乐(holonomy)。和乐在这里被定义为在残差流读取点上,通过局部框架沿小环传输并归一化旋转量得到的度量。

研究团队预先设定了实验设计、重要性阈值、分析和裁决规则,并在查看测量结果前将这些规则冻结。然而,实验结果表明,原假设被显著反转:活跃特征平面承载的和乐少于匹配的混合特征控制组,调整后的对数对比度为-0.29439,95%置信区间为[-0.43989, -0.14889]。这一结果推翻了“活跃特征平面承载更多和乐”的预测。

进一步分析显示,仅用幅度大小无法解释这一差异。在匹配幅度下,随机、混合特征和活跃特征平面的三向排序未定义,因为共同支撑失败。事后诊断在同一个读取点上验证了面积律(在小型验证子集上),并通过简单配对回归约束了匹配中心位移,同时识别出输运扭曲作为可能的机制或混淆因素。

作者强调,这一结果是严格可审计的操作性反转,而非因果性声明,即不能据此认定“意义抑制了和乐”。目前,活跃特征平面承载较少和乐的原因仍然开放,候选机制包括激活强度几何、特征参与程度、字典几何、匹配中心位移、激活流形邻近性和输运剪切等。