AI News HubLIVE
站內改寫1 分鐘閱讀

活躍SAE特徵平面是否承載更多和樂?Gemma中的預註冊反轉

一項預註冊實驗檢驗了Gemma 2 2B模型中活躍稀疏自編碼器(SAE)特徵平面是否集中更多和樂(holonomy),結果發現活躍特徵平面的和樂實際低於混合特徵控制組,推翻了原假設。研究強調結果為操作性反轉,而非因果結論,原因仍待探索。

來源arXiv Machine Learning作者: Larry Richards

近日,一篇題為《活躍SAE特徵平面是否承載更多和樂?Gemma中的預註冊反轉》的論文在arXiv上發表。該研究針對Gemma 2 2B模型,通過預註冊實驗檢驗了一個具體假設:活躍稀疏自編碼器(SAE)特徵平面是否比非活躍或混合特徵平面承載更多的和樂(holonomy)。和樂在這裏被定義為在殘差流讀取點上,通過局部框架沿小環傳輸並歸一化旋轉量得到的度量。

研究團隊預先設定了實驗設計、重要性閾值、分析和裁決規則,並在查看測量結果前將這些規則凍結。然而,實驗結果表明,原假設被顯著反轉:活躍特徵平面承載的和樂少於匹配的混合特徵控制組,調整後的對數對比度為-0.29439,95%置信區間為[-0.43989, -0.14889]。這一結果推翻了“活躍特徵平面承載更多和樂”的預測。

進一步分析顯示,僅用幅度大小無法解釋這一差異。在匹配幅度下,隨機、混合特徵和活躍特徵平面的三向排序未定義,因為共同支撐失敗。事後診斷在同一個讀取點上驗證了面積律(在小型驗證子集上),並通過簡單配對迴歸約束了匹配中心位移,同時識別出輸運扭曲作為可能的機制或混淆因素。

作者強調,這一結果是嚴格可審計的操作性反轉,而非因果性聲明,即不能據此認定“意義抑制了和樂”。目前,活躍特徵平面承載較少和樂的原因仍然開放,候選機制包括激活強度幾何、特徵參與程度、字典幾何、匹配中心位移、激活流形鄰近性和輸運剪切等。