構建快,評估慢:流程選擇主導自動可解釋性得分方差
研究發現,稀疏自編碼器(SAE)的自動可解釋性得分受評估流程選擇的影響遠大於架構差異,導致跨論文比較可能反映的是流程而非架構的差異。
一篇新發表的論文對稀疏自編碼器(SAE)的可解釋性評估方法提出了尖鋭批評。該論文由Sinie van der Ben等人撰寫,標題為《Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance》,並已提交至arXiv(編號2607.19386)。研究團隊系統性地檢驗了自動可解釋性評分——一種廣泛用於衡量SAE特徵解釋質量的評估流程。在該流程中,一個語言模型(LM)生成對每個特徵的自然語言解釋,另一個LM則對該解釋進行評分。跨論文比較依賴這些得分來評判不同SAE架構的優劣。然而,研究團隊通過四個指標(模擬、檢測、模糊測試、純度)、兩個模型(Pythia-160M和Apertus-8B)以及四個方法論變體軸的實驗發現,這一前提並不成立。
研究得出的三個主要發現是:第一,方法論方差(即評估流程的變化)在所有指標和測試模型上均超過架構方差,意味着選擇不同的評估流程對分數的影響大於架構創新。第二,每個指標的穩定性表現各異:檢測指標最為穩定,而模糊測試在所有條件下都不可靠。第三,top-k特徵排名在不同語料和採樣條件下並不一致,儘管平均分數看似穩定,但單個特徵的排名可能大幅波動,這種不穩定無法通過僅監控解釋相似性來檢測。
這些結果表明,基於自動可解釋性得分的跨論文比較可能反映的是評估流程的差異而非架構的真實優劣,這對當前關於SAE實用性的辯論具有重要影響。更廣泛地説,不可靠的評估拖慢了可解釋性研究的進展——而當下正需要可靠的工具來理解AI系統。
為改進評估,作者貢獻了一套方差分解方法、一個穩定性檢查工具以及一份最低報告清單,旨在幫助研究者識別並控制評估流程中的混淆因素。該論文已提交至arXiv,預印本編號為2607.19386,作者包括Sinie van der Ben以及其他三位共同作者。