速く構築し、ゆっくり評価:パイプライン選択が自動解釈可能性スコアの分散を支配する
この研究は、スパースオートエンコーダの自動解釈可能性スコアがアーキテクチャの違いよりも評価パイプラインの選択によって大きく左右されることを示し、論文間の比較がパイプラインの違いを反映する可能性があると指摘する。
新たに公開された論文が、スパースオートエンコーダ(SAE)の解釈可能性評価手法に鋭い批判を投げかけている。タイトルは「Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance」で、著者らは自動解釈可能性スコアリング——SAEの特徴説明品質を測定するために広く使われる評価パイプライン——を体系的に検証した。このパイプラインでは、1つの言語モデル(LM)が各特徴の自然言語説明を生成し、別のLMがその説明をスコアリングする。異なる論文間の比較はこれらのスコアに依存し、SAEアーキテクチャの優劣を判断するために用いられる。しかし、研究チームは4つの指標(シミュレーション、検出、ファジング、ピュリティ)、2つのモデル(Pythia-160MとApertus-8B)、4つの方法論的変動軸にわたる実験を通じて、この前提が成り立たないことを示した。
主な発見は3つある。第1に、方法論的分散(評価パイプラインの変化)は、すべての指標とテストモデルにおいてアーキテクチャ的分散を上回る。つまり、評価パイプラインの選択がアーキテクチャの革新よりもスコアに大きな影響を与える。第2に、各指標の安定性プロファイルは異なり、検出が最も安定で、ファジングはすべての条件下で信頼性が低い。第3に、top-k特徴ランキングはコーパスや描画条件間で一貫せず、平均スコアは安定しているように見えても個々の特徴のランキングは大きく変動する。この不安定性は、説明の類似性だけを監視しても検出できない。
これらの結果は、自動解釈可能性スコアに基づく論文間比較が、アーキテクチャの真の違いではなく評価パイプラインの違いを反映している可能性を示唆し、SAEの有用性をめぐる現在の議論に重要な影響を与える。より広く見れば、信頼性の低い評価は解釈可能性研究の進展を遅らせており、AIシステムを理解するための信頼できるツールが今まさに必要とされている。
評価を改善するために、著者らは分散分解アプローチ、安定性チェック、および最低限の報告チェックリストを提供している。これらは、研究者が評価パイプラインにおける交絡要因を特定し制御するのに役立つ。本論文はarXivに投稿され、プレプリント番号は2607.19386である。著者はSinie van der Benを含む4名である。