スパースオートエンコーダによる脳波基盤モデルのメカニズム解釈
本研究は、TopKスパースオートエンコーダ(SAE)を3つの異なるアーキテクチャの脳波トランスフォーマー(SleepFM、REVE、LaBraM)に適用し、スパース特徴辞書を抽出する。臨床的分類法(異常、年齢、性別、薬物)を用いて、単意味性と絡まりをベンチマークする。概念ステアリングと「ターゲット対オフターゲット」プローブ領域メトリックにより、3つの動作モード(選択的ステアリング可能、符号化済みだが絡まり、非符号化)を特定し、「wrecking-ball」介入や年齢-病理交絡などの重大な表現失敗を明らかにする。スペクトルデコーダは介入を生理学的に解釈可能な周波数特性にマッピングする。
脳波(EEG)基盤モデルは臨床診断において優れた性能を示すが、その内部計算メカニズムは不透明であり、臨床的信頼を妨げている。本研究チームはこの問題に対処するため、TopKスパースオートエンコーダ(SAE)に基づくメカニズム解釈フレームワークを提案し、SleepFM、REVE、LaBraMという3つの代表的なEEGトランスフォーマーを体系的に分析した。
研究ではまず、TopK SAEを用いてこれらのモデルの埋め込みからスパース特徴辞書を抽出した。特徴の解釈可能性を評価するため、チームは異常、年齢、性別、薬物の4次元からなる臨床的分類法を構築し、この分類法のもとで特徴の単意味性(monosemanticity)と絡まり(entanglement)をベンチマークした。注目すべきは、内在辞書健全性監査によって駆動される単一ハイパーパラメータ手順が、3つのアーキテクチャすべてにロバストに転送されたことである。
概念ステアリングの面では、研究者は新規の「ターゲット対オフターゲット」プローブ領域メトリックを導入し、ステアリングの選択性を定量化した。このメトリックにより、3つの動作モードが明らかになった:選択的にステアリング可能(概念をクリーンに操作できる)、符号化済みだが絡まり(概念は符号化されているが他の概念と絡み合い、単独操作が不可能)、非符号化(概念がモデルに効果的に表現されていない)。このフレームワークは重大な表現失敗を露呈した:一つは「wrecking-ball」介入であり、特定の操作がモデル全体の性能を崩壊させるもの、もう一つは年齢-病理交絡などの臨床的絡まりであり、一方の概念を抑制すると他方を損なうことが避けられない。
最後に、チームはスペクトルデコーダを設計し、介入を振幅スペクトルにマッピングすることで、潜在操作を生理学的に解釈可能な周波数特性(病理的徐波抑制やα波回復など)に変換した。これらの発見は、EEG基盤モデルの内部メカニズムに対する深い理解を提供するだけでなく、将来の臨床展開に向けた信頼性の高い解釈可能性ツールを提供し、AI支援診断に対する医師の信頼を高めることが期待される。