AI News HubLIVE
站內改寫1 分鐘閱讀

基於稀疏自編碼器的腦電圖基礎模型機械可解釋性研究

本研究應用TopK稀疏自編碼器對三種不同架構的腦電圖變形器(SleepFM、REVE、LaBraM)進行機械可解釋性分析,提取特徵詞典,並通過臨牀分類法(異常、年齡、性別、藥物)評估單一語義性和糾纏性。引入概念引導和“目標vs脱靶”探針區域度量,揭示三種操作模式:可選擇引導、編碼但糾纏、未編碼。暴露關鍵表徵失敗如“破壞球”干預和年齡-病理混雜。頻譜解碼器將潛在操作映射到生理可解釋的頻率特徵。

來源arXiv Machine Learning作者: William Lehn-Schi{\o}ler, Magnus Ruud Kj{\ae}r, Rahul Thapa, Magnus Guldberg Pedersen, Anton Storgaard Mosquera, Nick Williams, Radu Gatej, Tue Lehn-Schi{\o}ler, S\'andor Beniczky, Sadasivan Puthusserypady, James Zou, Lars Kai Hansen

腦電圖(EEG)基礎模型在臨牀診斷中展現出卓越性能,但其內部計算機制不透明,阻礙了臨牀信任。本研究團隊針對這一問題,提出了一種基於TopK稀疏自編碼器(SAE)的機械可解釋性框架,並對三種具有代表性的腦電圖變形器——SleepFM、REVE和LaBraM進行了系統性分析。

研究首先應用TopK稀疏自編碼器從這些模型的嵌入中提取稀疏特徵詞典。為了評估特徵的可解釋性,團隊構建了一個臨牀分類法,涵蓋異常、年齡、性別和藥物四個維度,並在此分類法下基準測試了特徵的單一語義性(monosemanticity)和糾纏性(entanglement)。令人關注的是,一種由內在詞典健康審計驅動的單一超參數過程,能夠穩健地在所有三種架構間遷移。

在概念引導(concept steering)方面,研究者引入了一種新穎的“目標vs脱靶”探針區域度量,用於量化引導的選擇性。通過這一度量,他們揭示了三類操作模式:可選擇性地引導(即乾淨地操控特定概念)、編碼但糾纏(概念被編碼但與其他概念糾纏,無法單獨操控)、以及未編碼(概念未被模型有效表徵)。這一框架暴露了關鍵的表徵失敗:一是“破壞球”干預,即某些操作會全面破壞模型性能,例如抑制某個特徵時導致整體輸出崩潰;二是臨牀糾纏,例如年齡與病理的混雜,使得抑制一個概念不可避免地會損壞另一個概念,這在實際應用中尤其危險。

最後,團隊設計了一個頻譜解碼器,將干預措施映射回振幅譜,從而將潛在操作轉化為生理上可解釋的頻率特徵,例如病理慢波抑制和α波恢復。這些發現不僅為EEG基礎模型的內部機制提供了深入理解,也為未來的臨牀部署提供了可靠的可解釋性工具,有望增強醫生對AI輔助診斷的信任。