AI News HubLIVE
站内改写1 分钟阅读

基于稀疏自编码器的脑电图基础模型机械可解释性研究

本研究应用TopK稀疏自编码器对三种不同架构的脑电图变形器(SleepFM、REVE、LaBraM)进行机械可解释性分析,提取特征词典,并通过临床分类法(异常、年龄、性别、药物)评估单一语义性和纠缠性。引入概念引导和“目标vs脱靶”探针区域度量,揭示三种操作模式:可选择引导、编码但纠缠、未编码。暴露关键表征失败如“破坏球”干预和年龄-病理混杂。频谱解码器将潜在操作映射到生理可解释的频率特征。

来源arXiv Machine Learning作者: William Lehn-Schi{\o}ler, Magnus Ruud Kj{\ae}r, Rahul Thapa, Magnus Guldberg Pedersen, Anton Storgaard Mosquera, Nick Williams, Radu Gatej, Tue Lehn-Schi{\o}ler, S\'andor Beniczky, Sadasivan Puthusserypady, James Zou, Lars Kai Hansen

脑电图(EEG)基础模型在临床诊断中展现出卓越性能,但其内部计算机制不透明,阻碍了临床信任。本研究团队针对这一问题,提出了一种基于TopK稀疏自编码器(SAE)的机械可解释性框架,并对三种具有代表性的脑电图变形器——SleepFM、REVE和LaBraM进行了系统性分析。

研究首先应用TopK稀疏自编码器从这些模型的嵌入中提取稀疏特征词典。为了评估特征的可解释性,团队构建了一个临床分类法,涵盖异常、年龄、性别和药物四个维度,并在此分类法下基准测试了特征的单一语义性(monosemanticity)和纠缠性(entanglement)。令人关注的是,一种由内在词典健康审计驱动的单一超参数过程,能够稳健地在所有三种架构间迁移。

在概念引导(concept steering)方面,研究者引入了一种新颖的“目标vs脱靶”探针区域度量,用于量化引导的选择性。通过这一度量,他们揭示了三类操作模式:可选择性地引导(即干净地操控特定概念)、编码但纠缠(概念被编码但与其他概念纠缠,无法单独操控)、以及未编码(概念未被模型有效表征)。这一框架暴露了关键的表征失败:一是“破坏球”干预,即某些操作会全面破坏模型性能,例如抑制某个特征时导致整体输出崩溃;二是临床纠缠,例如年龄与病理的混杂,使得抑制一个概念不可避免地会损坏另一个概念,这在实际应用中尤其危险。

最后,团队设计了一个频谱解码器,将干预措施映射回振幅谱,从而将潜在操作转化为生理上可解释的频率特征,例如病理慢波抑制和α波恢复。这些发现不仅为EEG基础模型的内部机制提供了深入理解,也为未来的临床部署提供了可靠的可解释性工具,有望增强医生对AI辅助诊断的信任。