AI News HubLIVE
站内改写1 分钟阅读

乳腺筛查AI中的数据集来源特征与捷径学习:跨数据集案例研究

一项研究评估了在乳腺筛查AI中引入异常丰富的活检确认病例的效果,发现混合数据集会导致性能下降,因为数据集特定特征产生了域偏移,抵消了额外阳性病例的益处。

来源arXiv Computer Vision作者: Parham Hajishafiezahramini, Matthew Hamilton, Oscar Meruvia-Pastor, Edward Kendall

一篇发表在arXiv上的新研究论文《Dataset-Origin Signatures and Shortcut Learning in Screening Mammography AI: A Cross-Dataset Case Study》探讨了在乳腺筛查人工智能(AI)中,使用来自异常丰富的外部数据集的活检确认病例是否能够提升模型性能。研究团队由Parham Hajishafiezahramini等人组成,利用纽芬兰与拉布拉多乳腺筛查数据集(NLBSD)以及CBIS-DDSM和CMMD两个外部数据集,评估了一个基于Mammo-CLIP权重的EfficientNet-B5编码器作为冻结线性探针的效果,并采用一致的预处理和患者级别划分。

结果显示,仅使用NLBSD训练的模型AUC-ROC达到0.737(95% CI [0.686, 0.785])。然而,在添加外部阳性病例后,所有配置下的性能均下降,AUC-ROC在0.620至0.644之间,且经DeLong检验和Holm校正后p值小于0.05。当训练和测试域一致时,域匹配评估仅带来微小提升,但没有任何配置超越NLBSD-only模型。

作为诊断手段,研究将任务重新定义为预测每次检查的数据集来源,结果发现即使经过相同预处理,数据集之间几乎完全可分离,表明数据集特定特征显著影响了学习到的表示。这些发现表明,简单地将异常丰富的乳腺X线数据集混合可能会引入域偏移,其负面影响超过额外阳性病例带来的正面效果。研究强调,在采集、强度映射和数据集构建方面的差异在标准化后依然存在,因此需要采取域感知策略来有效整合异质乳腺X线数据集。

这一发现对乳腺筛查AI的开发具有重要启示:单纯增加外部数据量并不能保证性能提升,反而可能引入偏见。未来的研究应关注如何设计域适应或域泛化方法,使模型能够学习到与数据集无关的病理特征。