乳腺篩查AI中的數據集來源特徵與捷徑學習:跨數據集案例研究
一項研究評估了在乳腺篩查AI中引入異常豐富的活檢確認病例的效果,發現混合數據集會導致性能下降,因為數據集特定特徵產生了域偏移,抵消了額外陽性病例的益處。
一篇發表在arXiv上的新研究論文《Dataset-Origin Signatures and Shortcut Learning in Screening Mammography AI: A Cross-Dataset Case Study》探討了在乳腺篩查人工智能(AI)中,使用來自異常豐富的外部數據集的活檢確認病例是否能夠提升模型性能。研究團隊由Parham Hajishafiezahramini等人組成,利用紐芬蘭與拉布拉多乳腺篩查數據集(NLBSD)以及CBIS-DDSM和CMMD兩個外部數據集,評估了一個基於Mammo-CLIP權重的EfficientNet-B5編碼器作為凍結線性探針的效果,並採用一致的預處理和患者級別劃分。
結果顯示,僅使用NLBSD訓練的模型AUC-ROC達到0.737(95% CI [0.686, 0.785])。然而,在添加外部陽性病例後,所有配置下的性能均下降,AUC-ROC在0.620至0.644之間,且經DeLong檢驗和Holm校正後p值小於0.05。當訓練和測試域一致時,域匹配評估僅帶來微小提升,但沒有任何配置超越NLBSD-only模型。
作為診斷手段,研究將任務重新定義為預測每次檢查的數據集來源,結果發現即使經過相同預處理,數據集之間幾乎完全可分離,表明數據集特定特徵顯著影響了學習到的表示。這些發現表明,簡單地將異常豐富的乳腺X線數據集混合可能會引入域偏移,其負面影響超過額外陽性病例帶來的正面效果。研究強調,在採集、強度映射和數據集構建方面的差異在標準化後依然存在,因此需要採取域感知策略來有效整合異質乳腺X線數據集。
這一發現對乳腺篩查AI的開發具有重要啓示:單純增加外部數據量並不能保證性能提升,反而可能引入偏見。未來的研究應關注如何設計域適應或域泛化方法,使模型能夠學習到與數據集無關的病理特徵。