DINOv3-MIL:基於基礎模型補丁令牌的腎臟腫瘤和囊腫多標籤檢測
基礎視覺模型在自然影像上訓練後可直接應用於醫學任務,無需領域預訓練。本研究在KiTS23資料集上比較了三種聚合器用於腎臟腫瘤和囊腫檢測,發現門控注意力多例項學習(MIL)效能最佳,腫瘤AUROC為0.74,囊腫為0.80。原型頭部在囊腫檢測上失敗(AUROC 0.51),凸顯了可解釋性與效能之間的權衡。
基礎視覺模型(如DINOv3)在自然影像上預訓練後,無需額外的醫學領域預訓練即可直接遷移至醫學影像任務,但在處理三維體積資料時,需要聚合每例研究中的數萬個補丁令牌,而聚合器的選擇直接影響模型的解釋能力。
本研究在KiTS23資料集(966個腎臟,97例測試)上,基於凍結的DINOv3 ViT-H/16+特徵,比較了三種聚合器用於腎臟腫瘤和囊腫的多標籤檢測:CLS令牌線性探針、基於55,296個補丁令牌的門控注意力多例項學習(MIL),以及遵循ProtoViT的原型頭部。實驗表明,注意力MIL在腫瘤檢測上取得最高AUROC(0.74,95%置信區間0.64-0.83),在囊腫檢測上取得AUROC(0.80,95%置信區間0.70-0.88),且注意力在標註病灶內的富集程度是隨機水平的7.5至9.8倍。
相比之下,原型頭部在囊腫檢測上表現不佳,AUROC僅為0.51,幾乎相當於隨機猜測,而CLS令牌線性探針的效能介於兩者之間。這一結果揭示了在該令牌規模下,模型可解釋性與檢測效能之間存在明顯權衡。注意力MIL透過端到端學習能夠精準定位病灶,但犧牲了部分可解釋性;原型頭部雖然理論上更易解釋,卻難以泛化至囊腫檢測。
該研究已被MIUA 2026會議接收(海報展示),並將發表於《Frontiers in Medical Technology》。研究結果強調了在醫學影像分析中,針對具體任務選擇合適聚合器的重要性,併為未來將基礎模型應用於三維醫學診斷提供了重要參考。