AI News HubLIVE
站内改写1 分钟阅读

DINOv3-MIL:基于基础模型补丁令牌的肾脏肿瘤和囊肿多标签检测

基础视觉模型在自然图像上训练后可直接应用于医学任务,无需领域预训练。本研究在KiTS23数据集上比较了三种聚合器用于肾脏肿瘤和囊肿检测,发现门控注意力多实例学习(MIL)性能最佳,肿瘤AUROC为0.74,囊肿为0.80。原型头部在囊肿检测上失败(AUROC 0.51),凸显了可解释性与性能之间的权衡。

来源arXiv Computer Vision作者: Vishalakshi M, Sahil Sharma, Pramod Kumar P

基础视觉模型(如DINOv3)在自然图像上预训练后,无需额外的医学领域预训练即可直接迁移至医学影像任务,但在处理三维体积数据时,需要聚合每例研究中的数万个补丁令牌,而聚合器的选择直接影响模型的解释能力。

本研究在KiTS23数据集(966个肾脏,97例测试)上,基于冻结的DINOv3 ViT-H/16+特征,比较了三种聚合器用于肾脏肿瘤和囊肿的多标签检测:CLS令牌线性探针、基于55,296个补丁令牌的门控注意力多实例学习(MIL),以及遵循ProtoViT的原型头部。实验表明,注意力MIL在肿瘤检测上取得最高AUROC(0.74,95%置信区间0.64-0.83),在囊肿检测上取得AUROC(0.80,95%置信区间0.70-0.88),且注意力在标注病灶内的富集程度是随机水平的7.5至9.8倍。

相比之下,原型头部在囊肿检测上表现不佳,AUROC仅为0.51,几乎相当于随机猜测,而CLS令牌线性探针的性能介于两者之间。这一结果揭示了在该令牌规模下,模型可解释性与检测性能之间存在明显权衡。注意力MIL通过端到端学习能够精准定位病灶,但牺牲了部分可解释性;原型头部虽然理论上更易解释,却难以泛化至囊肿检测。

该研究已被MIUA 2026会议接收(海报展示),并将发表于《Frontiers in Medical Technology》。研究结果强调了在医学影像分析中,针对具体任务选择合适聚合器的重要性,并为未来将基础模型应用于三维医学诊断提供了重要参考。