跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

以可微子集采样解决乳腺X线摄影视觉语言模型中的大海捞针问题

文章摘要

论文提出TopKSigLIP,一种针对乳腺X线摄影的CLIP风格视觉语言模型(VLM)。该方法引入可学习的TopK-Patch模块,在不牺牲批大小的情况下采样高分辨率病灶疑似图块,并通过基于结构化数据软标签的Sup-sigmoid损失替代对比损失。在密度评估、BI-RADS分类、发现亚型与癌症预测等零样本任务上,TopKSigLIP超越现有开源医学VLM,其病灶定位也优于Grad-CAM。

来源arXiv Computer Vision作者: Young Seok Jeon, Beatrice Brown-Mulry, Rohan Satya Isaac, Anjana Dissanayaka, Theo Dapamede, Mohammadreza Chavoshi, Judy Gichoya, Hari Trivedi
以可微子集采样解决乳腺X线摄影视觉语言模型中的大海捞针问题
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

近年来,将CLIP风格的大规模视觉语言预训练方法用于乳腺X线摄影受到越来越多的关注。此类方法通常将影像与放射报告配对,学习通用的图像与文本表征。然而,如果直接沿用标准的CLIP架构与训练目标,模型在癌症检测、病变类型判断和BI-RADS分级等临床重要任务上的零样本表现往往十分有限。研究者认为,造成这种落差的关键在于乳腺X线摄影数据的两项特征被忽视了:一是图像本身是超高分辨率,二是在大规模筛查人群中,阴性或者良性结果占绝大多数,使得放射报告的内容高度同质。若按照常规做法把图像缩放到较小尺寸以迁就GPU显存上限,微小的钙化或肿块等关键征象会丢失;若保持高分辨率,则又难以放入足够大的训练批次。

针对这些问题,论文提出TopKSigLIP。该模型在视觉编码一侧引入了一个名为TopK-Patch的模块,其核心思想是建立一个可微的采样机制,让模型从整幅高分辨率乳腺X线影像中挑选出一组稀疏但信息量最高的局部图块,并以这些图块代替整图进行训练。TopK-Patch的学习目标不依赖外部检测框标注,而是通过端到端训练自行学会把注意力放到最可能包含病灶的区域。这样一来,模型就能够在GPU内存有限的情况下保留原生高分辨率细节,同时也绕开了以往“分辨率越高、批次越小”的两难取舍。更重要的是,采样得到的图块位置可以直接作为病灶定位的输出,而不需要像常规可解释性方法那样在训练后另行计算Grad-CAM。

在语言与图文匹配一侧,TopKSigLIP改变了传统的对比学习目标。标准CLIP使用的对比损失会把同一个批次中不同的图文对都视为负样本,但在乳腺X线摄影筛查数据集中,大量报告描述的是相似的阴性或良性发现,这样的做法会在语义上错误的推开本来相近的样本。为了克服报告同质性带来的噪声,作者用Sup-sigmoid损失替代对比损失。Sup-sigmoid损失从SigLIP的sigmoid损失出发,利用结构化数据(如BI-RADS分级、密度分类或病理标签)构造软标签,使模型在训练时不仅看到“是否配对”的二值信号,还能利用临床标签表达的相似程度。这种软标签机制有助于模型把语义相近的阴性报告视为弱正相关,而不是强行把它们拆成互斥类别。

实验在内部与外部数据集上验证了TopKSigLIP的有效性。在密度评估、BI-RADS分类、发现亚型和癌症预测等零样本任务中,TopKSigLIP超过了现有的开源乳腺放射影像VLM以及通用医学VLM;即便使用比基线小得多的视觉编码器和更小的训练批次,在线性探测评估下仍能保持竞争力。在病灶定位方面,TopK-Patch模块也明显优于事后计算的Grad-CAM。此外,作者已公开代码与权重。论文由Young Seok Jeon及其他七位作者共同撰写,于2026年9月2日提交至arXiv,编号为arXiv:2609.03085,目前归类于计算机视觉与模式识别(cs.CV)方向。

展开要点与分析

文章情报

工程师进阶

要点

  • TopKSigLIP通过两个关键设计解决标准CLIP在乳腺X线摄影中忽视高分辨率影像与报告同质性的问题。
  • TopK-Patch模块学习采样少量可能包含病灶的高分辨率图块,绕过分辨率-批大小权衡,并提供内建定位线索。
  • Sup-sigmoid损失利用结构化数据的软标签扩展SigLIP的sigmoid损失,避免对比损失错误推开语义相似样本。
  • 在内部与外部基准上的零样本评估中,TopKSigLIP优于现有开源乳腺影像及通用医学VLM,代码与权重已公开。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。