AI News HubLIVE
站内改写1 分钟阅读

先聚焦再诊断:通过主动缩放实现置信度感知的超声VQA

现有视觉语言模型在超声图像问答中表现欠佳,因为它们无法模拟超声技师主动聚焦病灶的认知过程,且忽略了标注的主观性。本文提出一种框架,引入“缩放-诊断”范式和基于不确定性的奖励机制,在GRPO框架下鼓励模型对清晰病例增强准确预测,对模糊病例保持谨慎。在肝脏、乳腺和甲状腺数据集上,病灶定位准确率提升39.3%。

来源arXiv Computer Vision作者: Yue Zhou, Erxuan Wu, Yikang Sun, Hongjoo Lee, Yuan Bi, Huixiong Xu, Zhongliang Jiang

视觉语言模型(VLM)在医学视觉问答任务中取得了显著进展,但在超声影像领域,其性能仍然不够理想。临床实践中,超声技师在生成报告前会明确聚焦于病灶区域,然而由于固有的主观性,不同技师的诊断解读可能存在差异。现有VLM并未内置交互式缩放病灶的能力,而且通常将标注视为无偏真值,忽略了其主观性和模糊性。

针对这一挑战,来自中国的研究团队提出了一种考虑超声技师认知工作流的框架。该框架首先引入结构化的“缩放-诊断”(Zoom-then-Diagnose)范式,通过模拟交互式搜索过程实现病灶聚焦推理。具体来说,模型会主动选择图像中的区域进行放大,然后基于放大后的细节进行诊断决策。这一过程模仿了超声技师在真实临床中的操作方式。

此外,在组相对策略优化(Group Relative Policy Optimization, GRPO)框架内,研究人员设计了一种基于不确定性感知的奖励机制。通过在每次策略更新时进行多次随机组展开,估计模型预测的一致性,并以此作为置信度的代理。如果模型在某个病例上多次预测一致,说明该病例较为清晰,奖励机制会鼓励模型给出准确的答案;反之,如果预测不一致,说明病例存在歧义,模型应该谨慎行事,避免过度自信。

实验在肝脏、乳腺和甲状腺超声数据集上进行,结果显示该框架使病灶定位准确率提升了39.3%,表明模型已经学会了主动“凑近观察”再诊断的能力。这一成果有望推动超声影像自动化诊断的准确性提升,并增强模型对主观性标注的鲁棒性。该论文由Yue Zhou等人撰写,于2026年5月20日提交至arXiv,收录于计算机视觉与模式识别(cs.CV)和人工智能(cs.AI)领域。