AI News HubLIVE
站内改写2 分钟阅读

MedFM-Robust:医学基础模型鲁棒性基准测试

MedFM-Robust是一个新的基准测试框架,用于评估医学基础模型在真实世界条件下的鲁棒性,涵盖医学视觉语言模型和分割基础模型。

来源arXiv Computer Vision作者: Xiangxiang Cui, Tianjin Huang, Yifang Wang, Lijie Hu, Lu Yin

医学基础模型(MedFMs)正迅速成为医疗领域的变革性工具,展现出在多种临床应用中超越传统方法的潜力。这些模型大致可以分为两个主要的范式:医学视觉语言模型(Med-VLMs)和分割基础模型。Med-VLMs的范畴涵盖了从专门为医学影像设计的模型,如LLaVA-Med和MedGemma,到通用大型语言模型如GPT-4o和Gemini,这些模型能够执行一系列医学图像理解任务,包括视觉问答(VQA)、自动报告生成和视觉定位。例如,医生可以借助这些模型快速解读影像并生成诊断建议。另一方面,分割基础模型以Segment Anything Model(SAM)为基础,通过针对医学领域的适配,产生了如SAM-Med2D和MedSAM等专业版本,能够精确分割器官或病变区域。这些模型在研究和临床辅助中展现了巨大价值。然而,现阶段大多数模型在标准公开数据集上表现优异,但在真实的临床环境中,它们可能遇到各种挑战,例如不同的成像设备、扫描参数、患者体位、噪声水平、伪影以及数据分布的偏移等。这些因素可能导致模型性能大幅下降,甚至产生错误的输出,从而危及患者安全。因此,在将MedFMs部署到临床使用之前,对其鲁棒性进行系统、严格的评估是不可或缺的。正是为了应对这一需求,来自多机构的研究团队提出了MedFM-Robust基准测试框架。该基准测试专门设计用于评估医学基础模型在真实世界条件下的可靠性和稳定性。MedFM-Robust包含多个评估维度,涵盖图像质量退化、域迁移、对抗性攻击等多种典型干扰场景。通过标准化的评估协议,该基准能够量化模型在不同程度的干扰下性能下降的幅度,使得不同模型之间的比较成为可能。研究团队利用该基准对多种主流MedFMs进行了初步评估,揭示了当前模型在鲁棒性方面的不足。该工作已正式被MICCAI 2026接收,作为论文发表于计算机视觉与模式识别领域。论文由Xiangxiang Cui与其他四位合作者共同完成,于2026年5月18日提交至arXiv预印本平台,论文编号为2605.19027。这一基准的建立不仅为学术研究提供了标准化的评估工具,也为医疗人工智能产品的开发者和监管者提供了重要的参考。随着MedFMs逐步走向临床应用,MedFM-Robust有望成为推动该领域安全、可靠发展的关键里程碑。