医学视觉问答(Med-VQA)通常被认为需要医学微调、大型模型或复杂的多智能体流程。于2026年9月3日提交至arXiv的一篇论文提出了一种名为MedProb的轻量级探测框架,对这一假设提出质疑。该框架从冻结的视觉语言模型(VLM)的内部表征中直接预测多项选择答案,完全避免自由文本生成,从而绕开了生成式评估可能引入的噪声与偏差。
研究团队在PATH-VQA、SLAKE和VQA-RAD三个公开的医学视觉问答基准上进行了实验。结果显示,MedProb能够比提示工程(prompting)恢复出多得多的答案相关信息,并且表现优于医学专用的VLM以及更复杂的智能体系统。这表明,在医学视觉问答任务中,未必需要昂贵的领域微调或庞大的模型规模,冻结模型内部本身就携带足够的决策信号,只是需要合适的读取方式。
一个值得关注的发现是,使用探测方法时,小型VLM与大型VLM之间的表现差距显著缩小。相比之下,基于生成的评估方法让小型模型看起来明显更弱。这提示我们,小型VLM中实际包含的可恢复医学问答信号比生成式评估所揭示的更多,评估方式的选择会极大影响我们对模型能力的判断。
论文还比较了14对通用模型与医学适配模型的线性可解码性。结果显示,医学领域的适应(medical adaptation)并不一致地改善模型内部表征的可探测性。换句话说,经过医学数据调整的模型未必更容易通过线性探针提取出正确答案相关的信息。这一结论对目前普遍采用的“先适应后评估”范式提出了新的审视角度。
此外,作者揭示了生成式自由文本评估中存在一种答案位置偏差,最高可达10个百分点:正确答案在选项中的位置会影响模型的表现。MedProb虽然同样存在位置偏差,但其受影响的方式与提示工程不同。这一差异为理解VLM的决策机制提供了新的线索,同时也提醒研究者在比较不同方法时需要格外注意选项顺序带来的混淆效应。
MedProb的主要实验聚焦于多项选择和多元分类设定。作者还额外提出了一种基于拒绝采样打分的过程,将探针扩展到开放式医学问答生成中。该研究已被EMNLP Findings 2026接收,作者包括Erfan Nourbakhsh等人。