用于前列腺组织病理学的病理学家注意力对齐报告生成
该研究引入病理学家注意力来训练报告生成模型,通过收集121例前列腺全切片图像的多模态注意力数据集,优化模型注意力对齐,提升了报告生成和视觉问答的性能。
在癌症诊断过程中,病理学家从全切片图像(WSI)中提取关键信息的能力高度依赖于他们的视觉注意力分配。这一选择性过程不仅影响诊断准确性,也为自动化报告生成提供了重要线索。近日,一项由Ruoyu Xue等15位研究者完成的工作,首次将病理学家的视觉注意力引入报告生成模型的训练中,相关论文已被MICCAI 2026接收。
研究团队构建了一个包含121例前列腺WSI的多模态人类注意力数据集。他们在五位病理学家对切片进行诊断时,同步记录了多尺度视口轨迹、口头描述和光标移动,覆盖了Gleason分级模式等五个临床相关组件。这一精细的注释方式为模型学习人类的诊断关注点提供了丰富的基础。
在此基础上,研究者采用注意力对齐损失对两个现有的报告生成模型进行微调。该损失函数通过正则化模型在图像块上的注意力分布,使其尽量接近病理学家的注意力分布。实验中,两种模型采用了不同的内部注意力机制(即图像令牌整合到语言解码器的方式),从而验证了方法的通用性。
评估结果显示,该方法在前列腺癌报告生成和视觉问答任务上均取得显著提升。基于NLP的指标(如BLEU、ROUGE)平均提升了10.9%,而针对五个临床相关报告组件的准确率提高了19.3%。值得一提的是,模型在推理时提取的注意力图(仅需极小的额外计算开销)与病理学家的实际注意力更加一致。这使得生成的报告能够清晰突出对输出影响最大的图像区域,为临床决策提供了更强的可解释性和视觉支持。
这项研究不仅证明了将人类专家注意力嵌入深度学习模型的有效性,也为人工智能辅助病理诊断开辟了新路径。未来,该方法有望推广至其他癌症类型和更广泛的医疗影像分析任务中,从而提升自动化报告的质量和可信度。