PathReportEval:病理报告生成的系统基准测试
提出PathReportEval,一个用于病理报告生成的标准化基准和评估框架。该框架在三个数据集(TCGA、HistAI、REG 2025)上评估四种代表性方法,使用三种病理基础编码器(CONCHv1.5、UNI2-h、H-Optimus-1)。核心贡献是临床报告质量评分(CRQS),一种基于临床事实准确性的度量标准,从临床事实覆盖、关键信息召回、幻觉率和临床不一致性四个维度评估报告质量。实验表明,传统语言生成指标与临床正确性关联薄弱,而CRQS能揭示有临床意义的差异。
病理报告生成是将全切片图像(WSI)转化为结构化文本报告的多模态学习问题,近年来发展迅速。然而,由于现有研究使用异构数据集、模型设置、视觉编码器和评估协议,进展难以衡量。常用的自然语言生成指标,如BLEU、ROUGE和METEOR,主要奖励词汇相似性,常常无法检测临床重要错误,例如遗漏诊断、虚构发现或肿瘤属性不一致。这些指标在临床环境中可能产生误导,因为它们高估了报告质量,而忽略了事实正确性。
为了应对这些挑战,研究人员提出了PathReportEval——一个标准化基准和评估框架。该基准在三个公开数据集(TCGA、HistAI和REG 2025)上评估了四种有代表性的方法,并使用三种病理学基础编码器(CONCHv1.5、UNI2-h和H-Optimus-1)。该框架标准化了预处理、特征提取、训练、解码和评估流程,使得不同模型之间能够进行公平比较,同时提供了模块化平台以便集成新方法、数据集和编码器。这种模块化设计允许研究社区灵活添加新的视觉编码器或语言模型,从而推动该领域的快速发展。
PathReportEval的核心贡献是临床报告质量评分(CRQS),这是一种基于临床事实正确性的度量标准。CRQS将参考报告和生成报告映射到结构化的临床属性,并测量四个互补维度:临床事实覆盖率、关键信息召回率、幻觉率和临床不一致性,从而产生一个总体分数以及可解释的子分数。临床事实覆盖率衡量报告包含的真实临床事实的比例;关键信息召回率评估重要发现(如诊断、肿瘤分期)是否被正确提及;幻觉率则检测生成报告中虚构的内容;临床不一致性则关注与参考报告的矛盾之处。这种多维度的评估方式能够全面反映报告的质量。
实验结果表明,传统的语言生成指标与临床正确性弱相关,且常常高估报告质量。例如,一个生成报告可能因为词汇匹配度高而获得高BLEU分数,但可能漏掉了关键的诊断信息或包含了虚构的发现。相比之下,CRQS能够揭示模型和编码器之间具有临床意义的差异,而词汇指标无法捕捉这些差异。PathReportEval基准、公开的即插即用框架以及CRQS共同为病理报告生成的严格评估建立了可复现的基础。该工作对临床AI的应用具有重要意义,因为它提供了可靠的工具来评估模型是否能够生成准确、无幻觉的病理报告,从而提升患者安全。