EpiNarrate:从流行病学情景预测中生成本地化叙述的智能框架
本文介绍EpiNarrate,一种用于公共卫生报告生成的智能框架,将结构化数值推理与自然语言生成分离。框架通过部分有序模式提取情景轴,构建增强数据集,并采用比较语法确保语义和算术一致性,同时利用最大熵原理驱动的有趣性选择机制平衡覆盖与非冗余。在COVID-19情景建模中心上的实验表明,该模型生成的叙述具有更好的事实基础和更广泛的流行病学模式覆盖。
在公共卫生领域,将复杂的流行病学预测转化为清晰易懂的叙述对于政策制定者和公众至关重要。然而,传统的预测报告往往只是列举数字,缺乏多维度的背景化和定量支撑。直接使用大语言模型(LLM)总结和情境化这类数据,常常导致不一致、遗漏和脆弱行为。为此,研究人员提出了EpiNarrate框架,该框架将结构化数值推理与自然语言生成分开处理。
EpiNarrate首先从预测数据中提取情景轴,并将其组织成部分有序模式,从而系统化地遍历潜在的多维空间。这些情景轴包括干预措施假设、地理和人口分层、结果、时间范围和不确定性分位数等多维要素。接着,框架构建增强数据集,并通过比较语法(一种强制语义和算术一致性的机制)推导出有效的定量陈述。比较语法确保生成的陈述在数学上正确且语义上合理,例如“住院率在干预A下比干预B低30%”这类表述。
为了在覆盖面和避免冗余之间取得平衡,EpiNarrate引入了一种基于最大熵原理的有趣性驱动选择机制。该机制选择那些信息量最大且不重复的陈述,从而生成简洁而全面的叙述。研究者在COVID-19情景建模中心的数据上对EpiNarrate进行了实验,该数据集包含来自多个模型的预测结果。结果显示,与直接使用LLM的方法相比,EpiNarrate生成的叙述在事实准确性上显著提升,并且更广泛地覆盖了重要的流行病学模式,同时保持了专家撰写报告的风格。这项研究为自动化公共卫生报告生成提供了新的思路,有望在未来的疫情应对中发挥重要作用。