2026年8月18日,论文《Retrieved-Span Training for Efficient Query-Focused Meeting Summarization on QMSum》(面向 QMSum 的检索片段训练:高效查询聚焦会议摘要)以编号 arXiv:2609.25028v1 提交至 arXiv,归类于计算与语言(cs.CL)。作者为 Ertas AI 的 Edward Xi Yang,全文共24页、含4幅图,提交时间为协调世界时2026年8月18日04:26:31,文件大小181 KB,DOI 为 10.48550/arXiv.2609.25028。
论文首先指出了一个评测层面的结构性问题:QMSum 基准本身没有提供官方评分器(scorer),这导致面向查询的会议摘要任务上,不同系统的结果彼此难以直接比较,缺乏统一的对照口径。为绕开这一障碍,作者在同一套实现下重新评分或重新生成了15个系统的输出,从而建立可横向对照的实验基础。
在统一推理接口(common inference port)下,作者发现了一个显著的性能塌陷:一个已发布的406M参数 Fusion-in-Decoder(FiD)专用模型,当输入从有长度上限的长文本切换到2,000词的检索片段(retrieved spans)时,ROUGE-1 下降6.30。也就是说,输入组织方式的改变本身就会让该专用模型损失大量分数。作者随后在同一片段输入范式(span regime)上对该模型进行微调,结果显示这一损失可以被完全恢复。
在测试集上,该406M模型取得36.33 ROUGE-1,而作者自研的1.2B系统为35.41。两者差值的会议簇(meeting-cluster)95%置信区间为 [-0.27, +2.22],区间跨越零点,因此在 QMSum 上并不能在统计意义上区分这两个系统。与此同时,较小的系统在总参数量上仅为对照系统的大约三分之一,峰值推理内存不到对方的一半,体现出明显的效率优势。
论文还给出了两组消融式量化结论。第一,在固定的1.2B基座模型内部,采用片段输入范式进行微调可带来5.29的提升,置信区间为 [+4.02, +6.56]。第二,将转录文本前4,500词替换为2,000个检索词,在测试集上带来1.55的提升,在验证集上带来0.29的提升,说明检索片段的取舍本身对结果有正向但幅度不一的贡献。
论文另有一组对比实验:在单一简洁提示(one concise prompt)与基于参考重叠的评分器(reference-overlap scorer)设定下,上述已发布的406M专用模型至少以6.2 ROUGE-1 的优势超过五个专有托管模型(proprietary hosted models)。不过作者明确指出,该排序受到两点限制:一是输出长度的影响未被排除,二是缺乏人工评测与事实性(factuality)评测,因此这一排名不能被过度解读。
作者的结论边界也写得相当克制:所有结论仅限 QMSum 数据集与自动评测指标(automatic metrics)之内,不应无差别外推到其他会议摘要数据、其他任务形态或人工质量判断上。论文的注释信息重申了24页、4图的篇幅,并提供了PDF、实验性HTML与TeX源码等获取方式。