2026年8月18日,論文《Retrieved-Span Training for Efficient Query-Focused Meeting Summarization on QMSum》(面向 QMSum 的檢索片段訓練:高效查詢聚焦會議摘要)以編號 arXiv:2609.25028v1 提交至 arXiv,歸類於計算與語言(cs.CL)。作者為 Ertas AI 的 Edward Xi Yang,全文共24頁、含4幅圖,提交時間為協調世界時2026年8月18日04:26:31,文件大小181 KB,DOI 為 10.48550/arXiv.2609.25028。
論文首先指出了一個評測層面的結構性問題:QMSum 基準本身沒有提供官方評分器(scorer),這導致面向查詢的會議摘要任務上,不同系統的結果彼此難以直接比較,缺乏統一的對照口徑。為繞開這一障礙,作者在同一套實現下重新評分或重新生成了15個系統的輸出,從而建立可橫向對照的實驗基礎。
在統一推理接口(common inference port)下,作者發現了一個顯著的性能塌陷:一個已發佈的406M參數 Fusion-in-Decoder(FiD)專用模型,當輸入從有長度上限的長文本切換到2,000詞的檢索片段(retrieved spans)時,ROUGE-1 下降6.30。也就是説,輸入組織方式的改變本身就會讓該專用模型損失大量分數。作者隨後在同一片段輸入範式(span regime)上對該模型進行微調,結果顯示這一損失可以被完全恢復。
在測試集上,該406M模型取得36.33 ROUGE-1,而作者自研的1.2B系統為35.41。兩者差值的會議簇(meeting-cluster)95%置信區間為 [-0.27, +2.22],區間跨越零點,因此在 QMSum 上並不能在統計意義上區分這兩個系統。與此同時,較小的系統在總參數量上僅為對照系統的大約三分之一,峯值推理內存不到對方的一半,體現出明顯的效率優勢。
論文還給出了兩組消融式量化結論。第一,在固定的1.2B基座模型內部,採用片段輸入範式進行微調可帶來5.29的提升,置信區間為 [+4.02, +6.56]。第二,將轉錄文本前4,500詞替換為2,000個檢索詞,在測試集上帶來1.55的提升,在驗證集上帶來0.29的提升,説明檢索片段的取捨本身對結果有正向但幅度不一的貢獻。
論文另有一組對比實驗:在單一簡潔提示(one concise prompt)與基於參考重疊的評分器(reference-overlap scorer)設定下,上述已發佈的406M專用模型至少以6.2 ROUGE-1 的優勢超過五個專有託管模型(proprietary hosted models)。不過作者明確指出,該排序受到兩點限制:一是輸出長度的影響未被排除,二是缺乏人工評測與事實性(factuality)評測,因此這一排名不能被過度解讀。
作者的結論邊界也寫得相當剋制:所有結論僅限 QMSum 數據集與自動評測指標(automatic metrics)之內,不應無差別外推到其他會議摘要數據、其他任務形態或人工質量判斷上。論文的註釋信息重申了24頁、4圖的篇幅,並提供了PDF、實驗性HTML與TeX源碼等獲取方式。