QMSumはクエリ焦点型の会議要約データセットだが、標準的なスコアラーが長く存在せず、異なるシステム間の結果を比較することが難しかった。本論文はこの問題に対処するため、単一の実装フレームワークの下で15のシステムを再評価または再生成し、比較可能なベンチマークを構築した。
共通の推論ポートを用いた検証では、公開済みの406M Fusion-in-Decoder専用モデルは、上限付きの長い入力から2,000語の検索スパンへ切り替えるとROUGE-1が6.30低下した。しかし、このスパン方式でモデルを微調整すると、その損失は回復する。テストセットにおいて同モデルは36.33 ROUGE-1を記録し、本論文の1.2Bシステムは35.41であった。会議クラスタ単位で算出した差の95%信頼区間は[-0.27, +2.22]であり、QMSumは統計的に両者を区別できない。なお、より小さいシステムの総パラメータ数は約3分の1、ピーク推論メモリは半分未満である。
固定した1.2Bのベースモデル内部では、スパン方式の微調整が5.29の改善をもたらし、その信頼区間は[+4.02, +6.56]であった。また、転写テキストの最初の4,500語を2,000の検索語に置き換えると、テストセットで1.55、検証セットで0.29の向上が見られた。これらは、検索スパン方式の訓練と推論が品質を保ちながら資源消費を大きく削減できることを示している。
さらに、単一の簡潔なプロンプトと参照重複スコアラーを用いた設定では、公開済みの406M専用モデルが5つの商用ホスト型モデルを少なくとも6.2 ROUGE-1上回った。ただし、出力長や人手評価・事実性評価の欠如により、この順位付けの信頼性には制約がある。著者らは結論がQMSumと自動指標に限定されることを明示している。
本論文は全24ページ、図4点からなり、2026年8月18日に投稿された。分野は計算と言語(cs.CL)で、著者はEdward Xi Yang(Ertas AI)である。