DS@GT ARC在CheckThat! 2026中的表現:基於LLM的跡線排名與分組獎勵建模用於多語言數值聲明的驗證
該論文介紹了在CLEF 2026 CheckThat!任務2中開發的系統,旨在對英文和阿拉伯語的數值聲明進行自動化驗證。系統探索了兩種方法:基於LoRA微調的LLM驗證器,以及輕量級TF-IDF獎勵模型。實驗結果表明,LLM方法在多數指標上表現更優,尤其在Recall@5上;而獎勵模型在處理矛盾類聲明時表現更強。子聲明分解未能提升性能,反而引入了噪聲。對於阿拉伯語,AraBERT模型優於多語言基線。
在CLEF 2026 CheckThat!任務2中,數值聲明的自動化驗證面臨語言理解與定量推理的雙重挑戰。來自佐治亞理工學院DS@GT ARC團隊的研究人員提出了一種基於大規模語言模型(LLM)的跡線排名與分組獎勵建模系統。該系統專注於英文和阿拉伯語的數值聲明驗證,通過兩種不同方法探索推理跡線的有效利用。該任務要求系統對每個數值聲明生成多條推理跡線,並根據這些跡線預測最終判斷(支持、反對或矛盾)。
第一種方法採用LoRA技術對LLM驗證器進行微調,將每條推理跡線獨立視為二分類問題打分,並通過Best-of-N策略選擇最終裁決。此外,團隊嘗試了自適應子聲明分解,將複雜聲明拆分為更簡單的部分後再進行驗證。然而,實驗結果顯示,子聲明分解並未提升性能,反而引入了噪聲,表明簡單的聲明拆分可能干擾推理過程,導致模型無法捕捉整體語境。
第二種方法構建輕量級TF-IDF獎勵模型,結合手工設計的數值與時間重疊特徵對跡線評分,並按裁決分組聚合分數以確定最終預測。這種基於獎勵的方法在矛盾類聲明的處理上展現出更強的性能,而基於LLM的方法在多數指標上表現卓越,尤其在Recall@5上顯著領先。在精確率和F1分數方面,LLM方法也普遍優於獎勵模型。然而,獎勵模型的優勢在於其計算效率高,適合資源受限的場景。
針對阿拉伯語驗證,研究團隊比較了通用多語言模型(如mBERT)與專門預訓練於阿拉伯語的AraBERT模型。結果表明,AraBERT在大多數指標上優於多語言基線,凸顯了語言專用模型在特定任務中的價值。該研究還分析了不同語言模型對阿拉伯語數字和日期表達的處理能力,發現AraBERT在理解阿拉伯語特有的數值格式方面更具優勢。該研究不僅為數值聲明驗證提供了有效方案,還揭示了LLM與輕量級方法在不同場景下的優劣,為後續研究提供了重要參考。論文被CLEF 2026 CheckThat!接收,並將發表於CEUR Workshop Proceedings。