AI News HubLIVE
站内改写1 分钟阅读

DS@GT ARC在CheckThat! 2026中的表现:基于LLM的迹线排名与分组奖励建模用于多语言数值声明的验证

该论文介绍了在CLEF 2026 CheckThat!任务2中开发的系统,旨在对英文和阿拉伯语的数值声明进行自动化验证。系统探索了两种方法:基于LoRA微调的LLM验证器,以及轻量级TF-IDF奖励模型。实验结果表明,LLM方法在多数指标上表现更优,尤其在Recall@5上;而奖励模型在处理矛盾类声明时表现更强。子声明分解未能提升性能,反而引入了噪声。对于阿拉伯语,AraBERT模型优于多语言基线。

来源arXiv Computational Linguistics作者: Sagnik Sinha, Shreyas Shrestha

在CLEF 2026 CheckThat!任务2中,数值声明的自动化验证面临语言理解与定量推理的双重挑战。来自佐治亚理工学院DS@GT ARC团队的研究人员提出了一种基于大规模语言模型(LLM)的迹线排名与分组奖励建模系统。该系统专注于英文和阿拉伯语的数值声明验证,通过两种不同方法探索推理迹线的有效利用。该任务要求系统对每个数值声明生成多条推理迹线,并根据这些迹线预测最终判断(支持、反对或矛盾)。

第一种方法采用LoRA技术对LLM验证器进行微调,将每条推理迹线独立视为二分类问题打分,并通过Best-of-N策略选择最终裁决。此外,团队尝试了自适应子声明分解,将复杂声明拆分为更简单的部分后再进行验证。然而,实验结果显示,子声明分解并未提升性能,反而引入了噪声,表明简单的声明拆分可能干扰推理过程,导致模型无法捕捉整体语境。

第二种方法构建轻量级TF-IDF奖励模型,结合手工设计的数值与时间重叠特征对迹线评分,并按裁决分组聚合分数以确定最终预测。这种基于奖励的方法在矛盾类声明的处理上展现出更强的性能,而基于LLM的方法在多数指标上表现卓越,尤其在Recall@5上显著领先。在精确率和F1分数方面,LLM方法也普遍优于奖励模型。然而,奖励模型的优势在于其计算效率高,适合资源受限的场景。

针对阿拉伯语验证,研究团队比较了通用多语言模型(如mBERT)与专门预训练于阿拉伯语的AraBERT模型。结果表明,AraBERT在大多数指标上优于多语言基线,凸显了语言专用模型在特定任务中的价值。该研究还分析了不同语言模型对阿拉伯语数字和日期表达的处理能力,发现AraBERT在理解阿拉伯语特有的数值格式方面更具优势。该研究不仅为数值声明验证提供了有效方案,还揭示了LLM与轻量级方法在不同场景下的优劣,为后续研究提供了重要参考。论文被CLEF 2026 CheckThat!接收,并将发表于CEUR Workshop Proceedings。