AI News HubLIVE
站内改写2 分钟阅读

LLM-INSTRUCT在2026年苏黎世大学共享任务中:约束感知检索与选择性辩论用于段落级论点挖掘

LLM-INSTRUCT系统在2026年ArgMining的UZH共享任务中获胜,专注于联合国和联合国教科文组织决议的段落级论点挖掘。该系统通过元数据感知的密集检索缩小候选标签空间,应用带维度上限的约束解码,对不确定案例使用三智能体辩论分支,并验证输出模式。官方排行榜上总体第一,F1第一,LLM作为评判第五。开发中进一步将Task 1b Micro-F1从35.83%提升至40.08%。主要经验:生成前缩小决策空间可提高准确性和提交稳健性。

来源arXiv Computational Linguistics作者: Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

LLM-INSTRUCT系统在2026年ArgMining研讨会的UZH共享任务中崭露头角,成功夺得了段落级论点挖掘领域的冠军。该任务的目标是从联合国和联合国教科文组织的决议中自动提取和分析论点,具体包括三个子任务:段落类型分类、从141个官方标签中预测相关子集以及有向关系预测。这些任务必须在严格的JSON模式设置下完成,且只能使用参数规模不超过80亿的开源模型,这给研究带来了不小的挑战。研究团队巧妙地将这一难题转化为受约束的结构化预测问题,并设计了一套创新的解决方案。

系统的工作流程由多个精心设计的模块组成。首先,利用元数据感知的密集检索技术,系统能够根据段落本身的元数据信息快速缩小候选标签的范围,极大地减少了后续处理的计算量。接着,应用带维度上限的约束解码,确保生成的标签和关系符合预定义的约束条件。对于置信度较低的案例,系统会触发一个三智能体辩论分支,让多个智能体从不同角度进行讨论和推理,最终达成一致意见。最后,系统会对输出的JSON结构进行验证,确保其符合规范。这一流程不仅提高了预测的准确性,还增强了系统在面对不确定情况时的鲁棒性。

LLM-INDUCT在官方排行榜上表现卓越,综合排名第一,其中F1分数位居榜首,而LLM作为评判指标则排名第五。在开发阶段,研究团队通过系统的配置搜索进一步优化了性能,将任务1b的Micro-F1从35.83%提升到了40.08%,同时任务2的内部得分稳定在4.421。这些成果充分证明了该方法在约束条件下的有效性。研究团队指出,最重要的经验是:在生成输出之前尽可能缩小决策空间,这能够同时提升准确性和提交的稳定性。此外,他们还公开了所有代码和脚本,以便其他研究者复现和进一步探索。该论文已被2026年ACL会议上的第13届论点挖掘研讨会正式接收,标志着这一工作在学术界的认可。

这一工作对于推动自然语言处理技术在法律和政策分析领域的应用具有重要意义。通过高效准确的论点挖掘,可以辅助分析大量国际决议,帮助研究人员和政策制定者更好地理解复杂议题。此外,该系统的设计思路为其他受约束的文本生成任务提供了有价值的参考。