AI News HubLIVE
站內改寫2 分鐘閱讀

LLM-INSTRUCT在2026年蘇黎世大學共享任務中:約束感知檢索與選擇性辯論用於段落級論點挖掘

LLM-INSTRUCT系統在2026年ArgMining的UZH共享任務中獲勝,專注於聯合國和聯合國教科文組織決議的段落級論點挖掘。該系統透過後設資料感知的密集檢索縮小候選標籤空間,應用帶維度上限的約束解碼,對不確定案例使用三智慧體辯論分支,並驗證輸出模式。官方排行榜上總體第一,F1第一,LLM作為評判第五。開發中進一步將Task 1b Micro-F1從35.83%提升至40.08%。主要經驗:生成前縮小決策空間可提高準確性和提交穩健性。

來源arXiv Computational Linguistics作者: Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

LLM-INSTRUCT系統在2026年ArgMining研討會的UZH共享任務中嶄露頭角,成功奪得了段落級論點挖掘領域的冠軍。該任務的目標是從聯合國和聯合國教科文組織的決議中自動提取和分析論點,具體包括三個子任務:段落型別分類、從141個官方標籤中預測相關子集以及有向關係預測。這些任務必須在嚴格的JSON模式設定下完成,且只能使用引數規模不超過80億的開源模型,這給研究帶來了不小的挑戰。研究團隊巧妙地將這一難題轉化為受約束的結構化預測問題,並設計了一套創新的解決方案。

系統的工作流程由多個精心設計的模組組成。首先,利用後設資料感知的密集檢索技術,系統能夠根據段落本身的後設資料資訊快速縮小候選標籤的範圍,極大地減少了後續處理的計算量。接著,應用帶維度上限的約束解碼,確保生成的標籤和關係符合預定義的約束條件。對於置信度較低的案例,系統會觸發一個三智慧體辯論分支,讓多個智慧體從不同角度進行討論和推理,最終達成一致意見。最後,系統會對輸出的JSON結構進行驗證,確保其符合規範。這一流程不僅提高了預測的準確性,還增強了系統在面對不確定情況時的魯棒性。

LLM-INDUCT在官方排行榜上表現卓越,綜合排名第一,其中F1分數位居榜首,而LLM作為評判指標則排名第五。在開發階段,研究團隊透過系統的配置搜尋進一步最佳化了效能,將任務1b的Micro-F1從35.83%提升到了40.08%,同時任務2的內部得分穩定在4.421。這些成果充分證明了該方法在約束條件下的有效性。研究團隊指出,最重要的經驗是:在生成輸出之前儘可能縮小決策空間,這能夠同時提升準確性和提交的穩定性。此外,他們還公開了所有程式碼和指令碼,以便其他研究者復現和進一步探索。該論文已被2026年ACL會議上的第13屆論點挖掘研討會正式接收,標誌著這一工作在學術界的認可。

這一工作對於推動自然語言處理技術在法律和政策分析領域的應用具有重要意義。透過高效準確的論點挖掘,可以輔助分析大量國際決議,幫助研究人員和政策制定者更好地理解複雜議題。此外,該系統的設計思路為其他受約束的文本生成任務提供了有價值的參考。