LLM-INSTRUCTによる2026年チューリッヒ大学共有タスクへの取り組み:制約認識検索と選択的議論による段落レベルの議論マイニング
LLM-INSTRUCTは、ArgMining 2026のUZH共有タスクで優勝したシステムであり、国連とユネスコ決議における段落レベルの議論マイニングに焦点を当てています。メタデータ認識型の高密度検索で候補タグを絞り込み、次元ごとの上限付き制約デコーディングを適用し、不確実なケースには3エージェントの議論ブランチを使用します。公式リーダーボードで総合1位、F1で1位、LLM-as-a-Judgeで5位を獲得。開発中にTask 1bのMicro-F1を35.83%から40.08%に改善しました。主な教訓:生成前に決定空間を縮小することで、精度と提出の堅牢性が向上します。
LLM-INSTRUCTシステムは、2026年のArgMiningワークショップにおけるUZH共有タスクで優勝し、段落レベルの議論マイニングにおいて注目すべき成果を挙げました。このタスクは、国連およびユネスコ決議を対象として、段落タイプの分類、141個の公式タグのサブセット予測、そして有向関係予測を要求するもので、厳格なJSONスキーマ設定のもと、最大80億パラメータのオープンウェイトモデルのみを使用するという制約がありました。研究チームはこの問題を制約付き構造化予測として捉え、革新的なアプローチを開発しました。
システムのワークフローは、まずメタデータ認識型の高密度検索を用いて候補タグ空間を絞り込み、それにより後続の処理負荷を軽減します。次に、次元ごとの上限を設定した制約デコーディングを適用し、不確実なケースにのみ3エージェントの議論ブランチを起動して詳細な検討を行います。最後に、出力スキーマの検証を実施し、期待されるJSON形式に準拠していることを確認します。この段階的アプローチにより、精度と堅牢性が大幅に向上しました。
公式リーダーボードでは、LLM-INSTRUCTが総合1位を獲得し、F1スコアで1位、LLM-as-a-Judge指標で5位となりました。開発段階では、構成探索を通じてTask 1bのMicro-F1を35.83%から40.08%に改善し、Task 2の内部スコアを4.421に維持しました。研究チームが強調する主要な教訓は、生成前に決定空間を縮小することで精度と提出の安定性が向上するという点です。関連コードとスクリプトはGitHubで公開されており、今後の研究の再現性を高めています。本研究成果は、2026年のACL会議で開催される第13回議論マイニングワークショップで受理されました。
この研究は、自然言語処理技術を法律や政策分析の分野に応用する上で重要な意義を持ちます。大量の国際決議を効率的に分析することで、研究者や政策立案者が複雑な問題を理解するのに役立ちます。また、このシステムの設計思想は、他の制約付きテキスト生成タスクにも応用可能です。