AI News HubLIVE
サイト内リライト2 分で読了

ReacTOD: ゼロショット対話状態追跡のための有界神経記号エージェントNLU

ReacTODは、決定論的検証によって制御される自己修正ReActループ内でNLUを離散ツール呼び出しとして再構成する有界神経記号アーキテクチャを提案する。MultiWOZ 2.1では、gpt-oss-20Bが52.71%のジョイントゴール精度を達成し、従来の最高値から14ポイント改善。Qwen3-8Bはわずか8Bパラメータで47.34%を達成。SGDベンチマークでは、Claude-Opus-4.6が80.68%のJGAを達成し、クロスベンチマーク汎化を示した。

ソースarXiv Computational Linguistics著者: Yanjun Lin, Zimo Xiao, Kartik Natarajan, Mahesh Sankaranarayanan, Niraj Nawanit, Rakshit Parashar, Austin Zhang, Karthik Konaraddi, Rishita Mote, Wei Niu

タスク指向対話システム(取引、予約、サービスリクエストを処理するもの)には予測可能な動作が求められますが、実用的なレイテンシのために必要な中規模大規模言語モデル(LLM)は幻覚やフォーマットエラーを起こしやすく、これらのエラーが連鎖して誤ったアクション(例えば、間違った日付でのホテル予約)につながります。この問題を解決するため、Yanjun LinらはReacTODを提案しました。これは、決定論的検証によって制御される自己修正ReActループ内で自然言語理解(NLU)を離散ツール呼び出しとして再構成する、有界神経記号アーキテクチャです。

ReacTODの中核は有界ReActループであり、モデルが複数の推論ステップにわたって反復的に自己修正することを可能にします。この方法により、MultiWOZベンチマークでの単一パス推論と比較して精度が最大9.3パーセントポイント向上しました。さらに、記号検証器は各対話状態更新時にアクション準拠、スキーマ適合、照応一貫性を強制し、インターセプトされたエラーの93.1%の自己修正率を達成し、構造化された実行トレースを生成します。インクリメンタルな状態予測とオンデマンドの履歴検索によりプロンプトがコンパクトに保たれ、パラメータ制約のあるモデルでの指示追従が経験的に向上しました。

MultiWOZ 2.1データセットのゼロショット評価では、ReacTODが新たな最高記録を達成しました:gpt-oss-20Bモデルは52.71%のジョイントゴール精度(JGA)を達成し、従来の最高値から14ポイント改善。Qwen3-8Bモデルはわずか8Bパラメータで47.34%のJGAを達成しました。Schema-Guided Dialogue(SGD)ベンチマークでは、Claude-Opus-4.6を用いたReacTODが完全なエンドツーエンド評価で80.68%のJGAを達成し、Qwen3-32Bは64.09%を達成しました。これは、タスク固有のトレーニングデータなしでのクロスベンチマーク汎化を示しています。本論文はACL 2026のTrustNLPワークショップに採択されました。

この成果は、中規模LLMを使用して信頼性の高い対話状態追跡を実現する実用的な方法を提供する点で、対話AI分野にとって重要です。ReacTODの神経記号アプローチは精度を向上させるだけでなく、構造化された実行トレースを通じて解釈可能性を高め、リソース制約のある環境での将来の展開に道を開きます。