AI News HubLIVE
站內改寫1 分鐘閱讀

ReacTOD:用於零樣本對話狀態跟蹤的有界神經符號代理NLU

ReacTOD提出了一種有界神經符號架構,將NLU重新構造為自糾正ReAct循環中的離散工具調用,通過確定性驗證實現迭代自糾正。在MultiWOZ 2.1上,gpt-oss-20B達到52.71%的聯合目標準確率,超越此前最佳14個百分點;Qwen3-8B以僅8B參數達到47.34%。在SGD基準上,Claude-Opus-4.6實現80.68%的JGA,展示跨基準泛化能力。

來源arXiv Computational Linguistics作者: Yanjun Lin, Zimo Xiao, Kartik Natarajan, Mahesh Sankaranarayanan, Niraj Nawanit, Rakshit Parashar, Austin Zhang, Karthik Konaraddi, Rishita Mote, Wei Niu

任務導向對話系統(如處理交易、預訂和服務請求)需要可預測的行為,但實際部署中為滿足延遲要求而使用的中等規模大語言模型(LLM)容易出現幻覺和格式錯誤,這些錯誤會級聯導致不正確的操作(例如,酒店預訂了錯誤的日期)。為解決這一問題,Yanjun Lin等研究者提出了ReacTOD,一種有界神經符號架構,將自然語言理解(NLU)重新構造為自糾正ReAct循環中的離散工具調用,並由確定性驗證機制控制。

ReacTOD的核心是一個有界ReAct循環,允許模型在多次推理步驟中進行迭代自糾正。與單次推理相比,該方法在MultiWOZ基準上將準確率提高了最多9.3個百分點。此外,符號驗證器在每個對話狀態更新時強制執行動作合規性、模式一致性和指代一致性,在攔截的錯誤上實現了93.1%的自糾正率,並生成結構化的執行軌跡。增量狀態預測和按需歷史檢索保持了提示的緊湊性,從而在參數受限模型中實證提升了指令遵循能力。

在MultiWOZ 2.1數據集的零樣本評估中,ReacTOD取得了新的最優結果:gpt-oss-20B模型達到52.71%的聯合目標準確率(JGA),比此前最佳結果高出14個百分點;而Qwen3-8B模型僅用8B參數就達到了47.34%的JGA。在Schema-Guided Dialogue(SGD)基準上,使用Claude-Opus-4.6的ReacTOD在完全端到端評估中達到80.68%的JGA,Qwen3-32B達到64.09%,展示了跨基準的泛化能力,無需任務特定的訓練數據。該論文已被ACL 2026的TrustNLP研討會接收。

這一成果對於對話AI領域具有重要意義,因為它提供了一種在不犧牲性能的前提下,利用中等規模LLM實現可靠對話狀態跟蹤的可行方案。ReacTOD的神經符號方法不僅提高了準確性,還通過結構化執行軌跡增強了可解釋性,為未來在資源受限環境中的部署奠定了基礎。