ReacTOD:用于零样本对话状态跟踪的有界神经符号代理NLU
ReacTOD提出了一种有界神经符号架构,将NLU重新构造为自纠正ReAct循环中的离散工具调用,通过确定性验证实现迭代自纠正。在MultiWOZ 2.1上,gpt-oss-20B达到52.71%的联合目标准确率,超越此前最佳14个百分点;Qwen3-8B以仅8B参数达到47.34%。在SGD基准上,Claude-Opus-4.6实现80.68%的JGA,展示跨基准泛化能力。
任务导向对话系统(如处理交易、预订和服务请求)需要可预测的行为,但实际部署中为满足延迟要求而使用的中等规模大语言模型(LLM)容易出现幻觉和格式错误,这些错误会级联导致不正确的操作(例如,酒店预订了错误的日期)。为解决这一问题,Yanjun Lin等研究者提出了ReacTOD,一种有界神经符号架构,将自然语言理解(NLU)重新构造为自纠正ReAct循环中的离散工具调用,并由确定性验证机制控制。
ReacTOD的核心是一个有界ReAct循环,允许模型在多次推理步骤中进行迭代自纠正。与单次推理相比,该方法在MultiWOZ基准上将准确率提高了最多9.3个百分点。此外,符号验证器在每个对话状态更新时强制执行动作合规性、模式一致性和指代一致性,在拦截的错误上实现了93.1%的自纠正率,并生成结构化的执行轨迹。增量状态预测和按需历史检索保持了提示的紧凑性,从而在参数受限模型中实证提升了指令遵循能力。
在MultiWOZ 2.1数据集的零样本评估中,ReacTOD取得了新的最优结果:gpt-oss-20B模型达到52.71%的联合目标准确率(JGA),比此前最佳结果高出14个百分点;而Qwen3-8B模型仅用8B参数就达到了47.34%的JGA。在Schema-Guided Dialogue(SGD)基准上,使用Claude-Opus-4.6的ReacTOD在完全端到端评估中达到80.68%的JGA,Qwen3-32B达到64.09%,展示了跨基准的泛化能力,无需任务特定的训练数据。该论文已被ACL 2026的TrustNLP研讨会接收。
这一成果对于对话AI领域具有重要意义,因为它提供了一种在不牺牲性能的前提下,利用中等规模LLM实现可靠对话状态跟踪的可行方案。ReacTOD的神经符号方法不仅提高了准确性,还通过结构化执行轨迹增强了可解释性,为未来在资源受限环境中的部署奠定了基础。