AI News HubLIVE
站内改写2 分钟阅读

面向法律探究型对话智能体的双重层次对话策略学习

本文提出探究型对话智能体(ICA)概念,并针对美国最高法院口头辩论场景开发了基于双重层次强化学习的框架。该框架通过两个协作的强化学习代理分别管理战略对话和细粒度语句生成,模拟法官提问模式以主动获取关键法律信息。在最高法院数据集上的评估表明,该方法在多项指标上优于基线模型,为高风险领域专业应用迈出第一步。

来源arXiv Computational Linguistics作者: Xubo Lin, Zezhii Deng, Shihao Wang, Grace Hui Yang, Yang Deng

近日,一项发表于ACL 2026的研究提出了“探究型对话智能体”(Inquisitive Conversational Agents, ICA)的新概念,并针对美国最高法院口头辩论这一特殊场景开发了相应的智能系统。传统对话系统大多以用户驱动为主,旨在满足用户请求,但在许多关键现实场景中,对话智能体需要主动提取信息以实现自身目标。例如在法律咨询、医疗诊断或金融谈判中,智能体必须主动询问关键细节,而不是等待用户提供所有信息。为此,研究团队提出了双重层次强化学习框架,其中两个强化学习代理相互协作:一个负责宏观对话策略管理,决定何时改变话题、深入追问或总结;另一个负责微观语句生成,控制具体问题的措辞和语气。这种层次化设计使得智能体能够像法官一样,在口头辩论中通过策略性提问逐步揭示案件的关键事实和法律依据。

该框架的核心优势在于其灵活性。宏观代理学习整体对话路径,例如从开场问题逐渐深入到争议焦点;微观代理则根据当前对话状态生成自然且具有针对性的问题。两个代理通过共享的奖励信号进行联合优化,奖励函数设计为鼓励智能体在有限的对话轮次内获取最相关的法律信息。研究团队使用美国最高法院的历史口头辩论记录进行训练和评估,这些记录包含了法官与律师之间的真实问答模式。实验结果表明,该方法在多个人工评估和自动指标上均优于多种基线模型,包括基于规则的系统和传统的强化学习变体。特别地,该智能体能够有效识别信息缺口,并在适当的时间点提出探究性问题,从而显著提高了信息获取的完整性和效率。

尽管当前工作专注于法律场景,但研究人员指出其框架具有通用性,未来可扩展至医疗、金融、客户服务等其他需要主动信息获取的领域。该论文已被ACL 2026接收为Findings论文,相关代码和数据也已公开,供学界进一步研究和改进。这项研究标志着对话系统从被动响应向主动探究的重要转变,为高风险领域中的专业对话应用奠定了坚实基础。