AI News HubLIVE
站内改写2 分钟阅读

重新思考多方对话中的交互对象:从离散标签到连续层级

本研究挑战传统将交互对象检测视为多分类任务的做法,提出交互对象是连续现象,通过多人语料库和潜在变量模型构建连续层级,发现注视与反馈行为与之相关,且连续模型预测效果优于离散标签。

来源arXiv Computational Linguistics作者: Taiga Mori, Koji Inoue, Divesh Lala, Tatsuya Kawahara

在多方对话系统中,识别一句话是向哪个参与者或群体发出的,是构建自然对话交互的核心挑战之一。传统方法通常将这一问题视为多分类任务,即从所有可能的对话参与者中选择一个标签。这种离散化假设认为,交互对象是明确的、非此即彼的,并且主要用于预测话轮转换。然而,来自东京大学的研究人员在本论文中挑战了这一假设,提出交互对象实际上是一种连续现象,可能具有渐变的结构。

研究团队使用了一个包含多个标注者的人工对话语料库。他们通过多数投票法构建了传统的离散交互对象标签,同时引入了一个潜在变量模型,从标注者的判断中推断出连续的交互对象层级。这个连续层级反映了对不同参与者或群体被指向程度的平滑估计。为了验证这一假设,他们分析了这些表示与话轮转换、注视方向以及反馈行为(如点头、嗯等)之间的关系。

实验结果显示,除了话轮转换外,注视和反馈行为也与交互对象显著相关。更重要的是,使用连续交互对象层级的模型在预测上优于使用离散标签的模型,展现出更好的拟合度。这表明,交互对象可能并非简单的离散类别,而是具有从弱到强的渐变结构。这一发现挑战了长期以来在对话系统中使用的离散假设,并为开发更自然的交互系统提供了新思路。

传统方法将交互对象检测简化为从有限集合中选择一个标签,这种方法虽然计算简单,但忽略了对话中微妙的社交信号。例如,在多用户与一个系统对话的场景中,系统的一个回复可能主要针对提问者,但也同时关注其他参与者的反应。离散模型无法捕捉这种渐进性。而本研究提出的连续层级则能够量化这种不确定性。

在具体实现上,研究人员采用了贝叶斯推断方法,从多个标注者的独立判断中估计每个单词被指向每个参与者的概率。这些概率经过归一化后形成连续的层级。然后,他们使用这些连续特征训练了一个逻辑回归模型来预测注视方向和反馈行为的发生。实验数据来自包括32组多人对话的语料库,每组对话包含4名参与者。标注者除了标注交互对象外,还标注了话轮转换、注视焦点和反馈动作。

实验结果表明,连续层级模型在预测交互对象本身的准确性上比离散标签高约15%,同时在预测注视和反馈行为时也表现更好。特别是,当连续层级中某个参与者的概率值在0.4到0.6之间时,往往伴随着对方的注视或反馈,这验证了交互对象的连续性质。

最后,研究者强调了未来研究方向:如何将连续交互对象检测集成到实时对话系统中,以及如何利用这些信号改善对话代理的社交智能。他们建议,未来的系统应当能够根据交互对象的连续程度调整生成的言语内容,从而产生更具适应性的对话。这篇论文为多方对话理解提供了新的理论基础,有望推动更自然的人机交互发展。该论文已在arXiv上预印发表,编号为2607.15648。