DraDDP:多模态多方对话话语解析数据集
研究人员构建了首个公开的英文多模态多方对话话语解析数据集DraDDP,基于美国电视剧,包含495个对话片段、6374个话语和9.1小时的视频内容。实验表明多模态信息有助于捕捉对话结构和关系类型。数据集、标注指南和代码将公开发布。
在自然语言处理领域,对话话语解析旨在识别对话中话语之间的依赖结构和关系类型,对于构建更智能的多轮对话系统至关重要。然而,以往的研究主要局限于纯文本模态或双人对话场景,无法充分捕捉现实世界中常见的大规模、多模态、多方参与的复杂交互。多模态信息,如视觉线索(面部表情、手势、场景上下文),往往被完全忽略,导致模型对对话结构和意图的理解不够深入。
为了解决这一瓶颈,Shannan Liu及其合作者——来自多个知名研究机构的团队——发布了DraDDP(多模态多方对话话语解析数据集)。该数据集基于美国电视剧(如《老友记》等富含真实多人对话场景的剧集),精心抽取了495个对话片段,涵盖6,374条话语,并提供了9.1小时的同步视频内容。每个片段都包含多轮对话,参与人数一般为3至6人,确保了场景的多样性和挑战性。研究团队采用了严格的标注流程,定义了丰富的依赖关系类型(如回答、赞同、转折等),并进行了多轮一致性检验,以保证数据质量。
在基准实验中,团队评估了多种基线模型,包括纯文本模型、视觉增强模型以及注意力融合模型,深入分析了不同模态对任务的影响。结果显示,融合视觉信息(如面部表情和身体动作)的模型在识别对话结构和关系类型上显著优于仅依赖文本的模型,尤其在一些依赖肢体语言或情绪语调的隐含关系中提升明显。此外,团队还进行了消融研究,验证了视觉模态的不同部分(如静态帧 vs. 动态特征)的贡献度。
DraDDP的发布填补了多模态多方对话话语解析领域的空白,为社区提供了一个具有挑战性的基准测试平台。除了数据集,研究团队还计划开源标注指南、评测脚本以及基线模型代码,以降低研究门槛。该工作目前已收录于arXiv(编号2606.00012),属于计算语言学(cs.CL)和人工智能(cs.AI)分类。未来,研究人员可以基于DraDDP探索更复杂的多模态对话模型,如利用预训练的多模态语言模型或端到端视频对话解析方法,这将有望推动对话系统在客服、虚拟助手等实际应用中的能力飞跃。