AI News HubLIVE
站內改寫2 分鐘閱讀

DraDDP:多模態多方對話話語解析數據集

研究人員構建了首個公開的英文多模態多方對話話語解析數據集DraDDP,基於美國電視劇,包含495個對話片段、6374個話語和9.1小時的視頻內容。實驗表明多模態信息有助於捕捉對話結構和關係類型。數據集、標註指南和代碼將公開發布。

來源arXiv Computational Linguistics作者: Shannan Liu, Peifeng Li, Yaxin Fan, Qiaoming Zhu

在自然語言處理領域,對話話語解析旨在識別對話中話語之間的依賴結構和關係類型,對於構建更智能的多輪對話系統至關重要。然而,以往的研究主要侷限於純文本模態或雙人對話場景,無法充分捕捉現實世界中常見的大規模、多模態、多方參與的複雜交互。多模態信息,如視覺線索(面部表情、手勢、場景上下文),往往被完全忽略,導致模型對對話結構和意圖的理解不夠深入。

為了解決這一瓶頸,Shannan Liu及其合作者——來自多個知名研究機構的團隊——發佈了DraDDP(多模態多方對話話語解析數據集)。該數據集基於美國電視劇(如《老友記》等富含真實多人對話場景的劇集),精心抽取了495個對話片段,涵蓋6,374條話語,並提供了9.1小時的同步視頻內容。每個片段都包含多輪對話,參與人數一般為3至6人,確保了場景的多樣性和挑戰性。研究團隊採用了嚴格的標註流程,定義了豐富的依賴關係類型(如回答、贊同、轉折等),並進行了多輪一致性檢驗,以保證數據質量。

在基準實驗中,團隊評估了多種基線模型,包括純文本模型、視覺增強模型以及注意力融合模型,深入分析了不同模態對任務的影響。結果顯示,融合視覺信息(如面部表情和身體動作)的模型在識別對話結構和關係類型上顯著優於僅依賴文本的模型,尤其在一些依賴肢體語言或情緒語調的隱含關係中提升明顯。此外,團隊還進行了消融研究,驗證了視覺模態的不同部分(如靜態幀 vs. 動態特徵)的貢獻度。

DraDDP的發佈填補了多模態多方對話話語解析領域的空白,為社區提供了一個具有挑戰性的基準測試平台。除了數據集,研究團隊還計劃開源標註指南、評測腳本以及基線模型代碼,以降低研究門檻。該工作目前已收錄於arXiv(編號2606.00012),屬於計算語言學(cs.CL)和人工智能(cs.AI)分類。未來,研究人員可以基於DraDDP探索更復雜的多模態對話模型,如利用預訓練的多模態語言模型或端到端視頻對話解析方法,這將有望推動對話系統在客服、虛擬助手等實際應用中的能力飛躍。