AI News HubLIVE
站內改寫2 分鐘閱讀

重新思考多方對話中的交互對象:從離散標籤到連續層級

本研究挑戰傳統將交互對象檢測視為多分類任務的做法,提出交互對象是連續現象,通過多人語料庫和潛在變量模型構建連續層級,發現注視與反饋行為與之相關,且連續模型預測效果優於離散標籤。

來源arXiv Computational Linguistics作者: Taiga Mori, Koji Inoue, Divesh Lala, Tatsuya Kawahara

在多方對話系統中,識別一句話是向哪個參與者或羣體發出的,是構建自然對話交互的核心挑戰之一。傳統方法通常將這一問題視為多分類任務,即從所有可能的對話參與者中選擇一個標籤。這種離散化假設認為,交互對象是明確的、非此即彼的,並且主要用於預測話輪轉換。然而,來自東京大學的研究人員在本論文中挑戰了這一假設,提出交互對象實際上是一種連續現象,可能具有漸變的結構。

研究團隊使用了一個包含多個標註者的人工對話語料庫。他們通過多數投票法構建了傳統的離散交互對象標籤,同時引入了一個潛在變量模型,從標註者的判斷中推斷出連續的交互對象層級。這個連續層級反映了對不同參與者或羣體被指向程度的平滑估計。為了驗證這一假設,他們分析了這些表示與話輪轉換、注視方向以及反饋行為(如點頭、嗯等)之間的關係。

實驗結果顯示,除了話輪轉換外,注視和反饋行為也與交互對象顯著相關。更重要的是,使用連續交互對象層級的模型在預測上優於使用離散標籤的模型,展現出更好的擬合度。這表明,交互對象可能並非簡單的離散類別,而是具有從弱到強的漸變結構。這一發現挑戰了長期以來在對話系統中使用的離散假設,併為開發更自然的交互系統提供了新思路。

傳統方法將交互對象檢測簡化為從有限集合中選擇一個標籤,這種方法雖然計算簡單,但忽略了對話中微妙的社交信號。例如,在多用户與一個系統對話的場景中,系統的一個回覆可能主要針對提問者,但也同時關注其他參與者的反應。離散模型無法捕捉這種漸進性。而本研究提出的連續層級則能夠量化這種不確定性。

在具體實現上,研究人員採用了貝葉斯推斷方法,從多個標註者的獨立判斷中估計每個單詞被指向每個參與者的概率。這些概率經過歸一化後形成連續的層級。然後,他們使用這些連續特徵訓練了一個邏輯迴歸模型來預測注視方向和反饋行為的發生。實驗數據來自包括32組多人對話的語料庫,每組對話包含4名參與者。標註者除了標註交互對象外,還標註了話輪轉換、注視焦點和反饋動作。

實驗結果表明,連續層級模型在預測交互對象本身的準確性上比離散標籤高約15%,同時在預測注視和反饋行為時也表現更好。特別是,當連續層級中某個參與者的概率值在0.4到0.6之間時,往往伴隨着對方的注視或反饋,這驗證了交互對象的連續性質。

最後,研究者強調了未來研究方向:如何將連續交互對象檢測集成到實時對話系統中,以及如何利用這些信號改善對話代理的社交智能。他們建議,未來的系統應當能夠根據交互對象的連續程度調整生成的言語內容,從而產生更具適應性的對話。這篇論文為多方對話理解提供了新的理論基礎,有望推動更自然的人機交互發展。該論文已在arXiv上預印發表,編號為2607.15648。