AI News HubLIVE
站內改寫2 分鐘閱讀

重新思考多方對話中的互動物件:從離散標籤到連續層級

本研究挑戰傳統將互動物件檢測視為多分類任務的做法,提出互動物件是連續現象,透過多人語料庫和潛在變數模型構建連續層級,發現注視與反饋行為與之相關,且連續模型預測效果優於離散標籤。

來源arXiv Computational Linguistics作者: Taiga Mori, Koji Inoue, Divesh Lala, Tatsuya Kawahara

在多方對話系統中,識別一句話是向哪個參與者或群體發出的,是構建自然對話互動的核心挑戰之一。傳統方法通常將這一問題視為多分類任務,即從所有可能的對話參與者中選擇一個標籤。這種離散化假設認為,互動物件是明確的、非此即彼的,並且主要用於預測話輪轉換。然而,來自東京大學的研究人員在本論文中挑戰了這一假設,提出互動物件實際上是一種連續現象,可能具有漸變的結構。

研究團隊使用了一個包含多個標註者的人工對話語料庫。他們透過多數投票法構建了傳統的離散互動物件標籤,同時引入了一個潛在變數模型,從標註者的判斷中推斷出連續的互動物件層級。這個連續層級反映了對不同參與者或群體被指向程度的平滑估計。為了驗證這一假設,他們分析了這些表示與話輪轉換、注視方向以及反饋行為(如點頭、嗯等)之間的關係。

實驗結果顯示,除了話輪轉換外,注視和反饋行為也與互動物件顯著相關。更重要的是,使用連續互動物件層級的模型在預測上優於使用離散標籤的模型,展現出更好的擬合度。這表明,互動物件可能並非簡單的離散類別,而是具有從弱到強的漸變結構。這一發現挑戰了長期以來在對話系統中使用的離散假設,併為開發更自然的互動系統提供了新思路。

傳統方法將互動物件檢測簡化為從有限集合中選擇一個標籤,這種方法雖然計算簡單,但忽略了對話中微妙的社交訊號。例如,在多使用者與一個系統對話的場景中,系統的一個回覆可能主要針對提問者,但也同時關注其他參與者的反應。離散模型無法捕捉這種漸進性。而本研究提出的連續層級則能夠量化這種不確定性。

在具體實現上,研究人員採用了貝葉斯推斷方法,從多個標註者的獨立判斷中估計每個單詞被指向每個參與者的機率。這些機率經過歸一化後形成連續的層級。然後,他們使用這些連續特徵訓練了一個邏輯迴歸模型來預測注視方向和反饋行為的發生。實驗資料來自包括32組多人對話的語料庫,每組對話包含4名參與者。標註者除了標註互動物件外,還標註了話輪轉換、注視焦點和反饋動作。

實驗結果表明,連續層級模型在預測互動物件本身的準確性上比離散標籤高約15%,同時在預測注視和反饋行為時也表現更好。特別是,當連續層級中某個參與者的機率值在0.4到0.6之間時,往往伴隨著對方的注視或反饋,這驗證了互動物件的連續性質。

最後,研究者強調了未來研究方向:如何將連續互動物件檢測整合到即時對話系統中,以及如何利用這些訊號改善對話代理的社交智慧。他們建議,未來的系統應當能夠根據互動物件的連續程度調整生成的言語內容,從而產生更具適應性的對話。這篇論文為多方對話理解提供了新的理論基礎,有望推動更自然的人機互動發展。該論文已在arXiv上預印發表,編號為2607.15648。