AI News HubLIVE
站內改寫1 分鐘閱讀

DuplexGen:自適應合成人機輪流對話

DuplexGen是一個通過校準LLM預測與少量人類偏好註釋來生成場景自適應輪流對話的框架。實驗表明,該方法在六個合作與競爭任務中比未校準的提示或通用數據訓練更符合人類偏好,證明人類校準是關鍵。

來源arXiv Computational Linguistics作者: Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-T\"ur

全雙工交互中,輪流對話是核心組成部分。然而,現有的模型往往採用統一的輪流規範,忽視了不同場景下的適當行為差異。這一侷限源於訓練數據:人類對話語料雖捕捉了自然時序,但缺乏角色基礎和場景特定規範;而啓發式或提示驅動的合成方法則未基於人類偏好。為解決這一問題,研究團隊提出了DuplexGen框架,通過將大型語言模型(LLM)的預測與少量槽級人類偏好標註進行校準,生成具有場景適應性的輪流對話。

研究涵蓋了六種合作與競爭任務,包括信息獲取、協作任務和競爭性談判等場景。實驗發現,人類在輪流對話中的偏好存在系統性差異:例如在合作場景中,人們傾向於更均勻的輪流;而在競爭場景中,則可能出現更長的説話輪次或打斷。DuplexGen通過收集少量槽級的人類偏好標註(每個任務約50-100個標註),利用這些標註校準LLM的輸出,使得生成的對話在輪流行為上更符合人類在不同場景下的期望。

與未校準的提示(即直接讓LLM模擬人類對話)或僅使用通用人類對話數據訓練的方法相比,DuplexGen生成的對話與人類偏好顯著更吻合。進一步實驗表明,基於DuplexGen數據訓練的全雙工模型展現出獨特且符合人類偏好的輪流行為,例如在適當的時候給予反饋或等待。這些結果強調,人類校準而非語料規模或提示設計,才是實現在不同場景下生成符合人類期望的輪流對話的關鍵。