DuplexGen:自适应合成人机轮流对话
DuplexGen是一个通过校准LLM预测与少量人类偏好注释来生成场景自适应轮流对话的框架。实验表明,该方法在六个合作与竞争任务中比未校准的提示或通用数据训练更符合人类偏好,证明人类校准是关键。
来源arXiv Computational Linguistics作者: Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-T\"ur
全双工交互中,轮流对话是核心组成部分。然而,现有的模型往往采用统一的轮流规范,忽视了不同场景下的适当行为差异。这一局限源于训练数据:人类对话语料虽捕捉了自然时序,但缺乏角色基础和场景特定规范;而启发式或提示驱动的合成方法则未基于人类偏好。为解决这一问题,研究团队提出了DuplexGen框架,通过将大型语言模型(LLM)的预测与少量槽级人类偏好标注进行校准,生成具有场景适应性的轮流对话。
研究涵盖了六种合作与竞争任务,包括信息获取、协作任务和竞争性谈判等场景。实验发现,人类在轮流对话中的偏好存在系统性差异:例如在合作场景中,人们倾向于更均匀的轮流;而在竞争场景中,则可能出现更长的说话轮次或打断。DuplexGen通过收集少量槽级的人类偏好标注(每个任务约50-100个标注),利用这些标注校准LLM的输出,使得生成的对话在轮流行为上更符合人类在不同场景下的期望。
与未校准的提示(即直接让LLM模拟人类对话)或仅使用通用人类对话数据训练的方法相比,DuplexGen生成的对话与人类偏好显著更吻合。进一步实验表明,基于DuplexGen数据训练的全双工模型展现出独特且符合人类偏好的轮流行为,例如在适当的时候给予反馈或等待。这些结果强调,人类校准而非语料规模或提示设计,才是实现在不同场景下生成符合人类期望的轮流对话的关键。