AI News HubLIVE
站内改写2 分钟阅读

通过上下文感知的前置生成来实现真实世界对话机器人的低延迟轮换

研究人员提出了一种双阶段框架,用于基于LLM的对话机器人,在语音开始前生成上下文感知的前置响应,减少响应延迟。现场实验显示不同填充类型之间存在时间权衡。

来源arXiv Robotics作者: Yuki Okafuji, Koji Inoue, Yoshiki Ohira

近年来,基于大型语言模型(LLM)的对话系统在自然交互方面取得了显著进展,但仍面临一个关键挑战:响应延迟。传统方法仅在完整的语音识别结束后才开始生成响应,导致用户等待时间较长。虽然可以使用固定的填充语(如“嗯”、“稍等”)来缓解,但长期使用会显得不自然,且无法适应不同的对话上下文。

针对这一问题,日本研究人员提出了一种两阶段增量框架,将前置响应的准备与语音输出解耦。该框架包含两个核心组件:意图就绪检测器和语音活动投影(VAP)模型。意图就绪检测器持续分析用户的语音输入,一旦能够可靠地预测用户意图,便会触发LLM生成一个简短且上下文相关的前置响应。与此同时,VAP模型并行工作,通过预测用户的语音结束时间来决定何时输出该前置响应,从而在用户话音未落时就开始播放。

为了验证该方法的有效性,研究团队在购物中心部署了一台路径引导机器人,并进行了现场实验。实验设置了三种条件:无填充(机器人仅在识别完整指令后回复)、固定填充(使用固定的填充语如“请稍等”)、以及上下文前置(使用提出的框架生成与上下文相关的前置响应)。实验收集了初始响应延迟、初次响应到主要响应的间隔以及用户探索性评分等指标。

结果显示,与无填充相比,固定填充和上下文前置均显著降低了初始响应延迟。然而,上下文前置的初始响应延迟比固定填充更长,这可能是因为生成上下文相关的前置响应需要更多时间。但有趣的是,上下文前置显著缩短了从初次响应到主要响应的间隔,意味着用户能更快地获得完整回答。探索性评分显示三种条件之间无显著差异,表明用户对延迟的感知可能受到多种因素影响。

这些结果揭示了不同填充策略之间的时间权衡:固定填充虽然快速,但可能打断用户的思维;上下文前置虽然初次延迟稍长,但能提供更连贯的对话体验。该研究为对话机器人的人机交互设计提供了新的思路,尤其是在需要低延迟的场景下(如导览、客服)。未来工作可能进一步优化意图检测的准确性和前置响应的自然度,并探索更复杂的对话场景。