透過上下文感知的前置生成來實現真實世界對話機器人的低延遲輪換
研究人員提出了一種雙階段框架,用於基於LLM的對話機器人,在語音開始前生成上下文感知的前置響應,減少響應延遲。現場實驗顯示不同填充型別之間存在時間權衡。
近年來,基於大型語言模型(LLM)的對話系統在自然互動方面取得了顯著進展,但仍面臨一個關鍵挑戰:響應延遲。傳統方法僅在完整的語音識別結束後才開始生成響應,導致使用者等待時間較長。雖然可以使用固定的填充語(如“嗯”、“稍等”)來緩解,但長期使用會顯得不自然,且無法適應不同的對話上下文。
針對這一問題,日本研究人員提出了一種兩階段增量框架,將前置響應的準備與語音輸出解耦。該框架包含兩個核心元件:意圖就緒檢測器和語音活動投影(VAP)模型。意圖就緒檢測器持續分析使用者的語音輸入,一旦能夠可靠地預測使用者意圖,便會觸發LLM生成一個簡短且上下文相關的前置響應。與此同時,VAP模型並行工作,透過預測使用者的語音結束時間來決定何時輸出該前置響應,從而在使用者話音未落時就開始播放。
為了驗證該方法的有效性,研究團隊在購物中心部署了一臺路徑引導機器人,並進行了現場實驗。實驗設定了三種條件:無填充(機器人僅在識別完整指令後回覆)、固定填充(使用固定的填充語如“請稍等”)、以及上下文前置(使用提出的框架生成與上下文相關的前置響應)。實驗收集了初始響應延遲、初次響應到主要響應的間隔以及使用者探索性評分等指標。
結果顯示,與無填充相比,固定填充和上下文前置均顯著降低了初始響應延遲。然而,上下文前置的初始響應延遲比固定填充更長,這可能是因為生成上下文相關的前置響應需要更多時間。但有趣的是,上下文前置顯著縮短了從初次響應到主要響應的間隔,意味著使用者能更快地獲得完整回答。探索性評分顯示三種條件之間無顯著差異,表明使用者對延遲的感知可能受到多種因素影響。
這些結果揭示了不同填充策略之間的時間權衡:固定填充雖然快速,但可能打斷使用者的思維;上下文前置雖然初次延遲稍長,但能提供更連貫的對話體驗。該研究為對話機器人的人機互動設計提供了新的思路,尤其是在需要低延遲的場景下(如導覽、客服)。未來工作可能進一步最佳化意圖檢測的準確性和前置響應的自然度,並探索更復雜的對話場景。