跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

DuplexSpeechBench-IFEval:評估全雙工語音代理中的隱式指令遵循能力

文章摘要

全雙工語音代理需要在即時對話中持續判斷何時傾聽、插話、處理重疊語音和接管話輪。現有基準多透過顯式指令測試這些行為,而實際部署的代理往往根據角色或人設隱式推斷行為。為此,研究者提出 DuplexSpeechBench-IFEval(DSB-IFEval),用 1,038 個測試用例、8 種助手角色和 5 種指令條件,系統評估代理在即時語音互動中的隱式指令遵循能力。結果顯示不同架構存在顯著權衡:有些模型在只有人設提示時效能明顯下降,有些則無法適應不同指令來調整話輪管理。

來源arXiv AI作者: Puneet Mathur, Dinesh Manocha
DuplexSpeechBench-IFEval:評估全雙工語音代理中的隱式指令遵循能力
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

全雙工語音代理與使用者的互動遠不止“聽到並回答”那麼簡單。系統必須在持續對話流中判斷自己應該在什麼時候傾聽、發出反饋訊號(backchannel)、打斷對方、處理語音重疊、主動取得話輪或把話輪讓給對方。這些動作決定了對話的流暢度與自然感,但現行評測基準大多依賴顯式的會話管理指令來測試這些能力。實際部署中,開發者往往透過角色描述或人設來配置代理,模型需要從這些描述中自己推斷在特定時刻應採用何種對話行為。這種從“人設”到“即時行為”的推斷能力,目前仍缺少系統性的評測方法。

針對這一缺口,Puneet Mathur 等人提出了 DuplexSpeechBench-IFEval(DSB-IFEval)。該基準包含 1,038 個測試用例,覆蓋八種不同型別的助手角色,並設計了五種條件協議來測試指令遵循:預設行為、顯式行為指令、人設隱含行為、人設與規則組合條件,以及相互衝突的指令。為了量化表現,研究者使用兩種指標:指令遵循分數(Instruction Adherence Score, IAS)為確定性評分,用於衡量即時話輪管理是否符合規則;人設遵循分數(Persona Adherence Score, PAS)由大語言模型作為裁判,用於判斷回覆內容是否與扮演的角色保持一致。

研究團隊在六種即時語音系統上進行了評測。結果顯示,不同架構存在明顯的效能取捨。全雙工模型 F-Actor 和 PersonaPlex 對指令形式比較敏感:當行為需要從人設中推斷而不是直接給出時,兩者的遵循度分別下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 在保持人設一致內容方面表現更強,但它們的話輪管理行為不會隨顯式指令與人設暗示而改變,而且在多種主動行動上仍受到限制。此外,即使系統能夠可靠遵循符合其設定人設的指令,在面對安全相關的衝突指令時,它們依然難以覆蓋人設所規定的行為。

上述結果表明,對全雙工語音代理而言,“推斷角色隱含的行為”“在合適的對話時機執行該行為”和“解決相互競爭的指令”是三個不同的挑戰。DSB-IFEval 為這些能力的評估提供了基礎,也為未來更自然、更可控的人機語音互動研究指出了需要重點突破的方向。

展開要點與分析

文章情報

工程師進階

要點

  • DSB-IFEval 包含 1,038 個測試用例、8 種角色和 5 種條件協議,評測隱式指令遵循。
  • F-Actor 與 PersonaPlex 在僅有人設條件時指令遵循度分別下降 9.7% 和 4.5%。
  • GPT-Realtime、MiniCPM-o、Fun-Audio-Chat 能保持人設一致內容,但話輪管理行為不隨指令方式變化。
  • 系統在處理安全相關的衝突指令時,仍難以超越人設規定的行為。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。