全雙工語音代理與用户的交互遠不止“聽到並回答”那麼簡單。系統必須在持續對話流中判斷自己應該在什麼時候傾聽、發出反饋信號(backchannel)、打斷對方、處理語音重疊、主動取得話輪或把話輪讓給對方。這些動作決定了對話的流暢度與自然感,但現行評測基準大多依賴顯式的會話管理指令來測試這些能力。實際部署中,開發者往往通過角色描述或人設來配置代理,模型需要從這些描述中自己推斷在特定時刻應採用何種對話行為。這種從“人設”到“實時行為”的推斷能力,目前仍缺少系統性的評測方法。
針對這一缺口,Puneet Mathur 等人提出了 DuplexSpeechBench-IFEval(DSB-IFEval)。該基準包含 1,038 個測試用例,覆蓋八種不同類型的助手角色,並設計了五種條件協議來測試指令遵循:默認行為、顯式行為指令、人設隱含行為、人設與規則組合條件,以及相互衝突的指令。為了量化表現,研究者使用兩種指標:指令遵循分數(Instruction Adherence Score, IAS)為確定性評分,用於衡量實時話輪管理是否符合規則;人設遵循分數(Persona Adherence Score, PAS)由大語言模型作為裁判,用於判斷回覆內容是否與扮演的角色保持一致。
研究團隊在六種實時語音系統上進行了評測。結果顯示,不同架構存在明顯的性能取捨。全雙工模型 F-Actor 和 PersonaPlex 對指令形式比較敏感:當行為需要從人設中推斷而不是直接給出時,兩者的遵循度分別下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 在保持人設一致內容方面表現更強,但它們的話輪管理行為不會隨顯式指令與人設暗示而改變,而且在多種主動行動上仍受到限制。此外,即使系統能夠可靠遵循符合其設定人設的指令,在面對安全相關的衝突指令時,它們依然難以覆蓋人設所規定的行為。
上述結果表明,對全雙工語音代理而言,“推斷角色隱含的行為”“在合適的對話時機執行該行為”和“解決相互競爭的指令”是三個不同的挑戰。DSB-IFEval 為這些能力的評估提供了基礎,也為未來更自然、更可控的人機語音交互研究指出了需要重點突破的方向。