全双工语音代理与用户的交互远不止“听到并回答”那么简单。系统必须在持续对话流中判断自己应该在什么时候倾听、发出反馈信号(backchannel)、打断对方、处理语音重叠、主动取得话轮或把话轮让给对方。这些动作决定了对话的流畅度与自然感,但现行评测基准大多依赖显式的会话管理指令来测试这些能力。实际部署中,开发者往往通过角色描述或人设来配置代理,模型需要从这些描述中自己推断在特定时刻应采用何种对话行为。这种从“人设”到“实时行为”的推断能力,目前仍缺少系统性的评测方法。
针对这一缺口,Puneet Mathur 等人提出了 DuplexSpeechBench-IFEval(DSB-IFEval)。该基准包含 1,038 个测试用例,覆盖八种不同类型的助手角色,并设计了五种条件协议来测试指令遵循:默认行为、显式行为指令、人设隐含行为、人设与规则组合条件,以及相互冲突的指令。为了量化表现,研究者使用两种指标:指令遵循分数(Instruction Adherence Score, IAS)为确定性评分,用于衡量实时话轮管理是否符合规则;人设遵循分数(Persona Adherence Score, PAS)由大语言模型作为裁判,用于判断回复内容是否与扮演的角色保持一致。
研究团队在六种实时语音系统上进行了评测。结果显示,不同架构存在明显的性能取舍。全双工模型 F-Actor 和 PersonaPlex 对指令形式比较敏感:当行为需要从人设中推断而不是直接给出时,两者的遵循度分别下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 在保持人设一致内容方面表现更强,但它们的话轮管理行为不会随显式指令与人设暗示而改变,而且在多种主动行动上仍受到限制。此外,即使系统能够可靠遵循符合其设定人设的指令,在面对安全相关的冲突指令时,它们依然难以覆盖人设所规定的行为。
上述结果表明,对全双工语音代理而言,“推断角色隐含的行为”“在合适的对话时机执行该行为”和“解决相互竞争的指令”是三个不同的挑战。DSB-IFEval 为这些能力的评估提供了基础,也为未来更自然、更可控的人机语音交互研究指出了需要重点突破的方向。