跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

DuplexSpeechBench-IFEval:评估全双工语音代理中的隐式指令遵循能力

文章摘要

全双工语音代理需要在实时对话中持续判断何时倾听、插话、处理重叠语音和接管话轮。现有基准多通过显式指令测试这些行为,而实际部署的代理往往根据角色或人设隐式推断行为。为此,研究者提出 DuplexSpeechBench-IFEval(DSB-IFEval),用 1,038 个测试用例、8 种助手角色和 5 种指令条件,系统评估代理在实时语音交互中的隐式指令遵循能力。结果显示不同架构存在显著权衡:有些模型在只有人设提示时性能明显下降,有些则无法适应不同指令来调整话轮管理。

来源arXiv AI作者: Puneet Mathur, Dinesh Manocha
DuplexSpeechBench-IFEval:评估全双工语音代理中的隐式指令遵循能力
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

全双工语音代理与用户的交互远不止“听到并回答”那么简单。系统必须在持续对话流中判断自己应该在什么时候倾听、发出反馈信号(backchannel)、打断对方、处理语音重叠、主动取得话轮或把话轮让给对方。这些动作决定了对话的流畅度与自然感,但现行评测基准大多依赖显式的会话管理指令来测试这些能力。实际部署中,开发者往往通过角色描述或人设来配置代理,模型需要从这些描述中自己推断在特定时刻应采用何种对话行为。这种从“人设”到“实时行为”的推断能力,目前仍缺少系统性的评测方法。

针对这一缺口,Puneet Mathur 等人提出了 DuplexSpeechBench-IFEval(DSB-IFEval)。该基准包含 1,038 个测试用例,覆盖八种不同类型的助手角色,并设计了五种条件协议来测试指令遵循:默认行为、显式行为指令、人设隐含行为、人设与规则组合条件,以及相互冲突的指令。为了量化表现,研究者使用两种指标:指令遵循分数(Instruction Adherence Score, IAS)为确定性评分,用于衡量实时话轮管理是否符合规则;人设遵循分数(Persona Adherence Score, PAS)由大语言模型作为裁判,用于判断回复内容是否与扮演的角色保持一致。

研究团队在六种实时语音系统上进行了评测。结果显示,不同架构存在明显的性能取舍。全双工模型 F-Actor 和 PersonaPlex 对指令形式比较敏感:当行为需要从人设中推断而不是直接给出时,两者的遵循度分别下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 在保持人设一致内容方面表现更强,但它们的话轮管理行为不会随显式指令与人设暗示而改变,而且在多种主动行动上仍受到限制。此外,即使系统能够可靠遵循符合其设定人设的指令,在面对安全相关的冲突指令时,它们依然难以覆盖人设所规定的行为。

上述结果表明,对全双工语音代理而言,“推断角色隐含的行为”“在合适的对话时机执行该行为”和“解决相互竞争的指令”是三个不同的挑战。DSB-IFEval 为这些能力的评估提供了基础,也为未来更自然、更可控的人机语音交互研究指出了需要重点突破的方向。

展开要点与分析

文章情报

工程师进阶

要点

  • DSB-IFEval 包含 1,038 个测试用例、8 种角色和 5 种条件协议,评测隐式指令遵循。
  • F-Actor 与 PersonaPlex 在仅有人设条件时指令遵循度分别下降 9.7% 和 4.5%。
  • GPT-Realtime、MiniCPM-o、Fun-Audio-Chat 能保持人设一致内容,但话轮管理行为不随指令方式变化。
  • 系统在处理安全相关的冲突指令时,仍难以超越人设规定的行为。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。