商业ASR系统在代码转换语音上的基准测试:阿拉伯语、波斯语和德语
本研究对五个商业自动语音识别(ASR)系统在代码转换语音上进行了基准测试,涵盖四种语言对:埃及阿拉伯语-英语、沙特阿拉伯语(纳吉迪/希贾兹)-英语、波斯语(法尔西)-英语和德语-英语。ElevenLabs Scribe v2 在所有语言对中实现了最低的词错误率(13.2%)和最高的 BERTScore(0.936)。研究建议在阿拉伯语和波斯语中使用 BERTScore 而非 WER,以避免音译差异导致的错误惩罚。其两阶段流水线通过启发式过滤和 LLM 集成评分,将评分成本降低了约91%。
自动语音识别(ASR)系统在清洁、单语言音频上表现良好,但在现实世界的多语言场景中,尤其是代码转换(即在同一话语中交替使用两种语言)的情况下,面临巨大挑战。最近,一项新研究对五个商业ASR系统在四种语言对上的代码转换语音进行了全面基准测试,揭示了当前技术的优点与不足。
该研究由Sajjad Abdoli等人进行,论文发表于arXiv。研究团队选择了埃及阿拉伯语-英语、沙特阿拉伯语(纳吉迪/希贾兹)-英语、波斯语(法尔西)-英语以及德语-英语这四种语言对,每个语言对构建了300个样本的数据集。样本选择采用两阶段流水线:首先通过启发式过滤器根据五种结构性的代码转换信号对转录进行评分;随后使用GPT-4o和Gemini 1.5 Pro的集成模型,根据六个语言维度对候选样本进行评分。这一方法将大型语言模型(LLM)的评分成本降低了约91%,实现了高效率。
在评估指标上,研究使用了词错误率(WER)和BERTScore。WER是ASR领域的标准指标,但对于阿拉伯语和波斯语,由于音译的多样性,语义正确的转录可能因拼写不同而被错误惩罚。因此,研究者认为BERTScore更适合这些语言对,因为它能捕捉语义相似性。
ElevenLabs Scribe v2在所有语言对中表现最佳,整体WER为13.2%,在埃及阿拉伯语上达到13.1%,BERTScore为0.936。其他ASR系统包括但不限于其他商业提供商。研究还进行了难度分层分析,发现聚合平均结果可能掩盖了系统在不同难度级别上的性能差异。此外,BERT嵌入投影证实了参考转录和假设转录之间的语义接近性,尽管表面书写形式不同。
该基准测试数据集已在Hugging Face上公开发布,供研究人员和开发者使用。这项研究为多语言ASR系统的评估提供了重要参考,特别是针对代码转换这一长期被忽视的领域。未来,研究者可以基于此基准进一步改进ASR系统,以更好地服务于全球多语言用户。