商業ASR系統在程式碼轉換語音上的基準測試:阿拉伯語、波斯語和德語
本研究對五個商業自動語音識別(ASR)系統在程式碼轉換語音上進行了基準測試,涵蓋四種語言對:埃及阿拉伯語-英語、沙烏地阿拉伯語(納吉迪/希賈茲)-英語、波斯語(法爾西)-英語和德語-英語。ElevenLabs Scribe v2 在所有語言對中實現了最低的詞錯誤率(13.2%)和最高的 BERTScore(0.936)。研究建議在阿拉伯語和波斯語中使用 BERTScore 而非 WER,以避免音譯差異導致的錯誤懲罰。其兩階段流水線透過啟發式過濾和 LLM 整合評分,將評分成本降低了約91%。
自動語音識別(ASR)系統在清潔、單語言音訊上表現良好,但在現實世界的多語言場景中,尤其是程式碼轉換(即在同一話語中交替使用兩種語言)的情況下,面臨巨大挑戰。最近,一項新研究對五個商業ASR系統在四種語言對上的程式碼轉換語音進行了全面基準測試,揭示了當前技術的優點與不足。
該研究由Sajjad Abdoli等人進行,論文發表於arXiv。研究團隊選擇了埃及阿拉伯語-英語、沙烏地阿拉伯語(納吉迪/希賈茲)-英語、波斯語(法爾西)-英語以及德語-英語這四種語言對,每個語言對構建了300個樣本的資料集。樣本選擇採用兩階段流水線:首先透過啟發式過濾器根據五種結構性的程式碼轉換訊號對轉錄進行評分;隨後使用GPT-4o和Gemini 1.5 Pro的整合模型,根據六個語言維度對候選樣本進行評分。這一方法將大型語言模型(LLM)的評分成本降低了約91%,實現了高效率。
在評估指標上,研究使用了詞錯誤率(WER)和BERTScore。WER是ASR領域的標準指標,但對於阿拉伯語和波斯語,由於音譯的多樣性,語義正確的轉錄可能因拼寫不同而被錯誤懲罰。因此,研究者認為BERTScore更適合這些語言對,因為它能捕捉語義相似性。
ElevenLabs Scribe v2在所有語言對中表現最佳,整體WER為13.2%,在埃及阿拉伯語上達到13.1%,BERTScore為0.936。其他ASR系統包括但不限於其他商業提供商。研究還進行了難度分層分析,發現聚合平均結果可能掩蓋了系統在不同難度級別上的效能差異。此外,BERT嵌入投影證實了參考轉錄和假設轉錄之間的語義接近性,儘管表面書寫形式不同。
該基準測試資料集已在Hugging Face上公開發布,供研究人員和開發者使用。這項研究為多語言ASR系統的評估提供了重要參考,特別是針對程式碼轉換這一長期被忽視的領域。未來,研究者可以基於此基準進一步改進ASR系統,以更好地服務於全球多語言使用者。