自動語音識別(ASR)系統雖然在許多場景下表現出色,但有時會產生流暢卻與輸入語音毫不相干的文本,這種現象被稱為幻覺。一篇題為《The Anatomy of an ASR Hallucination》的論文將此類幻覺視為更廣泛的“接地失敗”的一種可能後果——即轉錄內容不再被音訊充分引導。為了解析這種失敗在何處成為可能,研究者對兩個獨立訓練的Conformer-Large識別器(一個基於CTC,一個基於RNN-T)進行了系統分析,並引入環境退化與說話人背景偏移兩種分佈偏移條件。
研究的核心發現是,在兩種模型中,編碼器的最後一個模組都扮演著關鍵邊界角色。實驗顯示,若繞過最終的編碼器模組,幾乎每一個輸入話語都會導致解碼輸出出現顯著發散;相比之下,繞過中間模組的影響則微乎其微。這意味著模型對最終編碼階段的依賴具有高度一致性,不受解碼器家族或分佈偏移型別的影響。研究者還觀察到,正是在這一階段,表徵變得更加緊湊,文本資訊變得能夠被訓練後的解碼器讀取,並且字素(grapheme)資訊也變得顯式。這些證據表明,最終編碼階段是將輸入音訊轉換為可解碼文本表徵的關鍵轉折點。
然而,一個極具啟發性的結果是:當研究者透過干預繞過該最終階段時,模型產生的輸出並非流暢的捏造內容,而是雜亂或重複的文本。這與自然發生的幻覺——通常表現為語法正確、語義連貫但與音訊無關的句子——形成了鮮明對照。因此,論文作者強調,他們的試驗揭示的是幻覺的一個機械前提:模型未能產生充分接地的輸出。換言之,這一發現定位了幻覺可能發生的“必要條件”,但尚未解釋自然幻覺的完整來源。
這項研究的價值在於,它將關注點從現象本身轉向了底層機制,提供了一種可復現的實驗正規化來探索ASR的故障模式。透過在CTC和RNN-T兩種主流訓練架構及多種資料偏移下驗證結論的一致性,研究者給出了強有力的證據,表明終端編碼階段對於接地識別至關重要。理解這一機制不僅有助於更細緻地診斷ASR系統,也可能為未來設計更魯棒的語音識別模型提供指導。