自动语音识别(ASR)系统虽然在许多场景下表现出色,但有时会产生流畅却与输入语音毫不相干的文本,这种现象被称为幻觉。一篇题为《The Anatomy of an ASR Hallucination》的论文将此类幻觉视为更广泛的“接地失败”的一种可能后果——即转录内容不再被音频充分引导。为了解析这种失败在何处成为可能,研究者对两个独立训练的Conformer-Large识别器(一个基于CTC,一个基于RNN-T)进行了系统分析,并引入环境退化与说话人背景偏移两种分布偏移条件。
研究的核心发现是,在两种模型中,编码器的最后一个模块都扮演着关键边界角色。实验显示,若绕过最终的编码器模块,几乎每一个输入话语都会导致解码输出出现显著发散;相比之下,绕过中间模块的影响则微乎其微。这意味着模型对最终编码阶段的依赖具有高度一致性,不受解码器家族或分布偏移类型的影响。研究者还观察到,正是在这一阶段,表征变得更加紧凑,文本信息变得能够被训练后的解码器读取,并且字素(grapheme)信息也变得显式。这些证据表明,最终编码阶段是将输入音频转换为可解码文本表征的关键转折点。
然而,一个极具启发性的结果是:当研究者通过干预绕过该最终阶段时,模型产生的输出并非流畅的捏造内容,而是杂乱或重复的文本。这与自然发生的幻觉——通常表现为语法正确、语义连贯但与音频无关的句子——形成了鲜明对照。因此,论文作者强调,他们的试验揭示的是幻觉的一个机械前提:模型未能产生充分接地的输出。换言之,这一发现定位了幻觉可能发生的“必要条件”,但尚未解释自然幻觉的完整来源。
这项研究的价值在于,它将关注点从现象本身转向了底层机制,提供了一种可复现的实验范式来探索ASR的故障模式。通过在CTC和RNN-T两种主流训练架构及多种数据偏移下验证结论的一致性,研究者给出了强有力的证据,表明终端编码阶段对于接地识别至关重要。理解这一机制不仅有助于更细致地诊断ASR系统,也可能为未来设计更鲁棒的语音识别模型提供指导。