SENSE:基于语义嵌入导航与软门控评估的检索式推测解码方法
提出SENSE方法,通过基于目标模型隐藏状态的语义检索和软门控评估,提升检索式推测解码的鲁棒性和效率,在LLaMA和Qwen上实现高达4.09的平均接受长度和3.26倍加速。
推测解码(Speculative Decoding, SD)作为一种有效的大语言模型(LLM)推理加速技术,近年来受到广泛关注。其基本原理是利用一个轻量级的草稿模型快速生成一连串候选令牌,然后由目标模型对这些候选进行并行验证,从而在保证生成质量不下降的前提下大幅提升推理速度。在众多SD方法中,检索式推测解码(Retrieval-based Speculative Decoding, RSD)因其无需额外训练、即插即用的特点而备受青睐。然而,传统的RSD方法存在一个根本性问题:其检索和验证过程高度依赖于词汇层面的精确匹配,这使得它对语言的表面变化(如同义词替换、语序调整等)非常敏感,从而导致鲁棒性不足。
针对这一挑战,来自研究者Shaowen Chen等人的团队提出了一种名为SENSE(Semantic Embedding Navigation with Soft-gated Evaluation)的新方法。SENSE的核心思想是将检索过程从词汇层面提升到语义层面。具体来说,它利用目标模型的隐藏状态(hidden states)作为检索锚点,通过计算语义嵌入之间的相似性来寻找与当前生成上下文相关的候选令牌。这种基于语义的检索方式能够有效捕捉句子的含义而非表面形式,因此能够抵抗语言表达的自然变化。在此基础上,SENSE引入了一个软门控评估(Soft-gated Evaluation)模块,该模块不仅考虑候选令牌与目标令牌的匹配程度,还通过门控机制动态调整评估标准,从而更准确地判断语义等价性。
为了验证SENSE的有效性,研究团队进行了一系列严格的实验。他们将现有多种RSD方法分解为统一的原子原语框架,从而可以在组件级别进行公平比较。实验覆盖了多个领域的数据集,并在LLaMA和Qwen两大主流模型家族上进行了测试。结果表明,SENSE在多个基线方法中表现最优,平均接受长度达到了4.09,加速比最高达到3.26倍,同时生成质量与原始模型无异。这意味着在实际应用中,SENSE能够显著降低推理时的延迟和计算资源消耗,尤其适合需要快速响应的场景。
SENSE的论文已于2026年4月14日提交至arXiv预印本平台,并归类于计算与语言(cs.CL)、人工智能(cs.AI)和机器学习(cs.LG)等子领域。研究团队表示,相关代码将在论文正式发表后开源,以促进该领域的进一步研究。SENSE的提出不仅解决了传统RSD方法的词汇依赖问题,还为未来的推理加速研究提供了新的方向。