AI News HubLIVE
站内改写1 分钟阅读

RIMS:面向小型语言模型检索增强生成的平滑多对偏好优化框架

小型语言模型在检索增强生成中易受噪声证据影响。本文提出RIMS,一种三阶段偏好优化框架,包括合成思维链偏好数据生成、可微平滑聚合机制和偏好优化。实验表明其在多跳问答基准上优于现有方法。

来源arXiv Computational Linguistics作者: Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

在资源受限的环境中,小型语言模型(SLM)因其低计算需求而成为检索增强生成(RAG)的理想选择。然而,这些模型容量有限,对检索到的噪声或虚假证据高度敏感。现有的基于偏好的方法,如RoseRAG,仅通过硬argmin/argmax选择最难的单个偏好对,丢弃了其余信号;另一些方法则将多个偏好对视为独立的二分类,导致数据利用率低下。

为此,研究团队提出了RIMS,一种三阶段偏好优化框架。第一阶段通过拒绝采样生成合成思维链偏好数据,仅使用目标SLM本身,无需依赖专有模型。第二阶段引入可微的软聚合机制,用平滑算子取代硬选择,在保留间隔感知选择的判别结构的同时,从所有偏好对中保留梯度信号。第三阶段将平滑目标应用于多种对齐算法进行偏好优化。

理论上,作者证明了平滑近似具有可控的误差界,且平滑聚合比硬选择能提供更紧的梯度对齐。在四个多跳问答基准上的实验表明,RIMS在多个SLM骨干上均优于最先进的基线,在噪声检索条件下在Exact Match和F1上取得了一致的提升。代码已开源。

这项工作的核心贡献在于提出了一种数据高效的偏好优化方法,使得小型模型在复杂检索场景中能够更好地利用检索结果,同时避免了昂贵的专有模型依赖。该框架的平滑聚合机制是一个重要创新,它通过保留所有偏好对的信息,显著提升了训练的稳定性和最终性能。团队还提供了理论证明和开源实现,为后续研究奠定了坚实基础。