AI News HubLIVE
站内改写1 分钟阅读

Search-on-Graph-R1:利用强化学习训练大语言模型搜索知识图谱

Search-on-Graph-R1通过监督微调(SFT)和强化学习(RL),将知识图谱问答的导航能力内化到一个8B参数的紧凑模型中,在多个基准上超越了使用前沿大模型的冻结系统,且推理时无需辅助模块,训练时无需LLM裁判。

来源arXiv Computational Linguistics作者: Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

知识图谱问答(KGQA)要求从主题实体出发,经过多个关系跳转找到答案。传统方法通常依赖前沿大语言模型(LLM)通过检索工具探索知识图谱,但这类方法推理成本高昂,难以在实际场景中部署。针对这一问题,来自学术界的研究团队提出了Search-on-Graph-R1,通过结合监督微调(SFT)和强化学习(RL),将知识图谱导航能力内化到一个仅有80亿参数(8B)的紧凑语言模型中,从而在不依赖前沿LLM的情况下实现高效KGQA。

该研究的核心创新在于“脚手架”(Scaffolding)策略。具体而言,作者利用每个问题对应的真实SPARQL查询,引导一个教师模型沿着已知的答案路径在实时Freebase服务器上执行搜索。由于每次搜索调用都直接针对真实的知识图谱,生成的轨迹天然与知识图谱一致,教师模型无需自行探索路径。这一设计确保了训练数据的准确性和可靠性,避免了教师模型产生错误累积。

在训练流程上,Search-on-Graph-R1首先通过监督微调(SFT)让模型学习基本的搜索行为,包括如何解析问题、执行查询以及沿关系路径移动。随后,采用强化学习(RL)进一步优化搜索策略,鼓励模型用更少的搜索步骤找到正确答案。实验在WebQSP、CWQ和GrailQA三个标准KGQA数据集上进行评估。结果显示,8B参数的Search-on-Graph-R1在所有对比的冻结前沿LLM系统中表现最佳,尤其是在CWQ数据集上取得了最强结果。值得注意的是,该模型在推理时不需要任何辅助模块(如检索器或重排序器),训练时也无需使用LLM作为裁判,降低了系统的复杂性和成本。

消融实验进一步揭示了各训练阶段的贡献:SFT和RL两个阶段相互补充,SFT提供了良好的初始策略,而RL则使模型能够更有效地搜索,显著减少了搜索调用次数。此外,该方法在不同模型家族间具有良好的可迁移性,表明其泛化能力。这项研究为在资源受限环境下高效构建KGQA系统提供了新思路,有望推动知识图谱问答技术在实际应用中的广泛部署。