AI News HubLIVE
站內改寫1 分鐘閱讀

Search-on-Graph-R1:利用強化學習訓練大語言模型搜索知識圖譜

Search-on-Graph-R1通過監督微調(SFT)和強化學習(RL),將知識圖譜問答的導航能力內化到一個8B參數的緊湊模型中,在多個基準上超越了使用前沿大模型的凍結系統,且推理時無需輔助模塊,訓練時無需LLM裁判。

來源arXiv Computational Linguistics作者: Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

知識圖譜問答(KGQA)要求從主題實體出發,經過多個關係跳轉找到答案。傳統方法通常依賴前沿大語言模型(LLM)通過檢索工具探索知識圖譜,但這類方法推理成本高昂,難以在實際場景中部署。針對這一問題,來自學術界的研究團隊提出了Search-on-Graph-R1,通過結合監督微調(SFT)和強化學習(RL),將知識圖譜導航能力內化到一個僅有80億參數(8B)的緊湊語言模型中,從而在不依賴前沿LLM的情況下實現高效KGQA。

該研究的核心創新在於“腳手架”(Scaffolding)策略。具體而言,作者利用每個問題對應的真實SPARQL查詢,引導一個教師模型沿着已知的答案路徑在實時Freebase服務器上執行搜索。由於每次搜索調用都直接針對真實的知識圖譜,生成的軌跡天然與知識圖譜一致,教師模型無需自行探索路徑。這一設計確保了訓練數據的準確性和可靠性,避免了教師模型產生錯誤累積。

在訓練流程上,Search-on-Graph-R1首先通過監督微調(SFT)讓模型學習基本的搜索行為,包括如何解析問題、執行查詢以及沿關係路徑移動。隨後,採用強化學習(RL)進一步優化搜索策略,鼓勵模型用更少的搜索步驟找到正確答案。實驗在WebQSP、CWQ和GrailQA三個標準KGQA數據集上進行評估。結果顯示,8B參數的Search-on-Graph-R1在所有對比的凍結前沿LLM系統中表現最佳,尤其是在CWQ數據集上取得了最強結果。值得注意的是,該模型在推理時不需要任何輔助模塊(如檢索器或重排序器),訓練時也無需使用LLM作為裁判,降低了系統的複雜性和成本。

消融實驗進一步揭示了各訓練階段的貢獻:SFT和RL兩個階段相互補充,SFT提供了良好的初始策略,而RL則使模型能夠更有效地搜索,顯著減少了搜索調用次數。此外,該方法在不同模型家族間具有良好的可遷移性,表明其泛化能力。這項研究為在資源受限環境下高效構建KGQA系統提供了新思路,有望推動知識圖譜問答技術在實際應用中的廣泛部署。