Search-on-Graph-R1:利用強化學習訓練大語言模型搜尋知識圖譜
Search-on-Graph-R1透過監督微調(SFT)和強化學習(RL),將知識圖譜問答的導航能力內化到一個8B引數的緊湊模型中,在多個基準上超越了使用前沿大模型的凍結系統,且推理時無需輔助模組,訓練時無需LLM裁判。
知識圖譜問答(KGQA)要求從主題實體出發,經過多個關係跳轉找到答案。傳統方法通常依賴前沿大語言模型(LLM)透過檢索工具探索知識圖譜,但這類方法推理成本高昂,難以在實際場景中部署。針對這一問題,來自學術界的研究團隊提出了Search-on-Graph-R1,透過結合監督微調(SFT)和強化學習(RL),將知識圖譜導航能力內化到一個僅有80億引數(8B)的緊湊語言模型中,從而在不依賴前沿LLM的情況下實現高效KGQA。
該研究的核心創新在於“腳手架”(Scaffolding)策略。具體而言,作者利用每個問題對應的真實SPARQL查詢,引導一個教師模型沿著已知的答案路徑在即時Freebase伺服器上執行搜尋。由於每次搜尋呼叫都直接針對真實的知識圖譜,生成的軌跡天然與知識圖譜一致,教師模型無需自行探索路徑。這一設計確保了訓練資料的準確性和可靠性,避免了教師模型產生錯誤累積。
在訓練流程上,Search-on-Graph-R1首先透過監督微調(SFT)讓模型學習基本的搜尋行為,包括如何解析問題、執行查詢以及沿關係路徑移動。隨後,採用強化學習(RL)進一步最佳化搜尋策略,鼓勵模型用更少的搜尋步驟找到正確答案。實驗在WebQSP、CWQ和GrailQA三個標準KGQA資料集上進行評估。結果顯示,8B引數的Search-on-Graph-R1在所有對比的凍結前沿LLM系統中表現最佳,尤其是在CWQ資料集上取得了最強結果。值得注意的是,該模型在推理時不需要任何輔助模組(如檢索器或重排序器),訓練時也無需使用LLM作為裁判,降低了系統的複雜性和成本。
消融實驗進一步揭示了各訓練階段的貢獻:SFT和RL兩個階段相互補充,SFT提供了良好的初始策略,而RL則使模型能夠更有效地搜尋,顯著減少了搜尋呼叫次數。此外,該方法在不同模型家族間具有良好的可遷移性,表明其泛化能力。這項研究為在資源受限環境下高效構建KGQA系統提供了新思路,有望推動知識圖譜問答技術在實際應用中的廣泛部署。