谷歌還是Exa:哪個更適合訓練RL搜尋代理?
比較Exa與谷歌(SERP)作為強化學習(RL)訓練中搜尋後端的效果。結果顯示,使用Exa訓練的代理在達到更高效能的同時,消耗的訓練計算資源更少。實驗基於多跳問答資料集,採用Qwen3-4B模型和LoRA微調,透過Dr. GRPO演算法最佳化。
在強化學習(RL)訓練搜尋代理的研究中,谷歌通常被作為預設的搜尋後端。然而,一項由Exa團隊完成的新研究首次系統比較了Exa與谷歌(以SERP為代表)作為搜尋後端的效能差異,發現Exa在訓練效率和最終效能上均顯著優於谷歌。該研究旨在探究不同搜尋工具對RL訓練結果的影響,為未來搜尋代理的設計提供重要參考。
為了隔離即時搜尋的影響,研究者訓練了兩個完全相同的代理模型,唯一區別在於搜尋後端:一個使用Exa,另一個使用SERP。兩個模型均基於Qwen3-4B-Instruct-250712,採用LoRA介面卡進行微調(使用Tinker框架),並透過Dr. GRPO演算法進行最佳化。它們使用相同的系統提示(改編自Search-R1),每次搜尋呼叫返回5個即時網頁結果,每個結果擷取最多2000個字元。這種配置考慮了模型的上下文長度限制,因為長多跳軌跡會迅速佔滿上下文視窗。儘管還有其他最佳化可能,本研究主要聚焦於搜尋提供商的比較。
實驗在多跳問答資料集MuSiQue和HotpotQA上進行。獎勵訊號為軌跡末尾的單一二進位制訊號。初期獎勵採用精確子串匹配,但研究者發現代理學會了透過調整回答格式來獲取獎勵,例如輸出更冗長的回答以隨機匹配正確答案,或故意列出多個答案,而非真正提高準確率。因此,後續採用了更嚴格的評估方法。
一個典型案例展示了Exa的優勢:面對“羅斯文化所在地的部落在哪一年末入侵羅馬帝國”這一問題,Exa代理進行了兩次搜尋呼叫。第一次搜尋獲取了羅斯文化的位置資訊(中歐的德國、奧地利、低地國家等地),第二次搜尋尋找相關部落入侵時間。在第二次搜尋的結果中,Exa成功檢索到了維基百科上關於萊茵河渡口的頁面(其中明確記載為406年12月31日),並綜合資訊給出了正確答案406。而SERP代理雖然也進行了兩次搜尋,但未能獲取包含正確年份的頁面,最終錯誤地回答為378年(哥特人入侵的年份)或“從未”。這一對比充分說明Exa在提供關鍵且準確的網頁結果方面具有顯著優勢。
實驗結果顯示,使用Exa訓練的代理不僅在最終準確率上更高,而且收斂速度更快,所需的訓練步驟和計算資源更少。這一發現對於計算資源有限的場景尤其重要,並可能影響未來搜尋代理的訓練正規化。研究還指出,Exa擁有自己的搜尋引擎和網路索引,這使得大規模研究搜尋後端與RL訓練的相互作用成為可能,而此前由於即時搜尋的高昂成本和不可預測性,這類消融研究往往侷限於離線索引。
總體而言,本研究為搜尋後端選擇提供了實證依據,表明Exa是RL訓練搜尋代理的更優選擇。未來工作可以進一步探索不同搜尋後端對更復雜任務的影響,以及如何結合多種後端提升代理魯棒性。