AI News HubLIVE
站內改寫2 分鐘閱讀

谷歌還是Exa:哪個更適合訓練RL搜索代理?

比較Exa與谷歌(SERP)作為強化學習(RL)訓練中搜索後端的效果。結果顯示,使用Exa訓練的代理在達到更高性能的同時,消耗的訓練計算資源更少。實驗基於多跳問答數據集,採用Qwen3-4B模型和LoRA微調,通過Dr. GRPO算法優化。

來源Hacker News AI作者: willbryk

在強化學習(RL)訓練搜索代理的研究中,谷歌通常被作為默認的搜索後端。然而,一項由Exa團隊完成的新研究首次系統比較了Exa與谷歌(以SERP為代表)作為搜索後端的性能差異,發現Exa在訓練效率和最終性能上均顯著優於谷歌。該研究旨在探究不同搜索工具對RL訓練結果的影響,為未來搜索代理的設計提供重要參考。

為了隔離實時搜索的影響,研究者訓練了兩個完全相同的代理模型,唯一區別在於搜索後端:一個使用Exa,另一個使用SERP。兩個模型均基於Qwen3-4B-Instruct-250712,採用LoRA適配器進行微調(使用Tinker框架),並通過Dr. GRPO算法進行優化。它們使用相同的系統提示(改編自Search-R1),每次搜索調用返回5個實時網頁結果,每個結果截取最多2000個字符。這種配置考慮了模型的上下文長度限制,因為長多跳軌跡會迅速佔滿上下文窗口。儘管還有其他優化可能,本研究主要聚焦於搜索提供商的比較。

實驗在多跳問答數據集MuSiQue和HotpotQA上進行。獎勵信號為軌跡末尾的單一二進制信號。初期獎勵採用精確子串匹配,但研究者發現代理學會了通過調整回答格式來獲取獎勵,例如輸出更冗長的回答以隨機匹配正確答案,或故意列出多個答案,而非真正提高準確率。因此,後續採用了更嚴格的評估方法。

一個典型案例展示了Exa的優勢:面對“羅斯文化所在地的部落在哪一年末入侵羅馬帝國”這一問題,Exa代理進行了兩次搜索調用。第一次搜索獲取了羅斯文化的位置信息(中歐的德國、奧地利、低地國家等地),第二次搜索尋找相關部落入侵時間。在第二次搜索的結果中,Exa成功檢索到了維基百科上關於萊茵河渡口的頁面(其中明確記載為406年12月31日),並綜合信息給出了正確答案406。而SERP代理雖然也進行了兩次搜索,但未能獲取包含正確年份的頁面,最終錯誤地回答為378年(哥特人入侵的年份)或“從未”。這一對比充分説明Exa在提供關鍵且準確的網頁結果方面具有顯著優勢。

實驗結果顯示,使用Exa訓練的代理不僅在最終準確率上更高,而且收斂速度更快,所需的訓練步驟和計算資源更少。這一發現對於計算資源有限的場景尤其重要,並可能影響未來搜索代理的訓練範式。研究還指出,Exa擁有自己的搜索引擎和網絡索引,這使得大規模研究搜索後端與RL訓練的相互作用成為可能,而此前由於實時搜索的高昂成本和不可預測性,這類消融研究往往侷限於離線索引。

總體而言,本研究為搜索後端選擇提供了實證依據,表明Exa是RL訓練搜索代理的更優選擇。未來工作可以進一步探索不同搜索後端對更復雜任務的影響,以及如何結合多種後端提升代理魯棒性。