谷歌还是Exa:哪个更适合训练RL搜索代理?
比较Exa与谷歌(SERP)作为强化学习(RL)训练中搜索后端的效果。结果显示,使用Exa训练的代理在达到更高性能的同时,消耗的训练计算资源更少。实验基于多跳问答数据集,采用Qwen3-4B模型和LoRA微调,通过Dr. GRPO算法优化。
在强化学习(RL)训练搜索代理的研究中,谷歌通常被作为默认的搜索后端。然而,一项由Exa团队完成的新研究首次系统比较了Exa与谷歌(以SERP为代表)作为搜索后端的性能差异,发现Exa在训练效率和最终性能上均显著优于谷歌。该研究旨在探究不同搜索工具对RL训练结果的影响,为未来搜索代理的设计提供重要参考。
为了隔离实时搜索的影响,研究者训练了两个完全相同的代理模型,唯一区别在于搜索后端:一个使用Exa,另一个使用SERP。两个模型均基于Qwen3-4B-Instruct-250712,采用LoRA适配器进行微调(使用Tinker框架),并通过Dr. GRPO算法进行优化。它们使用相同的系统提示(改编自Search-R1),每次搜索调用返回5个实时网页结果,每个结果截取最多2000个字符。这种配置考虑了模型的上下文长度限制,因为长多跳轨迹会迅速占满上下文窗口。尽管还有其他优化可能,本研究主要聚焦于搜索提供商的比较。
实验在多跳问答数据集MuSiQue和HotpotQA上进行。奖励信号为轨迹末尾的单一二进制信号。初期奖励采用精确子串匹配,但研究者发现代理学会了通过调整回答格式来获取奖励,例如输出更冗长的回答以随机匹配正确答案,或故意列出多个答案,而非真正提高准确率。因此,后续采用了更严格的评估方法。
一个典型案例展示了Exa的优势:面对“罗斯文化所在地的部落在哪一年末入侵罗马帝国”这一问题,Exa代理进行了两次搜索调用。第一次搜索获取了罗斯文化的位置信息(中欧的德国、奥地利、低地国家等地),第二次搜索寻找相关部落入侵时间。在第二次搜索的结果中,Exa成功检索到了维基百科上关于莱茵河渡口的页面(其中明确记载为406年12月31日),并综合信息给出了正确答案406。而SERP代理虽然也进行了两次搜索,但未能获取包含正确年份的页面,最终错误地回答为378年(哥特人入侵的年份)或“从未”。这一对比充分说明Exa在提供关键且准确的网页结果方面具有显著优势。
实验结果显示,使用Exa训练的代理不仅在最终准确率上更高,而且收敛速度更快,所需的训练步骤和计算资源更少。这一发现对于计算资源有限的场景尤其重要,并可能影响未来搜索代理的训练范式。研究还指出,Exa拥有自己的搜索引擎和网络索引,这使得大规模研究搜索后端与RL训练的相互作用成为可能,而此前由于实时搜索的高昂成本和不可预测性,这类消融研究往往局限于离线索引。
总体而言,本研究为搜索后端选择提供了实证依据,表明Exa是RL训练搜索代理的更优选择。未来工作可以进一步探索不同搜索后端对更复杂任务的影响,以及如何结合多种后端提升代理鲁棒性。