来自 arXiv 的新论文“Iris: Climbing to the Search Frontier”提出了两个开放搜索智能体:Iris-mini 与 Iris-pro。Iris-mini 对应的模型规模为 35B-A3B,Iris-pro 则为 397B-A17B。论文于 2026 年 9 月 3 日提交,作者为 Ziyuan Liu 等 9 人,正文共 12 页、2 幅图,属于人工智能(cs.AI)领域。
在数据层面,研究者没有依赖大规模人工标注,而是从网络语料的超链接结构“反向构造”任务。具体来说,他们先以某个种子网页为起点,在其外部链接形成的实体图上生成多跳问题链;随后把问题中所有非答案实体改写为描述性指代,确保无法通过字符串匹配直接找到答案。最后,只有参考模型无法闭卷回答、但获得补充证据后能够正确解决的问题才会被保留。随后,这些问题被转换成智能体的完整轨迹,并在轨迹层面和单个回合层面分别过滤,用于监督微调(SFT)。
训练阶段的核心是论文提出的“SFT-RL 爬升”流程。模型先基于过滤后的高质量轨迹进行 SFT,然后与实时搜索环境进行强化学习(RL)。奖励判断器和观测摘要器都运行在训练集群内部,过长的 rollout 会在请求层被中断,并在下一步从已经提交的前缀继续执行。每一轮 RL 结束后,其中最难被解决以及执行效率最高的轨迹会被送回下一轮 SFT,如此交替循环,使模型不断向更难的问题“爬升”。
论文特别强调,推理时的上下文管理带来的性能提升通常比许多系统间的差异更显著。因此,他们在所有基准上都分别比较了“启用”和“不启用”上下文管理的设置,并固定工具集、上下文长度与评判模型。所有结果均来自单一的 ReAct 智能体,没有使用子智能体,也没有测试时验证。启用上下文管理时,Iris-mini 在 BrowseComp、BrowseComp-ZH、DeepSearchQA 与 HLE 上分别达到 82.2、84.8、86.9 和 52.3;Iris-pro 则分别达到 88.6、85.1、92.9 和 56.4。作者表示,这在这些基准上对应参数范围内属于开源搜索智能体的最强整体结果。
研究团队计划开放模型权重,并公开数据构建、训练和评估的完整方案,以便社区复现并继续推进相关工作。