跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

Iris:向搜索前沿攀登

文章摘要

本文介紹 Iris-mini 和 Iris-pro 兩個開放搜索智能體,分別基於 35B-A3B 和 397B-A17B 規模訓練。作者提出從網頁超鏈接結構反向構建多跳問題的數據管線,並通過 SFT-RL 爬升方法交替進行監督微調與實時搜索強化學習。啓用推理時上下文管理後,兩個模型在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 HLE 上取得了開源搜索智能體中的領先成績。

來源arXiv AI作者: Ziyuan Liu, Hengqi Liu, Zichuan Wang, Yang Qin, Jiachen Liang, Xu Chu, Shaowei Chen, Yuantao Gu, Mu Chuan
Iris:向搜索前沿攀登
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

來自 arXiv 的新論文“Iris: Climbing to the Search Frontier”提出了兩個開放搜索智能體:Iris-mini 與 Iris-pro。Iris-mini 對應的模型規模為 35B-A3B,Iris-pro 則為 397B-A17B。論文於 2026 年 9 月 3 日提交,作者為 Ziyuan Liu 等 9 人,正文共 12 頁、2 幅圖,屬於人工智能(cs.AI)領域。

在數據層面,研究者沒有依賴大規模人工標註,而是從網絡語料的超鏈接結構“反向構造”任務。具體來説,他們先以某個種子網頁為起點,在其外部鏈接形成的實體圖上生成多跳問題鏈;隨後把問題中所有非答案實體改寫為描述性指代,確保無法通過字符串匹配直接找到答案。最後,只有參考模型無法閉卷回答、但獲得補充證據後能夠正確解決的問題才會被保留。隨後,這些問題被轉換成智能體的完整軌跡,並在軌跡層面和單個回合層面分別過濾,用於監督微調(SFT)。

訓練階段的核心是論文提出的“SFT-RL 爬升”流程。模型先基於過濾後的高質量軌跡進行 SFT,然後與實時搜索環境進行強化學習(RL)。獎勵判斷器和觀測摘要器都運行在訓練集羣內部,過長的 rollout 會在請求層被中斷,並在下一步從已經提交的前綴繼續執行。每一輪 RL 結束後,其中最難被解決以及執行效率最高的軌跡會被送回下一輪 SFT,如此交替循環,使模型不斷向更難的問題“爬升”。

論文特別強調,推理時的上下文管理帶來的性能提升通常比許多系統間的差異更顯著。因此,他們在所有基準上都分別比較了“啓用”和“不啓用”上下文管理的設置,並固定工具集、上下文長度與評判模型。所有結果均來自單一的 ReAct 智能體,沒有使用子智能體,也沒有測試時驗證。啓用上下文管理時,Iris-mini 在 BrowseComp、BrowseComp-ZH、DeepSearchQA 與 HLE 上分別達到 82.2、84.8、86.9 和 52.3;Iris-pro 則分別達到 88.6、85.1、92.9 和 56.4。作者表示,這在這些基準上對應參數範圍內屬於開源搜索智能體的最強整體結果。

研究團隊計劃開放模型權重,並公開數據構建、訓練和評估的完整方案,以便社區復現並繼續推進相關工作。

展開要點與分析

文章情報

工程師進階

要點

  • Iris-mini 與 Iris-pro 是不同參數規模的開放搜索智能體,使用單一 ReAct 智能體完成搜索任務。
  • 訓練數據通過網頁超鏈接結構自動構建多跳問題,並確保問題無法靠閉卷知識或字符串匹配解決。
  • SFT-RL 爬升方法交替執行監督微調和針對實時搜索的強化學習,不斷提升難度。
  • 啓用推理時上下文管理後,在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 HLE 基準上達到開源搜索智能體的最強成績。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。