來自 arXiv 的新論文“Iris: Climbing to the Search Frontier”提出了兩個開放搜索智能體:Iris-mini 與 Iris-pro。Iris-mini 對應的模型規模為 35B-A3B,Iris-pro 則為 397B-A17B。論文於 2026 年 9 月 3 日提交,作者為 Ziyuan Liu 等 9 人,正文共 12 頁、2 幅圖,屬於人工智能(cs.AI)領域。
在數據層面,研究者沒有依賴大規模人工標註,而是從網絡語料的超鏈接結構“反向構造”任務。具體來説,他們先以某個種子網頁為起點,在其外部鏈接形成的實體圖上生成多跳問題鏈;隨後把問題中所有非答案實體改寫為描述性指代,確保無法通過字符串匹配直接找到答案。最後,只有參考模型無法閉卷回答、但獲得補充證據後能夠正確解決的問題才會被保留。隨後,這些問題被轉換成智能體的完整軌跡,並在軌跡層面和單個回合層面分別過濾,用於監督微調(SFT)。
訓練階段的核心是論文提出的“SFT-RL 爬升”流程。模型先基於過濾後的高質量軌跡進行 SFT,然後與實時搜索環境進行強化學習(RL)。獎勵判斷器和觀測摘要器都運行在訓練集羣內部,過長的 rollout 會在請求層被中斷,並在下一步從已經提交的前綴繼續執行。每一輪 RL 結束後,其中最難被解決以及執行效率最高的軌跡會被送回下一輪 SFT,如此交替循環,使模型不斷向更難的問題“爬升”。
論文特別強調,推理時的上下文管理帶來的性能提升通常比許多系統間的差異更顯著。因此,他們在所有基準上都分別比較了“啓用”和“不啓用”上下文管理的設置,並固定工具集、上下文長度與評判模型。所有結果均來自單一的 ReAct 智能體,沒有使用子智能體,也沒有測試時驗證。啓用上下文管理時,Iris-mini 在 BrowseComp、BrowseComp-ZH、DeepSearchQA 與 HLE 上分別達到 82.2、84.8、86.9 和 52.3;Iris-pro 則分別達到 88.6、85.1、92.9 和 56.4。作者表示,這在這些基準上對應參數範圍內屬於開源搜索智能體的最強整體結果。
研究團隊計劃開放模型權重,並公開數據構建、訓練和評估的完整方案,以便社區復現並繼續推進相關工作。