この論文は、2026年9月3日にarXivへ投稿された「Iris: Climbing to the Search Frontier」(arXiv:2609.04304)に関するものです。著者はZiyuan Liu氏を含む9名で、人工知能(cs.AI)分野の研究成果です。提案されるIris-miniとIris-proは、それぞれ35B-A3Bと397B-A17Bというモデル規模を基盤とする検索エージェントです。
データ構築では、ウェブコーパスのハイパーリンク構造を利用します。シードとなるページとそのアウトリンクからエンティティグラフを抽出し、その上で複数ホップにわたる質問チェーンを作成します。すべての非解答エンティティは記述的な参照表現へ書き換えられ、文字列マッチングで手がかりを発見できないようにされます。さらに、参照モデルが閉巻の知識では答えられない一方、根拠となる情報を与えられれば解答できる質問のみが学習データとして採用されます。
生成された質問はエージェントの軌跡へ変換され、軌跡全体とターンレベルの両方でフィルタリングされた後、教師あり微調整(SFT)に使われます。次に、ポリシーはライブ検索を使った強化学習(RL)で最適化されます。報酬判定モデルと観測要約モデルはトレーニングクラスタ内で運用され、長すぎるロールアウトはリクエストレベルで中断され、次のステップでコミット済みプレフィックスから再開されます。このSFTとRLを交互に繰り返す手続きは「SFT-RLクライミング」と呼ばれ、各RLラウンドで最も難しい問題を解けた軌跡と最も効率的だった軌跡が次のSFTパスへ戻されます。
論文は、推論時のコンテキスト管理が、システム間で通常報告される差よりも大きな影響を持つと指摘しています。そのため、すべてのベンチマークでコンテキスト管理の有無を比較し、ツールセット・コンテキスト長・判定モデルを固定しました。すべての結果は単一のReActエージェントのみから得られており、サブエージェントやテスト時の追加検証は使用されていません。コンテキスト管理を有効にした場合、Iris-miniはBrowseCompで82.2、BrowseComp-ZHで84.8、DeepSearchQAで86.9、HLEで52.3を達成し、Iris-proはそれぞれ88.6、85.1、92.9、56.4を達成しました。著者らは、これらが同程度のパラメータ範囲にあるオープンソース検索エージェントの中で最強の総合結果だと述べています。
研究チームは、モデルの重みに加えて、データ構築・学習・評価の完全なレシピも公開する予定であるとしています。