本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

Iris:検索フロンティアへの挑戦

記事の要約

本論文は、35B-A3B と 397B-A17B のスケールで学習された2つのオープンソース検索エージェント Iris-mini と Iris-pro を紹介する。ウェブのハイパーリンク構造から多段階質問を逆構築し、フィルタリングして SFT に用いた後、ライブ検索環境での RL と SFT を交互に行う「SFT-RLクライミング」で性能を高める。推論時のコンテキスト管理を有効にすると、BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE で各パラメータ規模のオープンソース検索エージェントとして最強の総合結果を達成した。

ソースarXiv AI著者: Ziyuan Liu, Hengqi Liu, Zichuan Wang, Yang Qin, Jiachen Liang, Xu Chu, Shaowei Chen, Yuantao Gu, Mu Chuan
Iris:検索フロンティアへの挑戦
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

この論文は、2026年9月3日にarXivへ投稿された「Iris: Climbing to the Search Frontier」(arXiv:2609.04304)に関するものです。著者はZiyuan Liu氏を含む9名で、人工知能(cs.AI)分野の研究成果です。提案されるIris-miniとIris-proは、それぞれ35B-A3Bと397B-A17Bというモデル規模を基盤とする検索エージェントです。

データ構築では、ウェブコーパスのハイパーリンク構造を利用します。シードとなるページとそのアウトリンクからエンティティグラフを抽出し、その上で複数ホップにわたる質問チェーンを作成します。すべての非解答エンティティは記述的な参照表現へ書き換えられ、文字列マッチングで手がかりを発見できないようにされます。さらに、参照モデルが閉巻の知識では答えられない一方、根拠となる情報を与えられれば解答できる質問のみが学習データとして採用されます。

生成された質問はエージェントの軌跡へ変換され、軌跡全体とターンレベルの両方でフィルタリングされた後、教師あり微調整(SFT)に使われます。次に、ポリシーはライブ検索を使った強化学習(RL)で最適化されます。報酬判定モデルと観測要約モデルはトレーニングクラスタ内で運用され、長すぎるロールアウトはリクエストレベルで中断され、次のステップでコミット済みプレフィックスから再開されます。このSFTとRLを交互に繰り返す手続きは「SFT-RLクライミング」と呼ばれ、各RLラウンドで最も難しい問題を解けた軌跡と最も効率的だった軌跡が次のSFTパスへ戻されます。

論文は、推論時のコンテキスト管理が、システム間で通常報告される差よりも大きな影響を持つと指摘しています。そのため、すべてのベンチマークでコンテキスト管理の有無を比較し、ツールセット・コンテキスト長・判定モデルを固定しました。すべての結果は単一のReActエージェントのみから得られており、サブエージェントやテスト時の追加検証は使用されていません。コンテキスト管理を有効にした場合、Iris-miniはBrowseCompで82.2、BrowseComp-ZHで84.8、DeepSearchQAで86.9、HLEで52.3を達成し、Iris-proはそれぞれ88.6、85.1、92.9、56.4を達成しました。著者らは、これらが同程度のパラメータ範囲にあるオープンソース検索エージェントの中で最強の総合結果だと述べています。

研究チームは、モデルの重みに加えて、データ構築・学習・評価の完全なレシピも公開する予定であるとしています。

要点と分析を開く

記事インテリジェンス

エンジニア中級

要点

  • Iris-mini(35B-A3B)と Iris-pro(397B-A17B)という2つのオープンソース検索エージェントを提案。
  • ウェブのリンク構造から多ホップ問題を自動構築し、文字列一致や閉巻知識では解けない問題のみを学習に使用。
  • SFTとRLを交互に行う「SFT-RLクライミング」で、難易度の高い問題へ継続的に適応。
  • 推論時コンテキスト管理により、単一のReActエージェントで最高水準のベンチマーク結果を達成。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。