人工知能モデルを自動で構築するエージェントは、科学や工学の幅広い領域で AI へのアクセスを広げる可能性を持つ。これまで注目されてきた系統の手法は、モデル構築をコード探索問題として捉え、木探索で解くものである。木の各ノードは候補プログラムであり、親ノードから子プログラムを生成して木を成長させていく。こうしたエージェントは、現実的なベンチマーク上で経験豊富な AI エンジニアに迫る性能を示すようになった。しかし本論文は、効率の面で十分に解決されていない三つの弱点を指摘する。
第一に、現実的な予算内で実際に実行できる候補の数はごく限られる。そのため、実行済みの報酬でノードを順位付ける探索規則(モンテカルロ型の木探索など)は、数が少なくノイズの大きいスコアに依存することになり、次に探索すべきノードの選択が十分に機能しない。第二に、学習ジョブをスケジューリングする際の資源認識型の戦略が採用されておらず、ハードウェア利用率と学習効率が低下しうる。第三に、エージェントの呼び出しはすべて単一の高性能モデルが処理するため、推論コストが膨らむ。
これら三つの課題に対処するため、著者らは AIBuildAI-2.5 を提案する。これは LLM エージェントによって木探索を実行するエージェント型システムである。中核となるのは新しい LLM 誘導型の木探索であり、判定器(judge)が各候補を「期待される改善」「グラウンディング」「実現可能性」の観点で採点し、選択器(selector)がそのスコアと探索全体の状態に基づいて候補プールを順位付ける。さらにシステムには二つの構成要素が加わる。スケジューラは、現在のハードウェア資源の状況を考慮して学習ジョブを起動する。ルーターは、要求の低いタスクに低コストの LLM を割り当て、AI モデル構築ワークフローの中で最も困難なサブタスクには最も高性能な LLM を温存する。
評価では、AIBuildAI-2.5 は MLE-Bench でメダル率 73.3% を記録して首位となり、AIRS-Bench の自律 AI 研究タスク 6 件でも強力なベースラインを上回った。論文は 2026 年 9 月 6 日 02:42:23 UTC に投稿され、番号は arXiv:2609.25047v1、サイズは約 511 KB、主分類は計算と言語(cs.CL)で人工知能(cs.AI)にも分類されている。著者は Peijia Qin 氏ら 6 名で、投稿記録上の連絡担当は Ruiyi Zhang 氏である。