本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

AIBuildAI-2.5:LLM 誘導型木探索による効率的な自律 AI モデル開発

記事の要約

本論文は、LLM エージェントで木探索を実行する自律型 AI モデル構築システム「AIBuildAI-2.5」を提案する。実行済み報酬による順位付けを、判定器と選択器による LLM 誘導型木探索に置き換え、ハードウェア資源を考慮するスケジューラとタスク難易度に応じてモデルを使い分けるルーターを追加して、探索判断の質・資源利用率・推論コストを改善する。MLE-Bench でメダル率 73.3% の首位、AIRS-Bench の自律研究タスク 6 件でも強力なベースラインを上回った。

ソースarXiv Computational Linguistics著者: Peijia Qin, Ruiyi Zhang, Qi Cao, Han Guo, Li Zhang, Pengtao Xie
AIBuildAI-2.5:LLM 誘導型木探索による効率的な自律 AI モデル開発
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

人工知能モデルを自動で構築するエージェントは、科学や工学の幅広い領域で AI へのアクセスを広げる可能性を持つ。これまで注目されてきた系統の手法は、モデル構築をコード探索問題として捉え、木探索で解くものである。木の各ノードは候補プログラムであり、親ノードから子プログラムを生成して木を成長させていく。こうしたエージェントは、現実的なベンチマーク上で経験豊富な AI エンジニアに迫る性能を示すようになった。しかし本論文は、効率の面で十分に解決されていない三つの弱点を指摘する。

第一に、現実的な予算内で実際に実行できる候補の数はごく限られる。そのため、実行済みの報酬でノードを順位付ける探索規則(モンテカルロ型の木探索など)は、数が少なくノイズの大きいスコアに依存することになり、次に探索すべきノードの選択が十分に機能しない。第二に、学習ジョブをスケジューリングする際の資源認識型の戦略が採用されておらず、ハードウェア利用率と学習効率が低下しうる。第三に、エージェントの呼び出しはすべて単一の高性能モデルが処理するため、推論コストが膨らむ。

これら三つの課題に対処するため、著者らは AIBuildAI-2.5 を提案する。これは LLM エージェントによって木探索を実行するエージェント型システムである。中核となるのは新しい LLM 誘導型の木探索であり、判定器(judge)が各候補を「期待される改善」「グラウンディング」「実現可能性」の観点で採点し、選択器(selector)がそのスコアと探索全体の状態に基づいて候補プールを順位付ける。さらにシステムには二つの構成要素が加わる。スケジューラは、現在のハードウェア資源の状況を考慮して学習ジョブを起動する。ルーターは、要求の低いタスクに低コストの LLM を割り当て、AI モデル構築ワークフローの中で最も困難なサブタスクには最も高性能な LLM を温存する。

評価では、AIBuildAI-2.5 は MLE-Bench でメダル率 73.3% を記録して首位となり、AIRS-Bench の自律 AI 研究タスク 6 件でも強力なベースラインを上回った。論文は 2026 年 9 月 6 日 02:42:23 UTC に投稿され、番号は arXiv:2609.25047v1、サイズは約 511 KB、主分類は計算と言語(cs.CL)で人工知能(cs.AI)にも分類されている。著者は Peijia Qin 氏ら 6 名で、投稿記録上の連絡担当は Ruiyi Zhang 氏である。

要点と分析を開く

記事インテリジェンス

エンジニア中級

要点

  • 実行済み報酬でノードを順位付ける従来の探索規則を、LLM 誘導型の木探索に置き換える。判定器が各候補を「期待される改善」「グラウンディング」「実現可能性」で採点し、選択器がそのスコアと探索状態から候補プールを順位付ける。
  • 資源を考慮するスケジューラが現在のハードウェア資源の状況を踏まえて学習ジョブを起動し、ハードウェア利用率と学習効率を高める。
  • ルーターが負荷の低いタスクに低コストの LLM を割り当て、最も難しいサブタスクには最高性能モデルを温存して推論コストを抑える。
  • MLE-Bench でメダル率 73.3% の首位、AIRS-Bench の自律 AI 研究タスク 6 件で強力なベースラインを上回る。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。