跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

AIBuildAI-2.5:透過 LLM 引導的樹搜尋實現高效的自主 AI 模型開發

文章摘要

該論文提出 AIBuildAI-2.5,一個用 LLM 智慧體執行樹搜尋的自主 AI 模型構建系統。它用“評判器+選擇器”的 LLM 引導樹搜尋替代按已執行獎勵排序的蒙特卡洛式搜尋,並加入資源感知排程器與按任務難度分派的模型路由器,以改善搜尋決策、提升硬體利用率並壓低推理成本。系統在 MLE-Bench 上以 73.3% 的獎牌率排名第一,並在 AIRS-Bench 的六項自主 AI 研究任務上超過強基線。

來源arXiv Computational Linguistics作者: Peijia Qin, Ruiyi Zhang, Qi Cao, Han Guo, Li Zhang, Pengtao Xie
AIBuildAI-2.5:透過 LLM 引導的樹搜尋實現高效的自主 AI 模型開發
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

讓智慧體自動構建人工智慧模型,被認為有望把 AI 能力擴散到科學與工程的各個領域。此前一類較受關注的做法把“造模型”表述為程式碼搜尋問題,並用樹搜尋求解:樹的每個節點是一個候選程式,系統從父節點生成子程式來讓樹生長,這類智慧體如今在真實基準上已接近有經驗的 AI 工程師水平。但論文指出,這類智慧體在效率上仍有三處尚未被充分解決的短板。

第一處短板與預算約束下的評估噪聲有關。在符合現實的算力預算內,真正能被執行的候選程式數量很少,於是那些按“已執行獎勵”給節點排序的搜尋規則(例如蒙特卡洛式樹搜尋)只能依賴數量有限且噪聲很大的分數,導致“下一步探索哪個節點”的選擇不夠有效。第二處短板是訓練作業的排程:系統沒有采用資源感知的策略來決定作業如何啟動,這可能拉低硬體利用率與訓練效率。第三處短板出現在推理側:每一次智慧體呼叫都由同一個強模型承擔,推理成本因此被抬高。

針對這三點,作者提出 AIBuildAI-2.5——一個用 LLM 智慧體執行樹搜尋的系統。其核心是一種 LLM 引導的樹搜尋:由評判器(judge)從預期提升、依據性(grounding)與可行性三個維度為每個候選打分,再由選擇器(selector)依據這些分數以及搜尋整體狀態對候選池排序。系統另有兩個配套元件:排程器在啟動訓練作業時會考慮當前硬體資源的即時狀況;路由器則按任務要求分層,把成本更低的 LLM 用於要求較低的任務,而把能力最強的 LLM 保留給 AI 模型構建流程中最具挑戰性的子任務。

評測結果方面,AIBuildAI-2.5 在 MLE-Bench 上以 73.3% 的獎牌率排名第一,並在 AIRS-Bench 的六項自主 AI 研究任務上超過一個強基線。論文的提交時間為 2026 年 9 月 6 日 02:42:23 UTC,編號 arXiv:2609.25047v1,篇幅約 511 KB,主要歸類為計算與語言(cs.CL),同時歸入人工智慧(cs.AI);作者為 Peijia Qin 等共六人,提交記錄顯示聯絡人為 Ruiyi Zhang。

展開要點與分析

文章情報

工程師進階

要點

  • 用 LLM 引導的樹搜尋替代按已執行獎勵排序的傳統規則:評判器從預期提升、依據性與可行性三方面為候選程式打分,選擇器再結合這些分數與搜尋狀態對候選池排序。
  • 資源感知排程器在啟動作業時考慮當前硬體資源狀況,以提升硬體利用率與訓練效率。
  • 模型路由器把成本更低的 LLM 分配給要求較低的任務,把能力最強的模型留給工作流中最具挑戰性的子任務,從而抑制推理開銷。
  • 在 MLE-Bench 上以 73.3% 的獎牌率位列第一,並在 AIRS-Bench 的六項自主 AI 研究任務上優於強基線。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。