跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

AIBuildAI-2.5:通过 LLM 引导的树搜索实现高效的自主 AI 模型开发

文章摘要

该论文提出 AIBuildAI-2.5,一个用 LLM 智能体执行树搜索的自主 AI 模型构建系统。它用“评判器+选择器”的 LLM 引导树搜索替代按已执行奖励排序的蒙特卡洛式搜索,并加入资源感知调度器与按任务难度分派的模型路由器,以改善搜索决策、提升硬件利用率并压低推理成本。系统在 MLE-Bench 上以 73.3% 的奖牌率排名第一,并在 AIRS-Bench 的六项自主 AI 研究任务上超过强基线。

来源arXiv Computational Linguistics作者: Peijia Qin, Ruiyi Zhang, Qi Cao, Han Guo, Li Zhang, Pengtao Xie
AIBuildAI-2.5:通过 LLM 引导的树搜索实现高效的自主 AI 模型开发
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

让智能体自动构建人工智能模型,被认为有望把 AI 能力扩散到科学与工程的各个领域。此前一类较受关注的做法把“造模型”表述为代码搜索问题,并用树搜索求解:树的每个节点是一个候选程序,系统从父节点生成子程序来让树生长,这类智能体如今在真实基准上已接近有经验的 AI 工程师水平。但论文指出,这类智能体在效率上仍有三处尚未被充分解决的短板。

第一处短板与预算约束下的评估噪声有关。在符合现实的算力预算内,真正能被执行的候选程序数量很少,于是那些按“已执行奖励”给节点排序的搜索规则(例如蒙特卡洛式树搜索)只能依赖数量有限且噪声很大的分数,导致“下一步探索哪个节点”的选择不够有效。第二处短板是训练作业的调度:系统没有采用资源感知的策略来决定作业如何启动,这可能拉低硬件利用率与训练效率。第三处短板出现在推理侧:每一次智能体调用都由同一个强模型承担,推理成本因此被抬高。

针对这三点,作者提出 AIBuildAI-2.5——一个用 LLM 智能体执行树搜索的系统。其核心是一种 LLM 引导的树搜索:由评判器(judge)从预期提升、依据性(grounding)与可行性三个维度为每个候选打分,再由选择器(selector)依据这些分数以及搜索整体状态对候选池排序。系统另有两个配套组件:调度器在启动训练作业时会考虑当前硬件资源的实时状况;路由器则按任务要求分层,把成本更低的 LLM 用于要求较低的任务,而把能力最强的 LLM 保留给 AI 模型构建流程中最具挑战性的子任务。

评测结果方面,AIBuildAI-2.5 在 MLE-Bench 上以 73.3% 的奖牌率排名第一,并在 AIRS-Bench 的六项自主 AI 研究任务上超过一个强基线。论文的提交时间为 2026 年 9 月 6 日 02:42:23 UTC,编号 arXiv:2609.25047v1,篇幅约 511 KB,主要归类为计算与语言(cs.CL),同时归入人工智能(cs.AI);作者为 Peijia Qin 等共六人,提交记录显示联系人为 Ruiyi Zhang。

展开要点与分析

文章情报

工程师进阶

要点

  • 用 LLM 引导的树搜索替代按已执行奖励排序的传统规则:评判器从预期提升、依据性与可行性三方面为候选程序打分,选择器再结合这些分数与搜索状态对候选池排序。
  • 资源感知调度器在启动作业时考虑当前硬件资源状况,以提升硬件利用率与训练效率。
  • 模型路由器把成本更低的 LLM 分配给要求较低的任务,把能力最强的模型留给工作流中最具挑战性的子任务,从而抑制推理开销。
  • 在 MLE-Bench 上以 73.3% 的奖牌率位列第一,并在 AIRS-Bench 的六项自主 AI 研究任务上优于强基线。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。