让智能体自动构建人工智能模型,被认为有望把 AI 能力扩散到科学与工程的各个领域。此前一类较受关注的做法把“造模型”表述为代码搜索问题,并用树搜索求解:树的每个节点是一个候选程序,系统从父节点生成子程序来让树生长,这类智能体如今在真实基准上已接近有经验的 AI 工程师水平。但论文指出,这类智能体在效率上仍有三处尚未被充分解决的短板。
第一处短板与预算约束下的评估噪声有关。在符合现实的算力预算内,真正能被执行的候选程序数量很少,于是那些按“已执行奖励”给节点排序的搜索规则(例如蒙特卡洛式树搜索)只能依赖数量有限且噪声很大的分数,导致“下一步探索哪个节点”的选择不够有效。第二处短板是训练作业的调度:系统没有采用资源感知的策略来决定作业如何启动,这可能拉低硬件利用率与训练效率。第三处短板出现在推理侧:每一次智能体调用都由同一个强模型承担,推理成本因此被抬高。
针对这三点,作者提出 AIBuildAI-2.5——一个用 LLM 智能体执行树搜索的系统。其核心是一种 LLM 引导的树搜索:由评判器(judge)从预期提升、依据性(grounding)与可行性三个维度为每个候选打分,再由选择器(selector)依据这些分数以及搜索整体状态对候选池排序。系统另有两个配套组件:调度器在启动训练作业时会考虑当前硬件资源的实时状况;路由器则按任务要求分层,把成本更低的 LLM 用于要求较低的任务,而把能力最强的 LLM 保留给 AI 模型构建流程中最具挑战性的子任务。
评测结果方面,AIBuildAI-2.5 在 MLE-Bench 上以 73.3% 的奖牌率排名第一,并在 AIRS-Bench 的六项自主 AI 研究任务上超过一个强基线。论文的提交时间为 2026 年 9 月 6 日 02:42:23 UTC,编号 arXiv:2609.25047v1,篇幅约 511 KB,主要归类为计算与语言(cs.CL),同时归入人工智能(cs.AI);作者为 Peijia Qin 等共六人,提交记录显示联系人为 Ruiyi Zhang。