AI News HubLIVE
站内改写2 分钟阅读

扩展智能体强化学习:为软件工程、终端和搜索提供36.5万个环境

Prime Intellect将23个开源智能体任务集整合到统一的API下,提供超过36.5万个环境,用于软件工程、终端和搜索领域的强化学习训练和评估。所有任务经过金补丁和无操作验证,确保奖励信号干净。

来源Hacker News AI作者: anacleto

开源研究生态系统为智能体领域的三个主要方向——软件工程、终端使用和网络搜索——贡献了大量优秀的数据集。然而,每个数据集都带有独立的测试框架、镜像约定、评分脚本和故障模式,导致它们难以协同使用。为了解决这一问题,Prime Intellect将这些任务集整合到一个统一的taskset API下,提供超过36.5万个环境,可用于强化学习训练和评估。

统一的taskset API支持23个任务集,涵盖约19.8万个软件工程任务(涉及20多种编程语言)、约2.86万个终端任务和约13.76万个搜索任务。这些任务通过verifiers v1工具实现标准化,该工具将每个环境分解为三个独立的层:任务集(taskset)、测试框架(harness)和运行时(runtime)。用户只需一条命令即可运行任意任务集的评估,例如:uv run eval scaleswe-v1 --harness.id codex --harness.runtime.type prime -n 3

为确保数据质量,Prime Intellect对每个数据集进行了金补丁和无操作验证。金补丁验证确保应用参考修复后测试全部通过,无操作验证确保未做任何修改时测试全部失败。验证过程中,失败任务会进行最多10次重试以区分不稳定性和确定性故障,并执行独立的二次检测和多次无编辑检测。不符合条件的任务被排除,并保留在重新上传的数据集中以供审计。例如,R2E-Gym的4,578个实例中有4,522个通过验证,SWE-Lego的4,432个实例中有4,323个通过,Multi-SWE的2,232个实例经过双重金补丁和无编辑过滤后保留。

在软件工程领域,集成了多个知名数据集:SWE-bench Verified(500个经过人工筛选的GitHub问题)、SWE-bench Multilingual(300个跨8种语言的实例)、SWE-smith(83,519个通过注入bug生成的实例)、R2E-Gym(4,578个从真实提交生成的环境)、Multi-SWE(4,703个容器化RL实例)、SWE-rebench-V2(32,079个持续从GitHub PR挖掘的任务)、Scale-SWE(20,181个Python任务)、SWE-Lego(4,432个真实数据实例)、OpenSWE(45,320个任务)以及Senior SWE-Bench(50个调查和设计任务)。所有经过过滤和验证的重新上传均托管在Hugging Face的SWE RL集合中,每个数据集附带详细的变更说明和验证方法。

终端任务方面,Terminal-Lego提供了约13,800个Docker可验证的终端使用任务。搜索任务集包括PaperSearchQA、WideSeek、s1_deepresearch、OpenSeeker、DeepDive、BrowseComp、RedSearcher和BrowseComp_Plus等,总计约13.76万个任务。

Prime Intellect还建立了共享的镜像注册表,包含约13.5万个预构建的开源任务镜像,与沙箱共同部署,避免了大规模并发回滚时Docker Hub的速率限制。在运行过程中,评分材料(如测试补丁、预期输出)被隐藏,仅在评分时刻恢复,防止智能体利用容器内的信息进行奖励作弊。通过这一统一平台,研究人员和开发者可以轻松地在多样化环境上训练和评估智能体,无需处理不同数据集的兼容性问题。