跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

Harbor Adapters与Harbor-Index:面向大规模智能体评测的基础设施与精选元数据集

文章摘要

本文提出了Harbor Adapters,一个统一的智能体基准评测基础设施,可将80多个基准适配到任意智能体上;通过代码审查与对比实验验证后,研究团队在54个基准上对8个模型进行了大规模评测,并配合Terminus-2与3种原生评测框架运行。进一步,团队推出了Harbor-Index,这是从适配基准中提炼出的精选元数据集,包含跨越29个基准的82个困难、多样且高质量的任务。即使最强配置(GPT-5.5 with Codex)的通过率也只有28.0%,能够以可负担的成本保留大规模智能体评测的挑战性与覆盖面。相关适配器、结果、分析和数据集均已开源。

来源arXiv AI作者: Lin Shi (Audrey), Haowei Lin (Audrey), Zixuan Zhu (Audrey), Xiaoyue Zhou (Audrey), Xiang Li (Audrey), Xiangning Lin (Audrey), Yaxuan Deng (Audrey), Han Xu (Audrey), Yuangang Li (Audrey), Shanda Li (Audrey), Zizhao Chen (Audrey), Hanwen Xing (Audrey), Harsh Raj (Audrey), Bo Chen (Audrey), Quan Shi (Audrey), Steven Dillmann (Audrey), Yipeng Gao (Audrey), Puneesh Khanna (Audrey), Ruofan Lu (Audrey), Chao Beyond Zhou (Audrey), Michael Yang (Audrey), Robert Zhang (Audrey), Siyuan Chai (Audrey), Jiayu Chang (Audrey), Yizhao Chen (Audrey), Xiaokun Chen (Audrey), Yiwei Dai (Audrey), Wenting Yang (Audrey), Hange Liu (Audrey), Minghao Liu (Audrey), Zihan Wang (Audrey), Adnan El Assadi (Audrey), Benedikt Stroebl (Audrey), E. Kelly Buchanan (Audrey), Han Meng (Audrey), Junwei He (Audrey), Longxuan Yu (Audrey), Radin Shayanfar (Audrey), Yukyung Lee (Audrey), Zhikang Dong (Audrey), Allen G Hart (Audrey), Anjiang Wei (Audrey), Anurag Kashyap (Audrey), Arpandeep Khatua (Audrey), Audrey Jixin Zheng (Audrey), Chengrui Ma (Audrey), David Heineman (Audrey), Dubing Chen (Audrey), Hai-Anh Trinh (Audrey), Haishuo Fang (Audrey), Hefan Zhang (Audrey), Hui Shen (Audrey), Issa Sugiura (Audrey), Jiankai Sun (Audrey), Jiechao Gao (Audrey), Junhong Lin (Audrey), Junnan Li (Audrey), Kai Yang (Audrey), Lei Hsiung (Audrey), Maoyu Wang (Audrey), Mengze Tang (Audrey), Nabil Omi (Audrey), Negin Raoof (Audrey), Nicholas Edwards (Audrey), Octavia Guo (Audrey), Orfeas Menis Mastromichalakis (Audrey), Pengliang Ji (Audrey), Przemys{\l}aw Hejman (Audrey), Qi Qi (Audrey), Qunshu Lin (Audrey), Richard Zhuang (Audrey), Rui Yang (Audrey), Ruichen Zheng (Audrey), Ryan Marten (Audrey), Shaghayegh Fazliani (Audrey), Shizheng Hou (Audrey), Sicong Jiang (Audrey), Sijie Li (Audrey), Song Bian (Audrey), Terry Yue Zhuo (Audrey), Tianqing Wu (Audrey), Tom Tang (Audrey), Wanjia Zhao (Audrey), Weihao Xuan (Audrey), Wenhua Liang (Audrey), Xian Liu (Audrey), Xin Lan (Audrey), Xuan Zhang (Audrey), Xuandong Zhao (Audrey), Yanchuan Tang (Audrey), Yifan Jiang (Audrey), Yijiang Li (Audrey), Yitong Guan (Audrey), Yizhi Li (Audrey), Yonghui Liu (Audrey), Yuheng Tang (Audrey), Yujun (Audrey), Mao, Yunfei Zhao, Yuxin Wang, Yuxuan Tang, Zhenheng Tang, Zhifei Li, Ziruo Wang, Ziyu She, Kaiyuan Liu, Iheb Chaabane, Yuxin Tang, Xiangyi Li, Andy Konwinski, Boxuan Li, Leon Liangyu Chen, Alex Dimakis, Nicholas Carlini, Soroush Vosoughi, Di He, Etash Guha, Benjamin Feuer, Mike Merrill, Ludwig Schmidt, Alex Shaw
Harbor Adapters与Harbor-Index:面向大规模智能体评测的基础设施与精选元数据集
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

近年来,随着语言模型智能体的快速发展,如何系统性地评估这些智能体的能力成为一个重要课题。arXiv 于2026年9月3日发布了一篇名为“Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation”的论文,作者团队包括Lin Shi等120名研究者。论文指出,现有的智能体基准测试数量不断增加,但每项基准往往需要复杂的环境模拟和专用的智能体接口,这使得大规模评估变得极为困难。针对这一问题,论文提出了两项核心资源:Harbor Adapters 和 Harbor-Index。

Harbor Adapters 是一个统一的评估基础设施,它提供了超过80个基准的适配器,让任意智能体都可以被便捷地接入评估流程。研究团队对这些适配器进行了严格的代码审查和一致性实验(parity experiments),确保它们在不同配置下表现稳定。基于这套基础设施,作者们开展了一项大规模评估:他们选择了8个能力层级各异的模型,在54个基准上进行了测试。每个模型都在 Terminus-2 运行环境下执行,并配以三种原生测试框架(native harnesses)之一。这样多角度、大规模的实验设计,使得研究者能够比以往更深入地分析智能体的能力和失败模式。

在适配后的基准集合基础上,研究人员进一步构建了 Harbor-Index,这是一个经过精心挑选的元数据集,包含82个高难度、多样化且质量优秀的任务,这些任务跨越29个基准。筛选过程结合了难度过滤、AI 和人工审计,以及“审计-修复”循环,以确保所选任务既具有代表性又能有效区分不同模型的性能。Harbor-Index 的设计初衷是在保留大规模全面评估的挑战性的同时,控制评估成本。实验表明,在被评估的模型与框架组合中,没有任何一个组合的通过率超过30%;最强组合(GPT-5.5 with Codex)的通过率也仅为28.0%。这说明 Harbor-Index 是一个具有足够区分度的评测集。

这项工作的一个重要贡献是将所有资源开源。论文作者宣称,他们会发布适配器代码、完整的评估结果、深度分析报告以及 Harbor-Index 数据集,目的是让整个研究社区能够使用这些工具,进行更可靠、更全面的语言模型智能体评估。该论文的 arXiv 编号为 2609.04298,所属学科为 cs.AI 和 cs.CL,并获得了 DataCite 分配的 DOI:10.48550/arXiv.2609.04298。论文的 PDF 和实验性 HTML 版本已于2026年9月3日上线,供研究者阅读和引用。

展开要点与分析

文章情报

工程师进阶

要点

  • Harbor Adapters提供统一评测基础设施,将80多个智能体基准适配为可评测任意智能体的形式,并通过代码审查和对比实验验证。
  • 在54个基准上对8个不同能力层级的模型进行大规模评测,每个模型都使用Terminus-2及3种原生框架之一运行,从而支持更深入的智能体能力与失败模式分析。
  • Harbor-Index精选82个困难、多样且高质量的任务,覆盖29个基准,经难度筛选、AI与人工审计以及修复循环构建。
  • 所有测试的模型-框架组合通过率均不高于30%,最强组合GPT-5.5 with Codex达到28.0%,相关资源已开源。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。