近年来,随着语言模型智能体的快速发展,如何系统性地评估这些智能体的能力成为一个重要课题。arXiv 于2026年9月3日发布了一篇名为“Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation”的论文,作者团队包括Lin Shi等120名研究者。论文指出,现有的智能体基准测试数量不断增加,但每项基准往往需要复杂的环境模拟和专用的智能体接口,这使得大规模评估变得极为困难。针对这一问题,论文提出了两项核心资源:Harbor Adapters 和 Harbor-Index。
Harbor Adapters 是一个统一的评估基础设施,它提供了超过80个基准的适配器,让任意智能体都可以被便捷地接入评估流程。研究团队对这些适配器进行了严格的代码审查和一致性实验(parity experiments),确保它们在不同配置下表现稳定。基于这套基础设施,作者们开展了一项大规模评估:他们选择了8个能力层级各异的模型,在54个基准上进行了测试。每个模型都在 Terminus-2 运行环境下执行,并配以三种原生测试框架(native harnesses)之一。这样多角度、大规模的实验设计,使得研究者能够比以往更深入地分析智能体的能力和失败模式。
在适配后的基准集合基础上,研究人员进一步构建了 Harbor-Index,这是一个经过精心挑选的元数据集,包含82个高难度、多样化且质量优秀的任务,这些任务跨越29个基准。筛选过程结合了难度过滤、AI 和人工审计,以及“审计-修复”循环,以确保所选任务既具有代表性又能有效区分不同模型的性能。Harbor-Index 的设计初衷是在保留大规模全面评估的挑战性的同时,控制评估成本。实验表明,在被评估的模型与框架组合中,没有任何一个组合的通过率超过30%;最强组合(GPT-5.5 with Codex)的通过率也仅为28.0%。这说明 Harbor-Index 是一个具有足够区分度的评测集。
这项工作的一个重要贡献是将所有资源开源。论文作者宣称,他们会发布适配器代码、完整的评估结果、深度分析报告以及 Harbor-Index 数据集,目的是让整个研究社区能够使用这些工具,进行更可靠、更全面的语言模型智能体评估。该论文的 arXiv 编号为 2609.04298,所属学科为 cs.AI 和 cs.CL,并获得了 DataCite 分配的 DOI:10.48550/arXiv.2609.04298。论文的 PDF 和实验性 HTML 版本已于2026年9月3日上线,供研究者阅读和引用。