近年來,隨着語言模型智能體的快速發展,如何系統性地評估這些智能體的能力成為一個重要課題。arXiv 於2026年9月3日發佈了一篇名為“Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation”的論文,作者團隊包括Lin Shi等120名研究者。論文指出,現有的智能體基準測試數量不斷增加,但每項基準往往需要複雜的環境模擬和專用的智能體接口,這使得大規模評估變得極為困難。針對這一問題,論文提出了兩項核心資源:Harbor Adapters 和 Harbor-Index。
Harbor Adapters 是一個統一的評估基礎設施,它提供了超過80個基準的適配器,讓任意智能體都可以被便捷地接入評估流程。研究團隊對這些適配器進行了嚴格的代碼審查和一致性實驗(parity experiments),確保它們在不同配置下表現穩定。基於這套基礎設施,作者們開展了一項大規模評估:他們選擇了8個能力層級各異的模型,在54個基準上進行了測試。每個模型都在 Terminus-2 運行環境下執行,並配以三種原生測試框架(native harnesses)之一。這樣多角度、大規模的實驗設計,使得研究者能夠比以往更深入地分析智能體的能力和失敗模式。
在適配後的基準集合基礎上,研究人員進一步構建了 Harbor-Index,這是一個經過精心挑選的元數據集,包含82個高難度、多樣化且質量優秀的任務,這些任務跨越29個基準。篩選過程結合了難度過濾、AI 和人工審計,以及“審計-修復”循環,以確保所選任務既具有代表性又能有效區分不同模型的性能。Harbor-Index 的設計初衷是在保留大規模全面評估的挑戰性的同時,控制評估成本。實驗表明,在被評估的模型與框架組合中,沒有任何一個組合的通過率超過30%;最強組合(GPT-5.5 with Codex)的通過率也僅為28.0%。這説明 Harbor-Index 是一個具有足夠區分度的評測集。
這項工作的一個重要貢獻是將所有資源開源。論文作者宣稱,他們會發布適配器代碼、完整的評估結果、深度分析報告以及 Harbor-Index 數據集,目的是讓整個研究社區能夠使用這些工具,進行更可靠、更全面的語言模型智能體評估。該論文的 arXiv 編號為 2609.04298,所屬學科為 cs.AI 和 cs.CL,並獲得了 DataCite 分配的 DOI:10.48550/arXiv.2609.04298。論文的 PDF 和實驗性 HTML 版本已於2026年9月3日上線,供研究者閲讀和引用。