跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

Harbor Adapters與Harbor-Index:面向大規模智慧體評測的基礎設施與精選後設資料集

文章摘要

本文提出了Harbor Adapters,一個統一的智慧體基準評測基礎設施,可將80多個基準適配到任意智慧體上;透過程式碼審查與對比實驗驗證後,研究團隊在54個基準上對8個模型進行了大規模評測,並配合Terminus-2與3種原生評測框架執行。進一步,團隊推出了Harbor-Index,這是從適配基準中提煉出的精選後設資料集,包含跨越29個基準的82個困難、多樣且高質量的任務。即使最強配置(GPT-5.5 with Codex)的透過率也只有28.0%,能夠以可負擔的成本保留大規模智慧體評測的挑戰性與覆蓋面。相關介面卡、結果、分析和資料集均已開源。

來源arXiv AI作者: Lin Shi (Audrey), Haowei Lin (Audrey), Zixuan Zhu (Audrey), Xiaoyue Zhou (Audrey), Xiang Li (Audrey), Xiangning Lin (Audrey), Yaxuan Deng (Audrey), Han Xu (Audrey), Yuangang Li (Audrey), Shanda Li (Audrey), Zizhao Chen (Audrey), Hanwen Xing (Audrey), Harsh Raj (Audrey), Bo Chen (Audrey), Quan Shi (Audrey), Steven Dillmann (Audrey), Yipeng Gao (Audrey), Puneesh Khanna (Audrey), Ruofan Lu (Audrey), Chao Beyond Zhou (Audrey), Michael Yang (Audrey), Robert Zhang (Audrey), Siyuan Chai (Audrey), Jiayu Chang (Audrey), Yizhao Chen (Audrey), Xiaokun Chen (Audrey), Yiwei Dai (Audrey), Wenting Yang (Audrey), Hange Liu (Audrey), Minghao Liu (Audrey), Zihan Wang (Audrey), Adnan El Assadi (Audrey), Benedikt Stroebl (Audrey), E. Kelly Buchanan (Audrey), Han Meng (Audrey), Junwei He (Audrey), Longxuan Yu (Audrey), Radin Shayanfar (Audrey), Yukyung Lee (Audrey), Zhikang Dong (Audrey), Allen G Hart (Audrey), Anjiang Wei (Audrey), Anurag Kashyap (Audrey), Arpandeep Khatua (Audrey), Audrey Jixin Zheng (Audrey), Chengrui Ma (Audrey), David Heineman (Audrey), Dubing Chen (Audrey), Hai-Anh Trinh (Audrey), Haishuo Fang (Audrey), Hefan Zhang (Audrey), Hui Shen (Audrey), Issa Sugiura (Audrey), Jiankai Sun (Audrey), Jiechao Gao (Audrey), Junhong Lin (Audrey), Junnan Li (Audrey), Kai Yang (Audrey), Lei Hsiung (Audrey), Maoyu Wang (Audrey), Mengze Tang (Audrey), Nabil Omi (Audrey), Negin Raoof (Audrey), Nicholas Edwards (Audrey), Octavia Guo (Audrey), Orfeas Menis Mastromichalakis (Audrey), Pengliang Ji (Audrey), Przemys{\l}aw Hejman (Audrey), Qi Qi (Audrey), Qunshu Lin (Audrey), Richard Zhuang (Audrey), Rui Yang (Audrey), Ruichen Zheng (Audrey), Ryan Marten (Audrey), Shaghayegh Fazliani (Audrey), Shizheng Hou (Audrey), Sicong Jiang (Audrey), Sijie Li (Audrey), Song Bian (Audrey), Terry Yue Zhuo (Audrey), Tianqing Wu (Audrey), Tom Tang (Audrey), Wanjia Zhao (Audrey), Weihao Xuan (Audrey), Wenhua Liang (Audrey), Xian Liu (Audrey), Xin Lan (Audrey), Xuan Zhang (Audrey), Xuandong Zhao (Audrey), Yanchuan Tang (Audrey), Yifan Jiang (Audrey), Yijiang Li (Audrey), Yitong Guan (Audrey), Yizhi Li (Audrey), Yonghui Liu (Audrey), Yuheng Tang (Audrey), Yujun (Audrey), Mao, Yunfei Zhao, Yuxin Wang, Yuxuan Tang, Zhenheng Tang, Zhifei Li, Ziruo Wang, Ziyu She, Kaiyuan Liu, Iheb Chaabane, Yuxin Tang, Xiangyi Li, Andy Konwinski, Boxuan Li, Leon Liangyu Chen, Alex Dimakis, Nicholas Carlini, Soroush Vosoughi, Di He, Etash Guha, Benjamin Feuer, Mike Merrill, Ludwig Schmidt, Alex Shaw
Harbor Adapters與Harbor-Index:面向大規模智慧體評測的基礎設施與精選後設資料集
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

近年來,隨著語言模型智慧體的快速發展,如何系統性地評估這些智慧體的能力成為一個重要課題。arXiv 於2026年9月3日釋出了一篇名為“Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation”的論文,作者團隊包括Lin Shi等120名研究者。論文指出,現有的智慧體基準測試數量不斷增加,但每項基準往往需要複雜的環境模擬和專用的智慧體介面,這使得大規模評估變得極為困難。針對這一問題,論文提出了兩項核心資源:Harbor Adapters 和 Harbor-Index。

Harbor Adapters 是一個統一的評估基礎設施,它提供了超過80個基準的介面卡,讓任意智慧體都可以被便捷地接入評估流程。研究團隊對這些介面卡進行了嚴格的程式碼審查和一致性實驗(parity experiments),確保它們在不同配置下表現穩定。基於這套基礎設施,作者們開展了一項大規模評估:他們選擇了8個能力層級各異的模型,在54個基準上進行了測試。每個模型都在 Terminus-2 執行環境下執行,並配以三種原生測試框架(native harnesses)之一。這樣多角度、大規模的實驗設計,使得研究者能夠比以往更深入地分析智慧體的能力和失敗模式。

在適配後的基準集合基礎上,研究人員進一步構建了 Harbor-Index,這是一個經過精心挑選的後設資料集,包含82個高難度、多樣化且質量優秀的任務,這些任務跨越29個基準。篩選過程結合了難度過濾、AI 和人工審計,以及“審計-修復”迴圈,以確保所選任務既具有代表性又能有效區分不同模型的效能。Harbor-Index 的設計初衷是在保留大規模全面評估的挑戰性的同時,控制評估成本。實驗表明,在被評估的模型與框架組合中,沒有任何一個組合的透過率超過30%;最強組合(GPT-5.5 with Codex)的透過率也僅為28.0%。這說明 Harbor-Index 是一個具有足夠區分度的評測集。

這項工作的一個重要貢獻是將所有資源開源。論文作者宣稱,他們會發布介面卡程式碼、完整的評估結果、深度分析報告以及 Harbor-Index 資料集,目的是讓整個研究社群能夠使用這些工具,進行更可靠、更全面的語言模型智慧體評估。該論文的 arXiv 編號為 2609.04298,所屬學科為 cs.AI 和 cs.CL,並獲得了 DataCite 分配的 DOI:10.48550/arXiv.2609.04298。論文的 PDF 和實驗性 HTML 版本已於2026年9月3日上線,供研究者閱讀和引用。

展開要點與分析

文章情報

工程師進階

要點

  • Harbor Adapters提供統一評測基礎設施,將80多個智慧體基準適配為可評測任意智慧體的形式,並透過程式碼審查和對比實驗驗證。
  • 在54個基準上對8個不同能力層級的模型進行大規模評測,每個模型都使用Terminus-2及3種原生框架之一執行,從而支援更深入的智慧體能力與失敗模式分析。
  • Harbor-Index精選82個困難、多樣且高質量的任務,覆蓋29個基準,經難度篩選、AI與人工審計以及修復迴圈構建。
  • 所有測試的模型-框架組合透過率均不高於30%,最強組合GPT-5.5 with Codex達到28.0%,相關資源已開源。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。