本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

Harbor AdaptersとHarbor-Index:大規模エージェント評価のためのインフラとキュレーション済みメタデータセット

記事の要約

本論文は、エージェント型ベンチマークのための統一評価インフラであるHarbor Adaptersを提案する。80以上のベンチマークを任意のエージェントで評価できるようにアダプタ化し、厳密なコードレビューとパリティ実験で検証した。さらに、8つのモデルを54のベンチマークで、Terminus-2および3種類のネイティブハーネスと組み合わせて大規模評価を実施。加えて、29のベンチマークから選抜した82の困難で多様な高品質タスクからなるHarbor-Indexも導入する。どのモデル・ハーネス構成も正解率30%を超えず、最強のGPT-5.5 with Codexでも28.0%にとどまり、評価資源はすべてオープンソースとして公開される。

ソースarXiv AI著者: Lin Shi (Audrey), Haowei Lin (Audrey), Zixuan Zhu (Audrey), Xiaoyue Zhou (Audrey), Xiang Li (Audrey), Xiangning Lin (Audrey), Yaxuan Deng (Audrey), Han Xu (Audrey), Yuangang Li (Audrey), Shanda Li (Audrey), Zizhao Chen (Audrey), Hanwen Xing (Audrey), Harsh Raj (Audrey), Bo Chen (Audrey), Quan Shi (Audrey), Steven Dillmann (Audrey), Yipeng Gao (Audrey), Puneesh Khanna (Audrey), Ruofan Lu (Audrey), Chao Beyond Zhou (Audrey), Michael Yang (Audrey), Robert Zhang (Audrey), Siyuan Chai (Audrey), Jiayu Chang (Audrey), Yizhao Chen (Audrey), Xiaokun Chen (Audrey), Yiwei Dai (Audrey), Wenting Yang (Audrey), Hange Liu (Audrey), Minghao Liu (Audrey), Zihan Wang (Audrey), Adnan El Assadi (Audrey), Benedikt Stroebl (Audrey), E. Kelly Buchanan (Audrey), Han Meng (Audrey), Junwei He (Audrey), Longxuan Yu (Audrey), Radin Shayanfar (Audrey), Yukyung Lee (Audrey), Zhikang Dong (Audrey), Allen G Hart (Audrey), Anjiang Wei (Audrey), Anurag Kashyap (Audrey), Arpandeep Khatua (Audrey), Audrey Jixin Zheng (Audrey), Chengrui Ma (Audrey), David Heineman (Audrey), Dubing Chen (Audrey), Hai-Anh Trinh (Audrey), Haishuo Fang (Audrey), Hefan Zhang (Audrey), Hui Shen (Audrey), Issa Sugiura (Audrey), Jiankai Sun (Audrey), Jiechao Gao (Audrey), Junhong Lin (Audrey), Junnan Li (Audrey), Kai Yang (Audrey), Lei Hsiung (Audrey), Maoyu Wang (Audrey), Mengze Tang (Audrey), Nabil Omi (Audrey), Negin Raoof (Audrey), Nicholas Edwards (Audrey), Octavia Guo (Audrey), Orfeas Menis Mastromichalakis (Audrey), Pengliang Ji (Audrey), Przemys{\l}aw Hejman (Audrey), Qi Qi (Audrey), Qunshu Lin (Audrey), Richard Zhuang (Audrey), Rui Yang (Audrey), Ruichen Zheng (Audrey), Ryan Marten (Audrey), Shaghayegh Fazliani (Audrey), Shizheng Hou (Audrey), Sicong Jiang (Audrey), Sijie Li (Audrey), Song Bian (Audrey), Terry Yue Zhuo (Audrey), Tianqing Wu (Audrey), Tom Tang (Audrey), Wanjia Zhao (Audrey), Weihao Xuan (Audrey), Wenhua Liang (Audrey), Xian Liu (Audrey), Xin Lan (Audrey), Xuan Zhang (Audrey), Xuandong Zhao (Audrey), Yanchuan Tang (Audrey), Yifan Jiang (Audrey), Yijiang Li (Audrey), Yitong Guan (Audrey), Yizhi Li (Audrey), Yonghui Liu (Audrey), Yuheng Tang (Audrey), Yujun (Audrey), Mao, Yunfei Zhao, Yuxin Wang, Yuxuan Tang, Zhenheng Tang, Zhifei Li, Ziruo Wang, Ziyu She, Kaiyuan Liu, Iheb Chaabane, Yuxin Tang, Xiangyi Li, Andy Konwinski, Boxuan Li, Leon Liangyu Chen, Alex Dimakis, Nicholas Carlini, Soroush Vosoughi, Di He, Etash Guha, Benjamin Feuer, Mike Merrill, Ludwig Schmidt, Alex Shaw
Harbor AdaptersとHarbor-Index:大規模エージェント評価のためのインフラとキュレーション済みメタデータセット
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

エージェント型ベンチマークの増加に伴い、言語モデルエージェントの性能を評価することはますます困難になっている。多くのベンチマークは複雑な環境やエージェント連携を必要とするためだ。arXivに投稿された本論文(番号:2609.04298)は、Lin Shi氏ら120名の著者によって2026年9月3日に提出され、統一評価インフラ「Harbor Adapters」と、厳選されたメタデータセット「Harbor-Index」を提案している。

第一の貢献として、研究チームは80以上のベンチマークを任意のエージェントで評価できるようにするアダプタ群を開発した。単に接続するだけでなく、厳密なコードレビューとパリティ実験を通じて、アダプタ化後も各ベンチマークの本来の意味や難易度が保たれていることを確認している。これにより、公平で再現可能なエージェント評価の基盤が築かれる。

第二の貢献は、大規模評価実験である。異なる能力層にわたる8つのモデルを、54のベンチマークで徹底的に評価した。各モデルはTerminus-2と、3つのネイティブハーネスのいずれかと組み合わせて実行され、これまでにない広がりでエージェントの能力と失敗パターンを観察できるようになった。この設計は、エージェントの限界を体系的に理解し、今後の改善に役立つ豊富な実証データを提供する。

第三の貢献であるHarbor-Indexは、適応済みベンチマーク群から厳選されたデータセットだ。難易度フィルタリング、AIと人間による監査、監査と修正を繰り返すループを経て、29のベンチマークにわたる82の難しく多様な高品質タスクが選ばれた。評価の結果、どのモデル・ハーネス構成も正解率30%を超えず、最強のGPT-5.5 with Codexでも28.0%にとどまった。Harbor-Indexは大規模エージェント評価の挑戦的な性質と広がりを保ちつつ、手頃なコストで実行できることを示している。

著者らは、アダプタ、評価結果、詳細な分析、そしてHarbor-Indexをすべてオープンソースとして公開する。これにより、言語モデルエージェントのより信頼性が高く包括的な評価がコミュニティで進むことが期待される。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • Harbor Adaptersは80以上のエージェント用ベンチマークを統一インフラ上で任意のエージェントに適応させ、コードレビューとパリティ実験により検証する。
  • 8つのモデルを54ベンチマークで大規模評価し、各モデルをTerminus-2と3つのネイティブハーネスのいずれかで実行することで、能力と失敗モードの広範な分析を可能にする。
  • Harbor-Indexは、難易度フィルタリング、AI・人間による監査、監査と修正のループを通じて、29ベンチマークから82の困難で多様な高品質タスクを厳選したメタデータセットである。
  • 評価したすべてのモデル・ハーネス構成で正解率は30%以下であり、最強のGPT-5.5 with Codexで28.0%を記録。関連成果はオープンソースとして公開される。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。