Frontier-Bench:前沿智能体能力基准测试
Frontier-Bench 是一个由社区驱动的新型基准测试,旨在衡量智能体在多种复杂任务中的表现。首个版本包含 7 个领域的 74 个任务,最佳模型仅达到约 34% 的通过率。该基准采用持续改进机制,通过 CI/CD 和语义版本管理,确保测试任务的高质量和时效性。
Frontier-Bench 是由 Terminal-Bench 和 Harbor 团队打造的一个全新基准测试,旨在衡量智能体在最具挑战性任务上的表现。该项目始于 Terminal-Bench 3.0,现已发展为一个持续的社区协作项目,汇集了最丰富、最困难、最高质量的任务。
首个版本 Frontier-Bench v0.1 包含 74 个任务,覆盖 7 个领域,包括数据库、机器学习、硬件设计、形式化验证、源代码、虚拟机镜像、音乐乐谱、CAD 文件、科学分析、量化计算、逆向工程和业务流程决策等。当前最佳模型(如 Fable 5 和 GPT-5.6 Sol)的通过率仅为 34% 左右,表明测试难度极高。
与 Terminal-Bench 相比,Frontier-Bench 在多个方面进行了扩展。首先,任务难度显著提升,因为许多 Terminal-Bench 任务已趋于饱和。其次,任务多样性大幅增加,不仅限于编程和命令行操作,还涵盖了更广泛的工作类型。此外,环境配置更加丰富,包括多容器网络和 GPU 支持。
Frontier-Bench 引入了持续基准改进机制,包括 CI/CD、语义版本控制和结果迁移。每个任务都经过严格的人工和智能体反馈审核,确保定义清晰、现实可行,并避免过拟合。智能体在测试中需使用完整工具集,但禁止针对特定任务在线搜索答案。
测试结果显示出更好的区分度:例如,Fable 5 和 Opus 4.8 在 Terminal-Bench 上仅差 4.9 分,在 Frontier-Bench 上差距扩大到 12.7 分。同时,成本分析表明,GPT-5.6 Sol 在达到相似性能时,成本比 Fable 5 低 40%,令牌使用量少 50%。不同模型在令牌使用和步骤数量上表现出不同策略。
Frontier-Bench 团队已规划后续版本,将增加新任务、提升多样性并优化超时设置。未来版本将支持任务版本复用和重新评分,降低更新领导板的成本。
该项目是一项社区努力,共有 100 多位任务贡献者和审核者参与。团队计划通过 Discord 和 GitHub 持续改进基准,旨在以最准确的方式衡量最有价值的前沿能力。
致谢所有任务贡献者和高级审查员,特别感谢赞助商包括 Modal、Anthropic、OpenAI、Google、Scale AI 等。Frontier-Bench 由 Harbor 和 Laude Institute 主办。