AI News HubLIVE
站内改写1 分钟阅读

衡量前沿AI能力的开放世界评估

基准测试对于追踪AI进展很重要,但可能高估或低估实际能力。本文提出“开放世界评估”作为补充:长期、混乱的真实世界任务,通过小样本定性分析进行评估。作者介绍了CRUX项目,并展示AI代理成功开发并发布了一款iOS应用,仅需一次手动干预,表明开放世界评估能提供早期预警。

来源arXiv AI作者: Sayash Kapoor, Peter Kirgis, Andrew Schwartz, Stephan Rabanser, J. J. Allaire, Rishi Bommasani, Harry Coppock, Magda Dubois, Gillian K Hadfield, Andrew B. Hall, Sara Hooker, Seth Lazar, Steve Newman, Dimitris Papailiopoulos, Shoshannah Tekofsky, Helen Toner, Cozmin Ududec, Arvind Narayanan

随着人工智能技术的飞速发展,如何准确评估前沿AI系统的能力已成为一个关键问题。传统的基准测试方法虽然仍是追踪AI进展的重要工具,但其固有的局限性可能对实际部署能力产生误判。基准测试偏爱那些能够精确定义、自动评分、易于优化、且成本低、时间短的任务,这可能导致对AI真实能力的过高或过低估计。为了弥补这一不足,来自多所研究机构的研究人员在一篇新论文中提出了“开放世界评估”(open-world evaluations)这一补充方法。

开放世界评估的核心思想是让AI系统执行长期、杂乱的真实世界任务,并通过小样本定性分析而非大规模自动化基准来评价其表现。这类评估更贴近实际应用场景,能够揭示基准测试可能掩盖的能力或不足。论文不仅进行了理论阐述,还介绍了CRUX(Collaborative Research for Updating AI eXpectations)项目,该项目旨在定期开展此类评估,为AI发展提供早期预警信号。

作为CRUX项目的首个实例,研究团队让一个AI代理完成开发并发布一款简单的iOS应用程序到Apple App Store。令人惊讶的是,该AI代理在仅有一次可避免的人工干预下就成功完成了整个任务。这一结果强有力地表明,开放世界评估能够发现那些可能很快变得普遍的AI能力——例如,未来AI或许能够自主完成软件开发生命周期中的多个环节,从编码到发布。这一发现对于理解AI能力的演进具有重要意义。

论文最后为设计和报告开放世界评估提供了具体建议,强调应关注任务的真实性、评估的透明性以及结论的稳健性。研究人员认为,开放世界评估与基准测试相互补充,将共同推动对AI能力的更全面理解,并帮助行业和政策制定者做出更明智的决策。