衡量前沿AI能力的開放世界評估
基準測試對於追蹤AI進展很重要,但可能高估或低估實際能力。本文提出“開放世界評估”作為補充:長期、混亂的真實世界任務,通過小樣本定性分析進行評估。作者介紹了CRUX項目,並展示AI代理成功開發併發布了一款iOS應用,僅需一次手動干預,表明開放世界評估能提供早期預警。
隨着人工智能技術的飛速發展,如何準確評估前沿AI系統的能力已成為一個關鍵問題。傳統的基準測試方法雖然仍是追蹤AI進展的重要工具,但其固有的侷限性可能對實際部署能力產生誤判。基準測試偏愛那些能夠精確定義、自動評分、易於優化、且成本低、時間短的任務,這可能導致對AI真實能力的過高或過低估計。為了彌補這一不足,來自多所研究機構的研究人員在一篇新論文中提出了“開放世界評估”(open-world evaluations)這一補充方法。
開放世界評估的核心思想是讓AI系統執行長期、雜亂的真實世界任務,並通過小樣本定性分析而非大規模自動化基準來評價其表現。這類評估更貼近實際應用場景,能夠揭示基準測試可能掩蓋的能力或不足。論文不僅進行了理論闡述,還介紹了CRUX(Collaborative Research for Updating AI eXpectations)項目,該項目旨在定期開展此類評估,為AI發展提供早期預警信號。
作為CRUX項目的首個實例,研究團隊讓一個AI代理完成開發併發布一款簡單的iOS應用程序到Apple App Store。令人驚訝的是,該AI代理在僅有一次可避免的人工干預下就成功完成了整個任務。這一結果強有力地表明,開放世界評估能夠發現那些可能很快變得普遍的AI能力——例如,未來AI或許能夠自主完成軟件開發生命週期中的多個環節,從編碼到發佈。這一發現對於理解AI能力的演進具有重要意義。
論文最後為設計和報告開放世界評估提供了具體建議,強調應關注任務的真實性、評估的透明性以及結論的穩健性。研究人員認為,開放世界評估與基準測試相互補充,將共同推動對AI能力的更全面理解,並幫助行業和政策制定者做出更明智的決策。