AWS 發佈 aws-bench:面向 AWS 上 AI 智能體的開源基準測試
AWS 宣佈推出 aws-bench 研究預覽版,這是一個開源基準測試工具,用於衡量 AI 智能體在 AWS 上完成真實任務的準確性和效率。它提供基於實際 AWS 使用分析的測試用例,包括調查、故障排除和基礎設施創建任務。每個測試用例包含自然語言查詢、雲資源狀態和真實答案,支持任意智能體或模型的一致評分。現已在 GitHub 上提供。
AWS 今日宣佈推出 aws-bench 的研究預覽版,這是一個全新的開源基準測試工具,專門用於衡量 AI 智能體在 AWS 雲環境中完成真實世界任務的準確性和效率。對於構建在 AWS 基礎設施上運行的 AI 智能體的模型提供商和研究人員而言,他們需要一種客觀且可重複的方法來評估性能並診斷故障。aws-bench 應運而生,它提供了一套公開的測試用例,這些用例源自對實際 AWS 使用情況的分析,涵蓋調查、故障排除和基礎設施創建等任務類型。
每個測試用例都包含一個自然語言查詢、一個定義的雲資源狀態以及一個真實答案。這使得用户能夠以一致且可驗證的方式對任何智能體或模型進行評分。研究人員和模型提供商可以利用 aws-bench 來提升基礎模型在 AWS 任務上的表現,改進智能體框架,並追蹤進步軌跡。該發佈版本包含一個易於使用的 CLI 工具,用於實例化測試環境、執行和評分評估運行,以及重置資源狀態。
aws-bench 現已通過 GitHub 開放獲取。要開始使用,請按照 README 中的設置指南操作。