AI News HubLIVE
站內改寫1 分鐘閱讀

我們應該對AI Agent進行混沌測試嗎?

EvalMonkey 是一個開源的、本地的AI Agent基準測試與混沌工程框架。它支援11種Agent框架、19個標準基準測試和23種混沌注入,透過HTTP與任意Agent互動,無需修改程式碼。

來源Hacker News AI作者: himmi-01

EvalMonkey 是一個面向AI Agent的基準測試與混沌工程框架,旨在幫助開發者驗證其Agent的可靠性和彈性。該專案強調“不要只是信任你的Agent,證明它有效,然後破壞它”。它完全本地執行,開源,並透過HTTP與任意Agent互動,無需修改程式碼。

EvalMonkey 原生支援11種Agent框架,包括CrewAI、LangChain、LlamaIndex、LangGraph、Pydantic AI、OpenAI Agents、Microsoft AutoGen、AWS Bedrock、Ollama、Strands以及自定義HTTP端點。它內建了19個開箱即用的標準基準測試,涵蓋推理、工具使用、編碼、問答、安全性等多個類別,例如GSM8K(數學)、MMLU(多學科知識)、HumanEval(編碼)和ToxiGen(安全)等。此外,它還提供了23種混沌注入,包括12種客戶端負載突變和11種服務端中介軟體注入,所有注入均基於文本,無需GPU或視覺依賴。

使用EvalMonkey,開發者可以透過簡單的CLI命令快速啟動。例如,透過evalmonkey run-benchmark --scenario gsm8k --sample-agent rag_app --limit 3即可對內建示例Agent進行煙霧測試。對於自有Agent,只需確保Agent執行在HTTP端點上,並透過--request-key--response-path引數對映請求/響應格式即可。EvalMonkey還支援使用CSV、JSON或YAML檔案構建自定義基準測試,只需提供ID和期望行為標準即可。

當基準測試分數不佳時,EvalMonkey會自動生成追蹤檔案、評估檔案和改進提示,可直接用於Claude Code或Cursor等AI編碼助手。框架還提供了一個Web儀表盤,用於視覺化基準測試結果、追蹤可靠性分數變化,並互動式檢查失敗追蹤。

EvalMonkey 的設計哲學是讓Agent開發者能夠輕鬆地持續測試和改進其系統的可靠性。它支援多種LLM提供商作為評估裁判,包括OpenAI、Anthropic、AWS Bedrock和本地Ollama,並且無需為Agent本身提供API金鑰——裁判金鑰獨立配置。總之,EvalMonkey 是一個強大的工具,適用於希望確保其AI Agent在生產環境中表現穩定的團隊。