AI News HubLIVE
站內改寫1 分鐘閱讀

我們應該對AI Agent進行混沌測試嗎?

EvalMonkey 是一個開源的、本地的AI Agent基準測試與混沌工程框架。它支持11種Agent框架、19個標準基準測試和23種混沌注入,通過HTTP與任意Agent交互,無需修改代碼。

來源Hacker News AI作者: himmi-01

EvalMonkey 是一個面向AI Agent的基準測試與混沌工程框架,旨在幫助開發者驗證其Agent的可靠性和彈性。該項目強調“不要只是信任你的Agent,證明它有效,然後破壞它”。它完全本地運行,開源,並通過HTTP與任意Agent交互,無需修改代碼。

EvalMonkey 原生支持11種Agent框架,包括CrewAI、LangChain、LlamaIndex、LangGraph、Pydantic AI、OpenAI Agents、Microsoft AutoGen、AWS Bedrock、Ollama、Strands以及自定義HTTP端點。它內置了19個開箱即用的標準基準測試,涵蓋推理、工具使用、編碼、問答、安全性等多個類別,例如GSM8K(數學)、MMLU(多學科知識)、HumanEval(編碼)和ToxiGen(安全)等。此外,它還提供了23種混沌注入,包括12種客户端負載突變和11種服務端中間件注入,所有注入均基於文本,無需GPU或視覺依賴。

使用EvalMonkey,開發者可以通過簡單的CLI命令快速啓動。例如,通過evalmonkey run-benchmark --scenario gsm8k --sample-agent rag_app --limit 3即可對內置示例Agent進行煙霧測試。對於自有Agent,只需確保Agent運行在HTTP端點上,並通過--request-key--response-path參數映射請求/響應格式即可。EvalMonkey還支持使用CSV、JSON或YAML文件構建自定義基準測試,只需提供ID和期望行為標準即可。

當基準測試分數不佳時,EvalMonkey會自動生成追蹤文件、評估文件和改進提示,可直接用於Claude Code或Cursor等AI編碼助手。框架還提供了一個Web儀表盤,用於可視化基準測試結果、追蹤可靠性分數變化,並交互式檢查失敗追蹤。

EvalMonkey 的設計哲學是讓Agent開發者能夠輕鬆地持續測試和改進其系統的可靠性。它支持多種LLM提供商作為評估裁判,包括OpenAI、Anthropic、AWS Bedrock和本地Ollama,並且無需為Agent本身提供API密鑰——裁判密鑰獨立配置。總之,EvalMonkey 是一個強大的工具,適用於希望確保其AI Agent在生產環境中表現穩定的團隊。