我们应该对AI Agent进行混沌测试吗?
EvalMonkey 是一个开源的、本地的AI Agent基准测试与混沌工程框架。它支持11种Agent框架、19个标准基准测试和23种混沌注入,通过HTTP与任意Agent交互,无需修改代码。
EvalMonkey 是一个面向AI Agent的基准测试与混沌工程框架,旨在帮助开发者验证其Agent的可靠性和弹性。该项目强调“不要只是信任你的Agent,证明它有效,然后破坏它”。它完全本地运行,开源,并通过HTTP与任意Agent交互,无需修改代码。
EvalMonkey 原生支持11种Agent框架,包括CrewAI、LangChain、LlamaIndex、LangGraph、Pydantic AI、OpenAI Agents、Microsoft AutoGen、AWS Bedrock、Ollama、Strands以及自定义HTTP端点。它内置了19个开箱即用的标准基准测试,涵盖推理、工具使用、编码、问答、安全性等多个类别,例如GSM8K(数学)、MMLU(多学科知识)、HumanEval(编码)和ToxiGen(安全)等。此外,它还提供了23种混沌注入,包括12种客户端负载突变和11种服务端中间件注入,所有注入均基于文本,无需GPU或视觉依赖。
使用EvalMonkey,开发者可以通过简单的CLI命令快速启动。例如,通过evalmonkey run-benchmark --scenario gsm8k --sample-agent rag_app --limit 3即可对内置示例Agent进行烟雾测试。对于自有Agent,只需确保Agent运行在HTTP端点上,并通过--request-key和--response-path参数映射请求/响应格式即可。EvalMonkey还支持使用CSV、JSON或YAML文件构建自定义基准测试,只需提供ID和期望行为标准即可。
当基准测试分数不佳时,EvalMonkey会自动生成追踪文件、评估文件和改进提示,可直接用于Claude Code或Cursor等AI编码助手。框架还提供了一个Web仪表盘,用于可视化基准测试结果、追踪可靠性分数变化,并交互式检查失败追踪。
EvalMonkey 的设计哲学是让Agent开发者能够轻松地持续测试和改进其系统的可靠性。它支持多种LLM提供商作为评估裁判,包括OpenAI、Anthropic、AWS Bedrock和本地Ollama,并且无需为Agent本身提供API密钥——裁判密钥独立配置。总之,EvalMonkey 是一个强大的工具,适用于希望确保其AI Agent在生产环境中表现稳定的团队。