エージェントにカオスエンジニアリングをすべきか?
EvalMonkeyは、AIエージェント向けのオープンソースのローカルベンチマーク&カオスエンジニアリングフレームワークです。11のエージェントフレームワーク、19の標準ベンチマーク、23のカオスインジェクションをサポートし、コード変更なしで任意のエージェントとHTTP経由で連携します。
EvalMonkeyは、AIエージェントの信頼性と復元力を検証するためのベンチマーク&カオスエンジニアリングフレームワークです。「エージェントを信頼するな。動作を証明し、そして壊せ」という理念のもと、完全にローカルで動作し、オープンソースとして提供されています。HTTP経由で任意のエージェントと連携するため、コードの変更は一切不要です。
EvalMonkeyは11のエージェントフレームワークをネイティブサポートしています。CrewAI、LangChain、LlamaIndex、LangGraph、Pydantic AI、OpenAI Agents、Microsoft AutoGen、AWS Bedrock、Ollama、Strands、そしてカスタムHTTPエンドポイントです。また、GSM8K(数学)、MMLU(多分野知識)、HumanEval(コーディング)、ToxiGen(安全性)など19の標準ベンチマークが組み込まれており、推論、ツール使用、コーディング、Q&A、安全性など多岐にわたるカテゴリをカバーします。さらに、23のカオスインジェクション(12のクライアント側ペイロード変異+11のサーバー側ミドルウェア注入)が用意されており、すべてテキストベースでGPUやビジョン依存はありません。
使い方は簡単です。CLIコマンドで即座に開始できます。例えば、evalmonkey run-benchmark --scenario gsm8k --sample-agent rag_app --limit 3で組み込みサンプルエージェントのスモークテストが可能です。独自エージェントの場合は、エージェントがHTTPエンドポイント上で動作していることを確認し、--request-keyと--response-pathパラメータでリクエスト/レスポンス形式をマッピングするだけです。カスタムベンチマークもサポートしており、CSV、JSON、YAMLファイルを用意するだけで、IDと期待される振る舞いのルーブリックを定義できます。
ベンチマークスコアが低い場合、EvalMonkeyは自動的にトレース、評価ファイル、改善プロンプトを生成し、Claude CodeやCursorなどのAIコーディングアシスタントに直接利用できます。また、Webダッシュボードを通じて、すべてのベンチマーク実行を可視化し、信頼性スコアの推移を追跡し、障害トレースをインタラクティブに調査できます。
EvalMonkeyは、評価ジャッジとしてOpenAI、Anthropic、AWS Bedrock、ローカルOllamaなど複数のLLMプロバイダをサポートしており、エージェント自体のAPIキーは不要で、ジャッジ用のキーを独立して設定します。総じて、EvalMonkeyはプロダクション環境で安定したエージェントを運用したいチームにとって強力なツールです。