AIエージェントシステムのための決定論的リプレイフレームワーク
大規模言語モデルと外部ツールを組み合わせたAIエージェントシステムは本質的に非決定論的です。arXiv論文はagreplフレームワークを提案し、MITMプロキシで外部インタラクションを記録し、分離環境で再生することで、完全な再現忠実度(F=1.0)と98.3%のレイテンシ削減を実現します。
大規模言語モデル(LLM)と外部ツール・APIを組み合わせたAIエージェントシステムは、LLMのサンプリングばらつき、外部APIの状態変化、CDNインフラストラクチャヘッダー、実行環境ノイズなどの要因により、実行の再現が困難です。既存の可観測性プラットフォームは実行ログを記録しますが、単独での実行再現はできません。
arXivに投稿された論文では、agreplというフレームワークを提案しています。これは、MITM(中間者攻撃)プロキシを介してトランスポート層で外部とのやり取りをすべて横取りし、構造化された実行トレースとしてシリアライズし、外部ネットワークアクセスを完全に遮断した隔離環境で再生するCLIフレームワークです。
agreplはエージェント実行モデルを形式化し、リクエストキー照合関数K(s)を定義して決定論的不変条件を証明します。さらに、ノイズ認識差分アルゴリズムを導入し、HTTPヘッダーの差異をシグナルとノイズに分類します。
5種類のワークロード(n=250再生インスタンス)による実証評価では、再生忠実度F=1.0、ステップあたりのレイテンシ中央値98.3%削減を達成しました。agreplはGoで実装され、単一の静的バイナリとして配布され、MITライセンスで公開されています。
このツールは、AIエージェントシステムのデバッグや再現性研究を強力に支援し、開発者が以前の実行を正確に再現して問題を効率的に特定することを可能にします。さらに、隔離環境での再生により、実際のAPIへの依存を排除し、ノイズ認識アルゴリズムでヘッダー変動を適切に処理するため、実践的なデプロイシナリオにも対応できます。このフレームワークはデバッグ効率を向上させるだけでなく、エージェントシステムの信頼性検証の基盤を提供します。