CORVUS: 基盤同期によるLLMコーディングエージェントのコンテキスト最適化と削減
CORVUSを提案。ファイル読み取り操作と観測を分離し、同期レジストリを維持することで、LLMコーディングエージェントの冗長なトークンと推論サイクルを大幅に削減し、合格率を維持する新しい軌跡アーキテクチャ。
大規模言語モデル(LLM)を用いたコーディングエージェントは、推論、ツール呼び出し、結果を蓄積する軌跡(trajectory)を構築することで、多段階の意思決定を実行します。しかし、現在広く使われている追記型(append-only)の軌跡アーキテクチャでは、ファイル読み取り操作とその結果得られるスナップショットが密結合されており、時系列順に固定されます。エージェント自身の編集や人間による並行した変更によりファイルの内容が更新されると、過去のスナップショットは即座に古くなり、推論エラーを引き起こします。その結果、エージェントは同じファイルを何度も再読み取りし、そのたびに新しいコピーを軌跡に追加するため、軌跡が不要に肥大化し、トークン消費の増加と推論の遅延を招きます。
この問題を解決するため、研究チームはCORVUS(Context Optimization and Reduction Via Underlying Synchronization)という新しい軌跡アーキテクチャを提案しました。CORVUSでは、関連するファイルの現在の状態を管理する同期レジストリを導入し、各推論サイクルにおいて実際のファイル内容のみを注入することで、ファイル読み取り操作と観測結果を完全に分離します。この構造的変更により、軌跡から冗長なファイルコピーと古いスナップショットが排除され、実際のコードベースと常に同期した軽量な軌跡が生成されます。
研究チームは、SWE-POLYBENCH_VERIFIEDとSWE-BENCH PROの2つのベンチマークにおいて、4種類のLLMを用いてCORVUSを評価しました。その結果、タスクあたりの平均入力トークン数が9%から50%削減され、最終プロンプトの長さが15%から32%短縮され、推論サイクル数が最大37%削減されました。同時に、合格率は従来手法と同等に維持されました。これらの結果は、CORVUSがタスク完了品質を損なうことなく、コーディングエージェントの効率を大幅に向上させることを示しています。
本研究は、LLMコーディングエージェントの実用化に向けて重要な一歩です。冗長なトークンと推論サイクルの削減により、APIコストの低減、応答時間の短縮、そしてより複雑なコード編集タスクの実行が可能になります。今後、CORVUSは主要な開発ツールやエージェントフレームワークに統合され、AI支援プログラミングの進化を加速することが期待されます。