TraceCoder: 位置キーのスニペットバージョン管理による説明可能で監査可能なコード生成
LLMベースのコーディングエージェントはブラックボックスとしてコードを生成し、各行の根拠や修復履歴が不明瞭です。TraceCoderは、リレーショナルなスニペット履歴スキーマ、ブラウザベースの可視化ツール、分数位置キー索引方式の3つの仕組みで、コード生成の「物語」を監査・再生可能にします。30のアルゴリズムタスクで評価し、平均Chg%は30%、スニペットの30%に追跡可能な修復イベントが記録されました。
現在の大規模言語モデル(LLM)ベースのコーディングエージェントは、コードをブラックボックスとして生成します。各行の背後にある根拠は隠され、ベンチマーク駆動の修復を通じたコードの進化は一時的で、事後監査は不可能です。この問題に取り組むため、新しい論文は TraceCoder という概念を提案しています。これは、3つの補完的なメカニズムを通じて、自動コード生成の内部の「物語」を監査可能かつ再生可能にするものです。
第一のメカニズムはリレーショナルなスニペット履歴スキーマです。修復イベントごとに、ベンチマーク参照、ラウンド番号、失敗テキスト、LLMの説明を記録し、完全な来歴クエリを可能にします。第二はブラウザベースの可視化ツールで、この履歴をヒートマップ付き・ホバー注釈付きのソースコードとして描画します。第三は、ツリーノード区切り文字を備えた競争的な分数位置キー索引方式で、各コードスニペットに安定した辞書順の識別子を割り当て、周囲の行を乱さずに細粒度の追跡を実現します。
研究チームは、文字列処理、数学計算、データ構造操作を含む30のアルゴリズムプログラミングタスクで、2つのプロバイダ構成にわたって TraceCoder を評価しました。このうち10タスクでは、微妙なエッジケース挙動により6回の反復予算を使い切りました。平均Chg%は30%に達し、コードスニペットの10個中3個が追跡可能な修復イベント行を持ちました。比較として、20タスクのサブセットで Gemini 2.0 Flash を単独プロバイダとして使用した場合は21%でした。また、3つの詳細なケーススタディを通じて、システムが特定のベンチマーク失敗によって最終プログラムの各行がどのように形成されたかを説明できることを示しています。
この仕組みは、本番環境での信頼と説明責任に不可欠な性質を提供します。コード生成プロセスが不透明でなくなれば、開発者や監査者は自動修復の各ステップを再生・検証でき、エラー発見やリスク評価が容易になります。TraceCoder は現在、arXiv プレプリントとして公開されており、AGENTICS 2026 の proceedings に掲載予定です。