AI News HubLIVE
サイト内リライト3 分で読了

Echoverse: コンピューター操作エージェントのための深く進化する環境

コンピューター操作AIエージェントは、メールやカスタマーサポートのような複数ステップのワークフローに苦戦しています。Echoverseは、単にトレーニングタスクを増やすのではなく、現実的な環境でエージェントを訓練し、タスク、テスト、環境が進化するにつれてエージェントの改善を支援します。

ソースMicrosoft Research Blog著者: Akshay Nambi, Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Yash Lara, Ahmed Awadallah, Ece Kamar

Echoverseは、マイクロソフトリサーチが開発した、コンピューター操作エージェントを訓練するための深く進化する合成環境システムです。従来の多数のトレーニングタスクに依存する方法とは異なり、Echoverseは環境の品質と深さを重視し、実際のアプリケーションの動作を忠実に再現する合成世界を構築します。これらの世界は、行動の因果関係をリアルに模倣し、状態の一貫性を保つことで、エージェントが実際のフィードバックから学習できるようにします。

研究チームは12のトレーニングワールドを構築しました。そのうち10は深層ドメインワールドで、電子メール、カレンダー、銀行、医療記録、フォーラム、音楽、旅行などの分野をカバーしています。残りの2つは能力ワールドで、特定のUI要素(日付ピッカー、ネストされたフィルターなど)の操作に特化しています。これらのワールドは、実際のデータまたは厳密に生成されたシードデータに基づいており、データベースベースの客観的な検証器を備えています。

実験結果によると、9Bパラメータのモデルはこれらのワールドでトレーニングされた後、パフォーマンスが36.5%から67.1%に向上し、GPT-5.4にわずか14ポイント差まで迫りました。研究では、シミュレーションの忠実度が高いことが重要であることも明らかになりました。浅いワールドでトレーニングされたモデルはパフォーマンスが低下した一方、深いワールドでは向上しました。また、エージェントが頻繁に失敗する特定のUI要素を対象としたトレーニングにより、未見のドメインでの汎化能力が大幅に向上しました。

Echoverseの中心的な革新は「共進化」のループです。エージェントの評価が行われるたびに、環境自体も改善されます。エージェントがタスクに失敗すると、システムは失敗の原因を分析し、環境、タスク、または検証器を修正します。これにより、エージェントと環境が反復ごとに共に進化し、トレーニング効果が累積されます。研究チームは、真のレバレッジはワールドを追加することよりも、既存のワールドを継続的に改善するループにあると述べています。

ワールド構築プロセスは2段階で行われます。最初に、シードシナリオからアプリケーション仕様を生成し、それを機械チェック可能なクレームにコンパイルし、FastAPIとSQLiteのバックエンド、Reactのフロントエンドを生成し、すべてのクレームがパスするまで修復します。第2段階はコーパスの拡張です。各タスクをライブデータベースに再バインドし、アナライザーパネルでエンティティの現実性と目標の妥当性をチェックし、ブラウザテストでタスクが完了可能であることを確認します。各失敗は適切な層にタグ付けされ、修復され、通過率が頭打ちになるまでスコアリングが繰り返されます。

検証器はデータベースに基づいて客観的な解答キーを提供します。読み取り操作は保存された値との意味的等価性で評価され、書き込み操作はデータベースの差分で判断され、読み書き操作は両方の低い方のスコアを取ります。この評価メカニズムは操作が難しく、すべてのドメインで統一されています。

完全なドメインワールドは、通信・調整(EchoMail、EchoCalendar、EchoChat)、技術創造(EchoML、EchoForge)、規制記録(EchoBank、EchoCare)、コミュニティ・メディア(EchoForum、EchoTunes)、旅行(EchoStay)をカバーしています。各ワールドは、権限、共有状態、監査履歴などの複雑な構造を含む実際の製品のワークフローを忠実に再現しています。例えば、EchoStayはInsideAirbnbの実際のデータに基づいており、80以上のルートと23のデータベーステーブルを持ち、検索から支払いまでの全プロセスをシミュレートしています。この深さにより、エージェントは実際の因果関係を学習できます。

能力ワールドは、エージェントが頻繁に失敗する特定の操作(日付ピッカーやネストされたフィルターなど)に焦点を当てています。これらのコントロールを様々な形で練習することで、モデルはトレーニングで見たことのないドメインでも操作できるようになりました。このようなターゲットトレーニングは一般化能力を大幅に向上させます。

共進化のループはEchoverseの核心です。各評価はトレーニングデータを生成するだけでなく、ワールド、タスク、または検証器の欠陥を露呈し、それらが自動的に修復され、次のトレーニングのシグナルがより鋭くなります。この閉ループによりトレーニング効果が蓄積され、飽和に陥ることがありません。

まとめると、Echoverseは深さ、ターゲティング、共進化を重視することで、コンピューター操作エージェントのトレーニングに新しい方向性を提供します。高品質な合成環境の価値を実証し、継続的な改善がモデル能力を押し上げる方法を示しています。また、研究コミュニティのさらなる探求を促進するために、一部のワールドをオープンソース化しています。