WCM: 汎用的人間ロボット対話のための世界認識モデル
研究者らは、SLAKアーキテクチャ(センシング、ロジック、アクション、ナレッジ)と非同期ランタイムに基づく人間中心の具現化エージェントである世界認識モデル(WCM)を提案。認識、推論、制御、記憶を分離し、ヒューマン・イン・ザ・ループの教育モードを導入することで、ユーザーが対話を通じてロボットに困難なタスクや長期的なタスクを教えられるようにした。9つの実世界の人間ロボット対話タスクで73.8%の平均成功率を達成。
現在、言語エージェント(例:ChatGPT)はソフトウェア環境でユーザーと流暢にやり取りできるが、ロボットは物理タスクで同等の対話を実現するのに苦労している。既存のロボット制御パラダイム(視覚言語動作ポリシーや世界モデルベースのプランナーなど)は主に命令実行に最適化されており、ユーザーはアクションが選択された理由をほとんど理解できず、対話を通じてロボットを誘導、修正、教育する仕組みが不足している。
この問題を解決するため、研究者らは世界認識モデル(WCM)を提案した。これはSLAKアーキテクチャ(センシング、ロジック、アクション、ナレッジ)と非同期ランタイムに基づく人間中心の具現化エージェントである。SLAKは知覚、推論、制御、記憶を分離し、各モジュールを独立に最適化・アップグレード可能にする。非同期ランタイムは推論、対話、実行を並行して処理し、全体の効率と応答性を向上させる。
WCMの核心は、ヒューマン・イン・ザ・ループ教育モードの導入にある。このモードでは、ユーザーは自然言語と実演動作を通じて、ロボットに困難なタスクや長期的なタスクを対話的に教えることができる。教育エピソードと自律タスクロールアウトのデータは、思考連鎖(chain-of-thought)監視信号に洗練され、モデルの継続的改善に利用される。この仕組みはロボットの学習能力を高めるだけでなく、対話の透明性と説明可能性も向上させる。
実験評価では、WCMは9つの実世界人間ロボット対話タスクで平均73.8%の成功率を達成した。タスクには思考連鎖微調整から除外されたもの(held-out tasks)や教育を通じて学習した長期的タスクが含まれる。WCMは未訓練のタスクでも良好な汎化性能を示し、これはモジュール型アーキテクチャと継続学習機構に起因する。
WCMの提案は、人間とロボットの協働に、より自然で効率的な道を開く。ユーザーは単なる指示者ではなく、ロボットの協力者・教育者となる。将来、WCMは家庭サービス、医療支援、工業製造などの分野で重要な役割を果たし、ロボットを道具からパートナーへと変革する可能性がある。