LENS: LLMによる雑然環境の簡略化手法—プランニングと制御のための
汎用ロボット操作の進歩にもかかわらず、実世界の複数物体が散乱する環境は依然として困難です。LENSはプラグアンドプレイの修正として、LLMを用いてシーン固有の抽象表現を自動生成し、エンティティのマージやプルーニングによりタスクに適応させ、さまざまな操作手法の性能を向上させます。
近年、汎用ロボット操作は著しい進歩を遂げているものの、現実世界における複数物体が散乱した環境(クラッター環境)は依然として大きな課題となっています。物体数の増加、衝突の頻発、予測困難な接触物理、妨害物、タスクの曖昧さなどにより、問題の複雑さは飛躍的に増大します。既存のロボット操作手法(古典的プランニング、モデル予測制御、視覚言語動作モデルなど)は、高度に散乱したシーンでは性能が低下しがちです。実環境への展開に向けては効果的なシーン抽象化が不可欠ですが、現状ではこのような抽象化を生成するためにタスク固有の手動エンジニアリングが大量に必要であり、コストが高く調整も困難です。例えば、どの物体が関連するかを手動で定義し、積み重なった物体をどう扱うか、遠方の妨害物を無視するかなどを細かく設定する必要があり、新しいタスクへの適応が難しいという問題があります。
この問題に対処するため、研究者らはLLM誘導型環境簡略化手法(LENS)を提案しました。LENSはプラグアンドプレイ方式で、既存のプランニングおよび制御スタック上に、シーン固有・タスク固有・適応的に更新される抽象表現を自動生成します。具体的には、タスクの進捗に応じて閉ループでシーン内のエンティティをマージ(例:積み重なった物体)またはプルーニング(例:遠方の物体)することで、散乱を除去した抽象シーン表現を生成します。このプロセスでは大規模言語モデルを活用し、タスクの文脈やシーンの幾何学的情報を考慮して、どのエンティティを統合または削除するかをリアルタイムで決定します。生成される抽象表現は動的でタスクに関連しており、さまざまなロボットシステムに容易に統合できます。
実験では、LENSを古典的プランニング(例:サンプリングベースの運動計画)、モデルベース制御(例:モデル予測制御)、視覚言語動作モデル(例:RT-2)など、多様な高度に散乱した操作シーンに適用しました。結果、LENSはこれらの手法の成功率と効率を顕著に向上させました。例えば、物体の山から特定のアイテムを掴むタスクでは、積み重なった物体をマージすることで探索空間を削減し、古典的プランニングの速度を数倍に高速化しました。また、視覚言語動作モデルに対しては、LENSが提供する簡略化表現がモデルの推論ノイズを低減し、タスク完了の正確性を高めました。この成果は、大規模言語モデルを活用したシーン簡略化の可能性を示しており、複雑環境でのロボット操作の実用化に向けた有力なアプローチを提供します。プロジェクトウェブサイト(https://lens-2026.github.io/)ではさらに詳細な情報が公開されています。