低解像度自己中心視覚を用いた能動的知覚のための行動クローニング
新しい研究により、行動クローニングを用いて、構造化された物体発見タスクにおいて低解像度の自己中心視覚で能動的知覚が生成できることが示された。低コストのロボットアームと手首搭載RGBカメラを使用し、相対関節デルタの予測が絶対位置予測を大幅に上回ることを実証した。
アンソニー・ビリック氏らによるarXiv論文(番号2605.14106)では、行動クローニングが能動的知覚タスクに適用可能かどうかを調査した。研究チームは、構造化された物体発見シナリオを設計した。手首に自己中心型RGBカメラを搭載した低コストのロボットアームが、部分的に見える植物を中央に配置するために再位置決めし、つかみ信号をトリガーする必要がある。このプロセスでは、将来の観測を改善する動作が求められる。
モデルは行動クローニングを用いて、低解像度RGB画像から直接関節指令を予測し、閉ループ制御を実現する。実験の結果、低解像度(例:32x32ピクセル)の自己中心視覚でもタスクを確実に完了できることが示された。これは、高解像度センサーが能動的知覚に必須ではないという重要な示唆を与える。さらに、相対関節デルタ(relative joint deltas)の予測が絶対関節位置の予測よりも大幅に優れていることが明らかになった。具体的には、相対デルタ予測によりロボットはエンドエフェクタの位置をより正確に調整し、ターゲット物体を効果的に中央に配置できる。
これらの結果は、再現可能な環境において、視覚に基づく能動的知覚が行動クローニングから生じ得ることを実証している。この研究は、低コストロボットの知覚に新たな可能性を示し、高解像度センサーや複雑なモデルがなくても効果的な閉ループ相互作用が可能であることを示唆している。論文では、産業用仕分けや家庭用支援などへの応用可能性、および動的環境での検証の必要性についても議論されている。