本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

どのモダリティが重要かを感知する:ロバストなVLAポリシーのための証拠ゲート正則化

記事の要約

Vision-Language-Action(VLA)ポリシーは、限られた同質のロボット実演データで学習すると、タスクに関連する信号ではなくセンサー間の見せかけの相関を学習してしまうことがあります。著者らはこれを「モダリティ絡み合い(modality entanglement)」と呼びます。本論文が提案するEvidence-Gated Regularization(EGR)は、推論時のオーバーヘッドを一切増やさない訓練目的で、フレーム・センサーごとのタスク関連性に基づき、低エビデンスセンサーには不変性を、高エビデンスセンサーには単一センサーでの十分性を課します。BEHAVIOR-1K由来のベンチマークと2種類の実機ロボット検証では、単一センサーフォールバック時+120%、物理的妨害物のある双腕セットアップで+183%などの成功率向上を達成しました。

ソースarXiv Robotics著者: Yue Yang, Diego Romeres, Chiori Hori, Gedas Bertasius, Daniel Szafir, Siddarth Jain
どのモダリティが重要かを感知する:ロバストなVLAポリシーのための証拠ゲート正則化
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

Vision-Language-Action(VLA)モデルは、視覚と言語と行動生成を統合するロボット学習の有望な枠組みです。しかし、実ロボットのデモンストレーションデータは収集コストが高く、どうしても規模が限られ、分布が偏りがちです。そのため、モデルはタスクに本当に必要な信号ではなく、センサー間の見せかけの相関関係に基づいて行動を予測してしまうことがあります。本論文は、この問題を「モダリティ絡み合い(modality entanglement)」と呼び、その原因と対策を示しています。著者らはYue Yang氏ら6名で、論文は2026年9月2日にarXivへ提出されました。

モダリティ絡み合いは、実際には次の2つの形で顕在化します。1つ目は、タスクと無関係なセンサーが遮蔽されたり破損したりしたときに、ポリシーの出力が大きく乱れる「ノイズ感度」です。2つ目は、タスク情報を持つ唯一のセンサーだけが正常な場合に、他のセンサーとの相関に依存するあまり十分に機能しない「単一モダリティ不足」です。つまり、マルチモーダル融合の設計が原因で、現実世界の障害物や遮蔽に対して脆くなっています。

そこで本論文が提案するのがEvidence-Gated Regularization(EGR)です。EGRは特定のモダリティに依存しない学習目的で、各フレーム・各センサーのタスク関連性を表す「証拠(evidence)」を推定し、その証拠に応じて2種類の状態条件付き一致性の目標を動的にゲートします。具体的には、証拠が低いセンサーに対しては「不変性」を、証拠が高いセンサーに対しては「単一センサーでも十分に機能する」ことを促進します。EGRは学習時のみに作用し、推論時には余分な計算やモデル変更を必要としない点が大きな利点です。

評価も体系的に行われています。まず、BEHAVIOR-1Kを基盤に、実行を伴わず高速に診断できる推論専用スイートと、47の長期的なスキルからなるロールアウトベースのタスクを含む新しいベンチマークを構築しました。さらに、根本的に異なる2つの実機ロボットでも検証しています。1つは2台のKinovaアームと3台のRGBカメラを使った双腕システム、もう1つは単腕のMELFA ASSISTAに視覚とGelSight触覚センサーを組み合わせたシステムです。

シミュレーションでは、EGRにより全モダリティ利用時の成功率が12.5%から16.4%に向上(相対31%増)。タスクと無関係なセンサーを破損させた状況では9.4%から16.5%(同75%増)、単一センサーしか使えないフォールバック状況では2.8%から6.1%(同120%増)という結果が得られました。実機実験では物理的な物体を妨害物として配置し、双腕システムでは成功率が30%から85%(同183%増)、触覚センサーを備えた単腕システムでは55%から70%(同27%増)まで改善しました。

本稿の貢献は、どのセンサーが今この瞬間のタスクに本当に寄与しているのかを明示的に学習に取り込むことで、従来のブラインドなマルチモーダル融合よりも堅牢なVLAポリシーを実現した点にあります。EGRは推論時のオーバーヘッドを増やさないため、既存のポリシーへの適用もしやすく、実環境の遮蔽・妨害物・センサー故障などに対してより安定した操作を実現する上で有用な手法と言えます。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 限られた同質のロボット実演データで学習したVLAポリシーは、タスク関連信号ではなくセンサー間の見せかけの相関を学習する「モダリティ絡み合い」を起こす。
  • 提案手法Evidence-Gated Regularization(EGR)は、フレーム・センサー単位の証拠で一致性目的をゲートし、推論時オーバーヘッドはゼロ。
  • シミュレーション成功率は、全モダリティ利用時12.5%→16.4%、無情報センサー破損時9.4%→16.5%、単一センサーフォールバック時2.8%→6.1%に向上した。
  • 実機では物理的な妨害物がある状態で、双腕Kinova構成では成功率が30%→85%、MELFA ASSISTA触覚構成では55%→70%に向上した。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。