低コスト四足ロボットハードウェアへの強化学習の適用
低コスト四足ロボット(Mini Pupper 2など)に学習済み制御ポリシーを展開する際、50ミリ秒以上の伝送遅延がシミュレーションと現実のギャップを拡大させる。アクチュエータ遅延の平均的な前方モデルと時間認識型ニューラルネットワークを用いることで、ロバストな歩行を実現し、さらに+320ミリ秒の遅延摂動に耐える中枢パターン発生器(CPG)の出現を観察した。この研究は、コスト制約下の運動制御における時間的自己組織化の一般的な戦略を示唆している。
低コスト四足歩行ロボット(Mini Pupper 2など)に強化学習制御ポリシーを展開する際には、大きな課題が存在します。ハードウェアのコスト制約により、アクチュエータの伝送遅延(実測で50ミリ秒以上)やモーターフィードバックノイズが顕著であり、シミュレーションと実機の間のギャップ(sim-to-real gap)が大幅に拡大します。この遅延により、標準的なマルコフ決定過程は部分観測過程へと変質し、従来の強化学習手法では対応が困難になります。この問題を解決するため、研究者らは生物学的なインスピレーションを得て、アクチュエータ遅延の平均値をモデル化した前方モデルと、時間認識型ニューラルネットワークを組み合わせた手法を提案しました。前方モデルがネットワークに遅延の統計情報を提供し、時間認識型ネットワークが非マルコフ性を扱い、ノイズや遅延を含むフィードバックから有効な信号を抽出します。この組み合わせにより、ロボットは未知の遅延条件下でも安定した歩行を学習しました。さらに驚くべきことに、このネットワークは訓練中に中央パターン発生器(central pattern generator, CPG)を自己組織化しました。CPGは脊椎動物の脊髄に見られる神経回路で、自律的なリズム運動信号を生成します。本研究でネットワークが獲得したCPG歩容は、最大+320ミリ秒の追加遅延摂動に対しても高いロバスト性を示し、自然界の運動制御メカニズムを模倣しています。著者らは、この時間的自己組織化がコスト制約下の歩行問題における一般的な戦略である可能性を示唆しています。将来的に、この手法は他の低コストロボットプラットフォームへ応用され、強化学習の適用範囲を広げ、ロボット技術の普及に貢献することが期待されます。