成本受限四足硬件上的強化學習
本文探討在低成本四足機器人(如Mini Pupper 2)上部署強化學習策略時,超過50毫秒的傳輸延遲如何導致仿真與現實差距擴大。通過引入執行器延遲的前向模型和時序感知神經網絡,實現了魯棒的行走,並且網絡自組織出類似脊椎動物脊髓的中樞模式生成器(CPG),對高達+320毫秒的額外延遲擾動表現出強魯棒性。研究指出時間自組織可能是成本受限運動控制的通用策略。
在低成本四足機器人(如Mini Pupper 2)上部署基於強化學習的控制策略面臨嚴峻挑戰。由於硬件成本限制,這些平台普遍存在顯著的執行器傳輸延遲(實驗測量超過50毫秒)和電機反饋噪聲,導致仿真環境與真實硬件之間的差距(sim-to-real gap)急劇擴大。這一問題將原本標準的馬爾可夫決策過程轉化為部分可觀測過程,使得傳統強化學習方法難以直接應用。為了彌合這一鴻溝,研究人員從生物系統中獲得靈感,提出了一種結合執行器平均延遲前向模型與時序感知神經網絡的創新方法。該前向模型為網絡提供了延遲的統計信息,而時序感知神經網絡則能夠處理非馬爾可夫特性,從噪聲和延遲的反饋中提取有效信號。通過這種組合,機器人學會了魯棒的行走策略,即使在未知延遲條件下也能保持穩定。令人驚喜的是,該時序感知神經網絡在訓練過程中自行湧現出一種中央模式生成器(central pattern generator, CPG)。CPG是脊椎動物脊髓中存在的神經迴路,能夠產生自維持的節律運動信號。在此工作中,該網絡生成的CPG步態對高達+320毫秒的額外延遲擾動表現出極強的魯棒性,模擬了自然界中生物的運動控制機制。作者指出,這種時間自組織現象可能並非偶然,而是成本受限 locomotion 問題中一種普遍有效的策略。未來,這一方法有望推廣到其他低成本機器人平台,使強化學習在資源受限的硬件上發揮更大作用,推動機器人技術的普及。