開源螞蟻:用於強化學習研究的機器人平台
本文介紹Open Ant,一個物理機器人平台,旨在彌合強化學習研究中的仿真與真實世界差距。研究顯示,從零開始學習行走策略僅需約一小時,並支持Sim-to-Real遷移。硬件和軟件均已開源。
強化學習(RL)研究在物理和模擬領域均取得了成功,但主流方法仍以仿真為主。這導致算法和研究者將研究成果遷移到物理現實時面臨不確定性。為解決這一問題,本文作者提出了一個物理平台——Open Ant,旨在簡化從仿真到實際應用的過渡。
Open Ant是常用Gymnasium Ant環境的物理變體,並配有對應的仿真環境。研究團隊演示了兩種截然不同的RL算法——SARSA(λ)和Soft Actor-Critic(SAC)——能夠直接從物理機器人的經驗中,在大約一小時內從零開始學習到行走策略。SARSA(λ)是一種基於時間差分的策略迭代方法,而SAC是一種基於最大熵的隨機策略優化算法。兩者在理論和實現上差異顯著,但均能在Open Ant上快速學習有效的行走策略。此外,在仿真中訓練的策略也能成功遷移到真實機器人上,驗證了平台的Sim-to-Real能力。
平台還支持靈活的實驗生態。作者觀察到,來自不同背景的新用户能夠快速上手並首次成功運行平台,且當出現硬件問題時,平台易於修復和更新。硬件設計採用模塊化組件,如3D打印結構和標準電機,降低了定製和維修的門檻。軟件方面,提供了完整的ROS 2接口和Python API,便於集成和擴展。所有硬件設計和軟件均已開源發佈在GitHub上,便於研究者根據自己需求進行修改。
總之,Open Ant為經常使用仿真環境的RL研究人員提供了一個便捷的途徑,使他們能夠更輕鬆地將機器人實驗納入評估體系中。該平台的發佈有望加速RL算法從仿真到現實世界的轉化,推動機器人學習研究的發展。