開源螞蟻:用於強化學習研究的機器人平臺
本文介紹Open Ant,一個物理機器人平臺,旨在彌合強化學習研究中的模擬與真實世界差距。研究顯示,從零開始學習行走策略僅需約一小時,並支援Sim-to-Real遷移。硬體和軟體均已開源。
強化學習(RL)研究在物理和模擬領域均取得了成功,但主流方法仍以模擬為主。這導致演算法和研究者將研究成果遷移到物理現即時面臨不確定性。為解決這一問題,本文作者提出了一個物理平臺——Open Ant,旨在簡化從模擬到實際應用的過渡。
Open Ant是常用Gymnasium Ant環境的物理變體,並配有對應的模擬環境。研究團隊演示了兩種截然不同的RL演算法——SARSA(λ)和Soft Actor-Critic(SAC)——能夠直接從物理機器人的經驗中,在大約一小時內從零開始學習到行走策略。SARSA(λ)是一種基於時間差分的策略迭代方法,而SAC是一種基於最大熵的隨機策略最佳化演算法。兩者在理論和實現上差異顯著,但均能在Open Ant上快速學習有效的行走策略。此外,在模擬中訓練的策略也能成功遷移到真實機器人上,驗證了平臺的Sim-to-Real能力。
平臺還支援靈活的實驗生態。作者觀察到,來自不同背景的新使用者能夠快速上手並首次成功執行平臺,且當出現硬體問題時,平臺易於修復和更新。硬體設計採用模組化元件,如3D列印結構和標準電機,降低了定製和維修的門檻。軟體方面,提供了完整的ROS 2介面和Python API,便於整合和擴充套件。所有硬體設計和軟體均已開源釋出在GitHub上,便於研究者根據自己需求進行修改。
總之,Open Ant為經常使用模擬環境的RL研究人員提供了一個便捷的途徑,使他們能夠更輕鬆地將機器人實驗納入評估體系中。該平臺的釋出有望加速RL演算法從模擬到現實世界的轉化,推動機器人學習研究的發展。