AI News HubLIVE
站內改寫1 分鐘閱讀

安全約束的強化學習與訓練後可達性驗證用於機器人導航

研究人員提出了一種用於機器人導航的安全強化學習框架,該框架在訓練過程中使用條件風險價值(CVaR)約束,並在訓練後通過神經網絡可達性驗證來確保安全裕度。該方法在仿真中實現了98.3%的成功率,併成功遷移到真實機器人上。

來源arXiv Robotics作者: Qisong He, Xinmiao Huang, Jinwei Hu, Zhuoyun Li, Yi Dong, Changshun Wu, Xiaowei Huang

在機器人導航領域,安全性是部署自主系統的關鍵挑戰。傳統的強化學習方法通常使用平均累積成本來評估安全策略,然而這種指標可能掩蓋高成本的尾部風險行為。為了解決這一問題,來自Qisong He等七位研究者的工作提出了一種結合條件風險價值(CVaR)約束優化與訓練後可達性驗證的安全強化學習框架。

該框架基於離策略的TD3算法,在訓練過程中引入CVaR約束,使得策略對高成本的尾部結果更加敏感,而不是僅僅優化平均表現。具體來説,CVaR約束要求策略在累積成本分佈的高尾部分保持較低的風險,從而在數學上保證策略對極端事件的魯棒性。訓練完成後,研究者採用泰勒模型分析,在合理的觀測不確定性假設下計算策略的動作可達集合。通過定義安全率指標,量化在評估狀態下策略的可達動作集保持在預設安全邊界內的比例。

實驗在十個不同的導航場景中進行,與六個基線方法(包括無約束、標準成本約束等)的對比表明,CVaR約束訓練的策略在評估狀態下保持了更大的障礙物安全裕度。該方法達到了98.3%的成功率,在所有對比方法中安全驗證率最高。更重要的是,研究發現平均成本排名與基於可達性的安全排名可能產生分歧,這表明可達性驗證能夠捕捉到僅靠經驗成本指標無法識別的風險,為安全評估提供了更全面的視角。

為了驗證方法在實際環境中的可行性,研究團隊在Clearpath Jackal地面機器人上進行了實物實驗。機器人搭載了有限的傳感器,在室內環境中執行導航任務,成功實現了從仿真到現實的遷移。這一工作不僅為移動機器人導航提供了更可靠的安全保障,也為後續研究將形式化驗證與風險敏感學習相結合提供了重要範式。