AI News HubLIVE
站內改寫1 分鐘閱讀

強化學習在機電系統引數辨識中的最優實驗設計

該論文提出一種強化學習代理,用於為機電系統的系統辨識生成最優激勵訊號,並在Quanser Aero 2測試平臺上驗證,實現了高估計精度且僅0.75%的安全違規。

來源arXiv Robotics作者: Julian Langschwert, Georg Schaefer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

在機電系統的系統辨識中,激勵訊號的質量直接影響引數估計的準確性。傳統的系統辨識方法依賴於專家知識和手動設計的訊號,不僅需要保證資訊豐富度,還需考慮硬體安全約束,如電機電流限幅、位置極限等。這些約束限制了方法的通用性和可重複性。近日,來自奧地利的研究團隊在論文“Reinforcement Learning for Optimal Experiment Design in Parameter Identification of Mechatronic Systems”中,提出了一種基於強化學習(RL)的方法,讓代理自主學習最優激勵訊號,同時透過獎勵塑形自動滿足安全約束。

研究人員以Quanser Aero 2飛行器測試平臺為載體,該平臺是一個典型的機電系統,包含兩個電機和三個待辨識引數(如轉動慣量、阻尼係數等)。他們設計了強化學習框架,其中代理的任務是生成激勵訊號序列,目標是最大化引數估計的資訊量(以Fisher資訊矩陣為度量),同時懲罰違反安全約束的行為。代理採用近端策略最佳化(PPO)演算法進行訓練,獎勵函式綜合了資訊增益和安全合規性。

透過10次獨立訓練的種子測試,綜合代理在所有三個引數上均取得了與經典方法(如偽隨機二進位制序列和掃頻訊號)相當甚至更優的估計精度。更令人印象深刻的是,安全違規率僅為0.75%,即在整個實驗過程中,只有極少數動作導致了硬體限制的輕微越界。這一結果表明,強化學習能夠在不依賴人工干預的情況下,自動探索出符合安全要求的高效激勵訊號,為複雜機電系統的自動化系統辨識開闢了新路徑。

該研究的意義在於,它展示了RL在實驗設計中的潛力,尤其是在安全關鍵的物理系統中。未來,該方法可擴充套件到更復雜的多輸入多輸出系統,甚至用於線上自適應實驗設計。該成果已被DEXA AI4IP 2026會議接收,論文預印本可在arXiv獲取(arXiv:2606.00059)。