強化學習在機電系統參數辨識中的最優實驗設計
該論文提出一種強化學習代理,用於為機電系統的系統辨識生成最優激勵信號,並在Quanser Aero 2測試平台上驗證,實現了高估計精度且僅0.75%的安全違規。
在機電系統的系統辨識中,激勵信號的質量直接影響參數估計的準確性。傳統的系統辨識方法依賴於專家知識和手動設計的信號,不僅需要保證信息豐富度,還需考慮硬件安全約束,如電機電流限幅、位置極限等。這些約束限制了方法的通用性和可重複性。近日,來自奧地利的研究團隊在論文“Reinforcement Learning for Optimal Experiment Design in Parameter Identification of Mechatronic Systems”中,提出了一種基於強化學習(RL)的方法,讓代理自主學習最優激勵信號,同時通過獎勵塑形自動滿足安全約束。
研究人員以Quanser Aero 2飛行器測試平台為載體,該平台是一個典型的機電系統,包含兩個電機和三個待辨識參數(如轉動慣量、阻尼係數等)。他們設計了強化學習框架,其中代理的任務是生成激勵信號序列,目標是最大化參數估計的信息量(以Fisher信息矩陣為度量),同時懲罰違反安全約束的行為。代理採用近端策略優化(PPO)算法進行訓練,獎勵函數綜合了信息增益和安全合規性。
通過10次獨立訓練的種子測試,綜合代理在所有三個參數上均取得了與經典方法(如偽隨機二進制序列和掃頻信號)相當甚至更優的估計精度。更令人印象深刻的是,安全違規率僅為0.75%,即在整個實驗過程中,只有極少數動作導致了硬件限制的輕微越界。這一結果表明,強化學習能夠在不依賴人工干預的情況下,自動探索出符合安全要求的高效激勵信號,為複雜機電系統的自動化系統辨識開闢了新路徑。
該研究的意義在於,它展示了RL在實驗設計中的潛力,尤其是在安全關鍵的物理系統中。未來,該方法可擴展到更復雜的多輸入多輸出系統,甚至用於在線自適應實驗設計。該成果已被DEXA AI4IP 2026會議接收,論文預印本可在arXiv獲取(arXiv:2606.00059)。