面向元強化學習的擬蒙特卡洛初始化方法
新論文研究擬蒙特卡洛(QMC)權重初始化在元強化學習中的應用。在相似未見任務上,該方法比正交初始化收斂更快,但在不相似任務上正交初始化更優。
元強化學習(Meta-Reinforcement Learning, Meta-RL)致力於開發能夠快速適應新任務的智慧體,其中權重初始化策略對訓練效率與泛化能力具有重要影響。傳統的正交初始化(如 Stable Baselines3 中採用的預設方法)提供了無偏的搜尋起點,但在特定遷移學習場景下未必最優。Julian G. Soltes 在其最新預印本論文《Quasi-Monte Carlo Initialization for Meta-Reinforcement Learning》(arXiv:2607.21637)中,提出利用擬蒙特卡洛(Quasi-Monte Carlo, QMC)方法生成元先驗(meta-priors),從而最佳化初始化權重。
QMC 是一種數值積分方法,透過低差異序列在引數空間中更均勻地取樣,相較於標準蒙特卡洛方法具有更快的收斂速度。在這項工作中,作者採用多種取樣策略(如 Sobol 序列等)約束基於種群的搜尋,從一組基線任務中聚合出最優先驗。實驗在多個連續控制基準環境(如 MuJoCo 環境)上進行,評估了 QMC 元先驗在未見任務上的遷移效能。
結果表明,在相似的未見任務中,QMC 初始化相比正交初始化能顯著提升訓練收斂速度,加速智慧體的適應過程。然而,當任務與訓練集存在較大差異時,正交初始化憑藉其無偏特性表現更為全域性優越。因此,兩種方法在不同場景下各具優勢。
該論文共 6 頁,包含 6 張圖表和 1 張表格,詳細列出了實驗引數與結果對比。論文於 2026 年 7 月 21 日提交至 arXiv,歸屬機器學習(cs.LG)與最佳化控制(math.OC)領域,並附有完整的引用資訊與輔助工具連結。研究為 Meta-RL 的初始化策略提供了新視角:在任務分佈相對一致的條件下,QMC 初始化是更優的選擇;而對於未知或差異較大的任務,正交初始化仍是最穩妥的預設方案。
這一發現可能推動後續研究在初始化方法上的重新評估,並促進相關開源實現與標準基準的更新。