AI News HubLIVE
站內改寫1 分鐘閱讀

強化學習引導的NSGA-II結合灰色關聯絡數用於多目標最佳化:在納斯達克投資組合最佳化中的應用

本文提出一種新型的強化學習引導的NSGA-II演算法(RL-NSGA-II-GRC),透過引入灰色關聯絡數和強化學習代理,在解決多目標最佳化問題中顯著改善收斂性和Pareto前沿的多樣性。在Kursawe和CONSTR基準測試中,該演算法相比傳統NSGA-II實現了約5.8%和4.4%的收斂改進,並在納斯達克投資組合最佳化中生成平滑且密集的有效前沿,識別出年化夏普比率為1.92的最大夏普比率投資組合。

來源arXiv Machine Learning作者: Zhiyuan Wang, Qinxu Ding, Ding Ding, Siying Zhu, Jing Ren, Yue Wang, Chong Hui Tan

在現代金融市場中,決策者越來越依賴定量方法在多個相互衝突的目標之間進行權衡。本文針對約束多目標最佳化問題,以投資組合最佳化為例,旨在最小化風險並最大化收益。為彌補現有方法的不足,研究者提出了一種新型的強化學習引導的非支配排序遺傳演算法II,結合灰色關聯絡數,稱為RL-NSGA-II-GRC。該演算法將強化學習代理控制器與基於灰色關聯絡數的選擇機制相結合,以提高Pareto前沿的收斂性和多樣性。

強化學習代理透過使用超體積、可行性和多樣性等指標線上調整進化引數,而灰色關聯錦標賽運算元則透過考慮支配等級、擁擠距離和與理想參考點的接近程度,為父代個體生成統一評分進行排序。這種設計使得演算法能夠在進化過程中自適應地調整搜尋策略,從而更有效地探索解空間。

研究者在Kursawe和CONSTR兩個經典基準函式上評估了該框架。實驗結果表明,RL-NSGA-II-GRC相比傳統NSGA-II分別實現了約5.8%和4.4%的收斂改進,同時保持了良好的非支配解分佈,這意味著演算法在找到接近真實Pareto前沿解的同時,還能維持解的多樣性。

在納斯達克投資組合例項中,該演算法應用於實際股票資料,生成了一條平滑且密集的有效前沿。透過這條前沿,投資者可以識別出最大夏普比率投資組合(年化夏普比率為1.92),以及針對不同風險厭惡水平的效用最優投資組合。這為實際投資決策提供了有價值的工具。

本文的主要貢獻有三點:第一,提出了RL-NSGA-II-GRC方法,將強化學習代理整合到進化框架中,透過代際反饋自適應控制引數;第二,設計了灰色關聯增強的二元錦標賽運算元,提供了全面的指標來引導搜尋朝向Pareto前沿;第三,透過基準多目標最佳化和納斯達克案例研究,證明了該方法在收斂性和前沿密集度方面的提升,為實際決策提供了可操作的見解。這項研究不僅推動了進化多目標最佳化演算法的發展,也為金融領域的量化決策提供了新的思路。