AI News HubLIVE
站内改写1 分钟阅读

强化学习引导的NSGA-II结合灰色关联系数用于多目标优化:在纳斯达克投资组合优化中的应用

本文提出一种新型的强化学习引导的NSGA-II算法(RL-NSGA-II-GRC),通过引入灰色关联系数和强化学习代理,在解决多目标优化问题中显著改善收敛性和Pareto前沿的多样性。在Kursawe和CONSTR基准测试中,该算法相比传统NSGA-II实现了约5.8%和4.4%的收敛改进,并在纳斯达克投资组合优化中生成平滑且密集的有效前沿,识别出年化夏普比率为1.92的最大夏普比率投资组合。

来源arXiv Machine Learning作者: Zhiyuan Wang, Qinxu Ding, Ding Ding, Siying Zhu, Jing Ren, Yue Wang, Chong Hui Tan

在现代金融市场中,决策者越来越依赖定量方法在多个相互冲突的目标之间进行权衡。本文针对约束多目标优化问题,以投资组合优化为例,旨在最小化风险并最大化收益。为弥补现有方法的不足,研究者提出了一种新型的强化学习引导的非支配排序遗传算法II,结合灰色关联系数,称为RL-NSGA-II-GRC。该算法将强化学习代理控制器与基于灰色关联系数的选择机制相结合,以提高Pareto前沿的收敛性和多样性。

强化学习代理通过使用超体积、可行性和多样性等指标在线调整进化参数,而灰色关联锦标赛算子则通过考虑支配等级、拥挤距离和与理想参考点的接近程度,为父代个体生成统一评分进行排序。这种设计使得算法能够在进化过程中自适应地调整搜索策略,从而更有效地探索解空间。

研究者在Kursawe和CONSTR两个经典基准函数上评估了该框架。实验结果表明,RL-NSGA-II-GRC相比传统NSGA-II分别实现了约5.8%和4.4%的收敛改进,同时保持了良好的非支配解分布,这意味着算法在找到接近真实Pareto前沿解的同时,还能维持解的多样性。

在纳斯达克投资组合实例中,该算法应用于实际股票数据,生成了一条平滑且密集的有效前沿。通过这条前沿,投资者可以识别出最大夏普比率投资组合(年化夏普比率为1.92),以及针对不同风险厌恶水平的效用最优投资组合。这为实际投资决策提供了有价值的工具。

本文的主要贡献有三点:第一,提出了RL-NSGA-II-GRC方法,将强化学习代理集成到进化框架中,通过代际反馈自适应控制参数;第二,设计了灰色关联增强的二元锦标赛算子,提供了全面的指标来引导搜索朝向Pareto前沿;第三,通过基准多目标优化和纳斯达克案例研究,证明了该方法在收敛性和前沿密集度方面的提升,为实际决策提供了可操作的见解。这项研究不仅推动了进化多目标优化算法的发展,也为金融领域的量化决策提供了新的思路。