基于强化学习引导的灰关联系数增强NSGA-II多目标优化:应用于NASDAQ投资组合优化

arXiv cs.LG 论文

摘要

介绍RL-NSGA-II-GRC方法,该方法将强化学习与经灰关联系数增强的NSGA-II遗传算法相结合,用于多目标优化,应用于NASDAQ投资组合优化。实现了改进的收敛性和多样化的帕累托前沿。

arXiv:2607.16194v1 公告类型:新 摘要:在现代金融市场中,决策者越来越依赖定量方法来应对多个通常相互冲突的目标之间的复杂权衡。本文针对带约束的多目标优化问题(MOO),并将其应用于投资组合优化以最小化风险和最大化收益。为填补现有空白,我们提出了一种新颖的基于强化学习(RL)引导的、经灰关联系数(GRC)增强的非支配排序遗传算法II(NSGA-II),称为RL-NSGA-II-GRC,该方法结合了RL智能体控制器和基于GRC的选择机制,以提高帕累托前沿的收敛性和多样性。该智能体在线利用超体积、可行性和多样性指标自适应调整进化参数,而GRC锦标赛算子则通过综合考虑支配等级、拥挤距离和与理想参考点的接近程度的统一评分对父代进行排序。我们在Kursawe和CONSTR基准测试以及NASDAQ投资组合应用上评估了该框架。在基准测试中,RL-NSGA-II-GRC相比NSGA-II实现了约5.8%和4.4%的收敛性改进,同时保持了分布良好的非支配解。在投资组合应用中,它生成了一条平滑且密集的有效前沿,支持识别最大夏普比率投资组合(年化夏普比率=1.92)以及针对不同风险厌恶水平的效用最优投资组合。主要贡献有三方面:1)我们提出了RL-NSGA-II-GRC方法,将RL智能体集成到进化框架中,通过代际反馈自适应控制参数;2)我们设计了一个GRC增强的二元锦标赛算子,提供了全面的指标以引导搜索向帕累托前沿靠拢;3)我们在基准MOO问题和NASDAQ案例研究中证明,该方法提供了改进的收敛性和密集的前沿,从而支持可操作的见解。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:45

# 基于强化学习引导、灰色关联系数增强的NSGA-II多目标优化:纳斯达克投资组合优化应用
来源:https://arxiv.org/abs/2607.16194
查看PDF(https://arxiv.org/pdf/2607.16194)

> 摘要:在现代金融市场中,决策者日益依赖量化方法来应对多个、往往相互冲突的目标之间的复杂权衡。本文研究带约束的多目标优化问题,并将其应用于投资组合优化,以实现风险最小化和收益最大化。为弥补现有空白,我们提出了一种新颖的强化学习引导的非支配排序遗传算法II,并引入灰色关联系数进行增强,简称RL-NSGA-II-GRC。该方法结合了RL智能体控制器与基于GRC的选择机制,以改善帕累托前沿的收敛性与多样性。该智能体利用超体积、可行性和多样性指标在线调整进化参数,而GRC竞赛选择算子则通过一个统一得分(考虑支配等级、拥挤距离以及与理想参考点的接近程度)对父代个体进行排序。我们在Kursawe和CONSTR基准测试以及一个纳斯达克投资组合应用中评估了该框架。在基准测试中,RL-NSGA-II-GRC比NSGA-II收敛性提高约5.8%和4.4%,同时保持了分布良好的非支配解。在投资组合应用中,该方法生成了平滑且密集的有效前沿,有助于识别最大夏普比率投资组合(年化夏普比率=1.92)以及针对不同风险厌恶水平的效用最优投资组合。主要贡献有三:1)我们提出了RL-NSGA-II-GRC方法,将强化学习智能体集成到进化框架中,通过代际反馈自适应控制参数;2)我们设计了一种GRC增强的二元竞赛算子,提供了一个综合指标来引导搜索朝向帕累托前沿;3)通过在基准多目标优化问题和纳斯达克案例研究中的验证,表明该方法具有更好的收敛性和更密集的前沿,从而支持可操作的见解。

## 提交历史

来自:王志远 \[查看邮箱(https://arxiv.org/show-email/9ae1cb8d/2607.16194)\] **\[v1\]** 2026年4月12日星期日 11:58:43 UTC(1,090 KB)

相似文章

FBOS-RL:反馈驱动的双目标协同强化学习

arXiv cs.LG

本文提出FBOS-RL,一个反馈驱动的双目标协同强化学习框架,通过使用反馈引导的探索和两个相互增强的训练目标——面向利用的策略对齐(EPA)和面向探索的能力培养(ECC)——来提升训练效率和性能上限,优于GRPO在大语言模型对齐和推理中的表现。

基于可靠性的双目标投资组合优化的深度强化学习

arXiv cs.LG

本文提出了一种深度强化学习框架(MORP-DRL),用于多目标基于可靠性的投资组合优化,在实践约束下使用CVaR和EVaR联合优化期望收益和下行风险,并在不同市场体制下的全球股票指数上展示了性能。

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。