基于强化学习引导的灰关联系数增强NSGA-II多目标优化:应用于NASDAQ投资组合优化
摘要
介绍RL-NSGA-II-GRC方法,该方法将强化学习与经灰关联系数增强的NSGA-II遗传算法相结合,用于多目标优化,应用于NASDAQ投资组合优化。实现了改进的收敛性和多样化的帕累托前沿。
查看缓存全文
缓存时间: 2026/07/21 06:45
# 基于强化学习引导、灰色关联系数增强的NSGA-II多目标优化:纳斯达克投资组合优化应用 来源:https://arxiv.org/abs/2607.16194 查看PDF(https://arxiv.org/pdf/2607.16194) > 摘要:在现代金融市场中,决策者日益依赖量化方法来应对多个、往往相互冲突的目标之间的复杂权衡。本文研究带约束的多目标优化问题,并将其应用于投资组合优化,以实现风险最小化和收益最大化。为弥补现有空白,我们提出了一种新颖的强化学习引导的非支配排序遗传算法II,并引入灰色关联系数进行增强,简称RL-NSGA-II-GRC。该方法结合了RL智能体控制器与基于GRC的选择机制,以改善帕累托前沿的收敛性与多样性。该智能体利用超体积、可行性和多样性指标在线调整进化参数,而GRC竞赛选择算子则通过一个统一得分(考虑支配等级、拥挤距离以及与理想参考点的接近程度)对父代个体进行排序。我们在Kursawe和CONSTR基准测试以及一个纳斯达克投资组合应用中评估了该框架。在基准测试中,RL-NSGA-II-GRC比NSGA-II收敛性提高约5.8%和4.4%,同时保持了分布良好的非支配解。在投资组合应用中,该方法生成了平滑且密集的有效前沿,有助于识别最大夏普比率投资组合(年化夏普比率=1.92)以及针对不同风险厌恶水平的效用最优投资组合。主要贡献有三:1)我们提出了RL-NSGA-II-GRC方法,将强化学习智能体集成到进化框架中,通过代际反馈自适应控制参数;2)我们设计了一种GRC增强的二元竞赛算子,提供了一个综合指标来引导搜索朝向帕累托前沿;3)通过在基准多目标优化问题和纳斯达克案例研究中的验证,表明该方法具有更好的收敛性和更密集的前沿,从而支持可操作的见解。 ## 提交历史 来自:王志远 \[查看邮箱(https://arxiv.org/show-email/9ae1cb8d/2607.16194)\] **\[v1\]** 2026年4月12日星期日 11:58:43 UTC(1,090 KB)
相似文章
FBOS-RL:反馈驱动的双目标协同强化学习
本文提出FBOS-RL,一个反馈驱动的双目标协同强化学习框架,通过使用反馈引导的探索和两个相互增强的训练目标——面向利用的策略对齐(EPA)和面向探索的能力培养(ECC)——来提升训练效率和性能上限,优于GRPO在大语言模型对齐和推理中的表现。
基于可靠性的双目标投资组合优化的深度强化学习
本文提出了一种深度强化学习框架(MORP-DRL),用于多目标基于可靠性的投资组合优化,在实践约束下使用CVaR和EVaR联合优化期望收益和下行风险,并在不同市场体制下的全球股票指数上展示了性能。
Agent-G^2:基于高斯指导的代理强化学习
Agent-G^2 引入了一个高斯指导框架,用于强化学习中的提示深度,提升了长期代理任务的性能,无需额外的探测回合,并在 ALFWorld 和 WebShop 基准测试中取得优异结果。
An Emerging Retail Portfolio Management Application: Personalized, Tax-Aware Reinforcement Learning with Natural Language Goals
Presents an emerging retail portfolio management application that uses personalized, tax-aware reinforcement learning with natural language goal input, featuring a three-phase pipeline and integration with live brokerage APIs.
GRAIL:面向可验证奖励强化学习的梯度重加权优势方法
GRAIL 引入了梯度重加权优势,以改进 LLM 推理强化学习中的 token 级信用分配,在多个模型上优于 GRPO。