DVAO:多奖励强化学习中的动态方差自适应优势优化
摘要
DVAO 根据奖励方差自适应地加权目标,以提升多奖励强化学习的训练稳定性和多目标性能。
查看缓存全文
缓存时间: 2026/05/26 02:41
论文页面 - DVAO:面向多奖励强化学习的动态方差自适应优势优化
来源:https://huggingface.co/papers/2605.25604
摘要
动态方差自适应优势优化(DVAO)通过基于经验奖励方差自适应加权目标,解决多奖励强化学习中的训练不稳定问题,保持优势幅度有界,提升多目标性能。
强化学习 (https://huggingface.co/papers?q=Reinforcement%20Learning) 已成为将大语言模型 (https://huggingface.co/papers?q=Large%20Language%20Models) 与人类意图及任务要求对齐的标准范式。尽管群体相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) 作为近端策略优化 (https://huggingface.co/papers?q=Proximal%20Policy%20Optimization) 的一种高效、无价值模型的替代方案,但将其适配到现实世界的多奖励场景仍具挑战性。标准的标量化做法,如奖励组合 (https://huggingface.co/papers?q=Reward%20Combination) 和优势组合 (https://huggingface.co/papers?q=Advantage%20Combination),存在显著缺陷:奖励组合 (https://huggingface.co/papers?q=Reward%20Combination) 频繁生成具有过大平方幅度的优势,导致训练不稳定;而优势组合 (https://huggingface.co/papers?q=Advantage%20Combination) 依赖静态超参数,忽略跨目标相关性。为解决这些局限,我们提出动态方差自适应优势优化 (https://huggingface.co/papers?q=Dynamic%20Variance-adaptive%20Advantage%20Optimization)(DVAO),该方法基于 rollout 组内每个目标的经验奖励方差 (https://huggingface.co/papers?q=empirical%20reward%20variance) 动态调整组合权重,有效提升学习信号较强目标的权重,同时抑制噪声较大的目标。我们数学证明 DVAO 保持优势幅度有界以实现稳定训练,并引入一种自适应的跨目标正则化机制。在 Qwen3 和 Qwen2.5 模型上的数学推理及工具使用基准测试中的大量实验表明,DVAO 显著优于基线方法,实现了更优的多目标帕累托前沿 (https://huggingface.co/papers?q=multi-objective%20Pareto%20frontier) 和稳健的训练稳定性 (https://huggingface.co/papers?q=training%20stability)。
查看 arXiv 页面 (https://arxiv.org/abs/2605.25604)查看 PDF (https://arxiv.org/pdf/2605.25604)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.25604)
在您的 agent 中获取此论文:
hf papers read 2605.25604
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2605.25604 即可从本页链接。
引用此论文的数据集0
无数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.25604 即可从本页链接。
引用此论文的 Spaces0
无 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2605.25604 即可从本页链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
分层优势加权:面向稀疏回合结果的VLA在线强化学习微调
本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。
基于可靠性的双目标投资组合优化的深度强化学习
本文提出了一种深度强化学习框架(MORP-DRL),用于多目标基于可靠性的投资组合优化,在实践约束下使用CVaR和EVaR联合优化期望收益和下行风险,并在不同市场体制下的全球股票指数上展示了性能。
CVPO:通过值方差适应与动态课程学习增强LLM强化学习推理
这篇arXiv论文介绍了CVPO,一种针对LLM的强化学习方法,它适应值方差以进行优势估计,并使用动态课程学习来匹配问题难度,在数学任务上取得了比VAPO更好的推理性能。
D-VLA: 面向视觉-语言-动作模型的高并发分布式异步强化学习框架
D-VLA 提出了一种高并发分布式异步强化学习框架,用于视觉-语言-动作模型,采用平面解耦和泳道管线提升大规模具身智能训练中的吞吐量和效率。
基于难度适应的树结构策略优化以扩展RLVR中的推理覆盖
论文提出了DATPO,一种基于难度适应的树结构策略优化方法,通过句子熵引导的分支和多样性感知优化来增强大模型中的推理覆盖,在pass@k指标上优于基线方法。