DVAO:多奖励强化学习中的动态方差自适应优势优化

Hugging Face Daily Papers 论文

摘要

DVAO 根据奖励方差自适应地加权目标,以提升多奖励强化学习的训练稳定性和多目标性能。

强化学习已成为将大型语言模型与人类意图和任务需求对齐的标准范式。虽然组相对策略优化为近端策略优化提供了一种高效、无需价值模型的替代方案,但将其应用于现实世界的多奖励场景仍具挑战性。标准的标量化实践,例如奖励组合和优势组合,存在显著缺陷:奖励组合经常产生平方幅度过大的优势,导致训练不稳定;而优势组合依赖静态超参数,忽略跨目标相关性。为解决这些局限,我们提出动态方差自适应优势优化(DVAO),它根据 rollout 组内每个目标的经验奖励方差动态调整组合权重,有效增强学习信号较强的目标权重,同时抑制噪声较大的目标。我们从数学上证明 DVAO 能保持有界的优势幅度以实现稳定训练,并引入一种自适应的跨目标正则化机制。在使用 Qwen3 和 Qwen2.5 模型进行的数学推理和工具使用基准上的大量实验表明,DVAO 显著优于基线方法,实现了更优的多目标帕累托前沿和稳健的训练稳定性。
查看原文
查看缓存全文

缓存时间: 2026/05/26 02:41

论文页面 - DVAO:面向多奖励强化学习的动态方差自适应优势优化

来源:https://huggingface.co/papers/2605.25604

摘要

动态方差自适应优势优化(DVAO)通过基于经验奖励方差自适应加权目标,解决多奖励强化学习中的训练不稳定问题,保持优势幅度有界,提升多目标性能。

强化学习 (https://huggingface.co/papers?q=Reinforcement%20Learning) 已成为将大语言模型 (https://huggingface.co/papers?q=Large%20Language%20Models) 与人类意图及任务要求对齐的标准范式。尽管群体相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) 作为近端策略优化 (https://huggingface.co/papers?q=Proximal%20Policy%20Optimization) 的一种高效、无价值模型的替代方案,但将其适配到现实世界的多奖励场景仍具挑战性。标准的标量化做法,如奖励组合 (https://huggingface.co/papers?q=Reward%20Combination) 和优势组合 (https://huggingface.co/papers?q=Advantage%20Combination),存在显著缺陷:奖励组合 (https://huggingface.co/papers?q=Reward%20Combination) 频繁生成具有过大平方幅度的优势,导致训练不稳定;而优势组合 (https://huggingface.co/papers?q=Advantage%20Combination) 依赖静态超参数,忽略跨目标相关性。为解决这些局限,我们提出动态方差自适应优势优化 (https://huggingface.co/papers?q=Dynamic%20Variance-adaptive%20Advantage%20Optimization)(DVAO),该方法基于 rollout 组内每个目标的经验奖励方差 (https://huggingface.co/papers?q=empirical%20reward%20variance) 动态调整组合权重,有效提升学习信号较强目标的权重,同时抑制噪声较大的目标。我们数学证明 DVAO 保持优势幅度有界以实现稳定训练,并引入一种自适应的跨目标正则化机制。在 Qwen3 和 Qwen2.5 模型上的数学推理及工具使用基准测试中的大量实验表明,DVAO 显著优于基线方法,实现了更优的多目标帕累托前沿 (https://huggingface.co/papers?q=multi-objective%20Pareto%20frontier) 和稳健的训练稳定性 (https://huggingface.co/papers?q=training%20stability)。

查看 arXiv 页面 (https://arxiv.org/abs/2605.25604)查看 PDF (https://arxiv.org/pdf/2605.25604)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.25604)

在您的 agent 中获取此论文:

hf papers read 2605.25604

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2605.25604 即可从本页链接。

引用此论文的数据集0

无数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.25604 即可从本页链接。

引用此论文的 Spaces0

无 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2605.25604 即可从本页链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

分层优势加权:面向稀疏回合结果的VLA在线强化学习微调

Hugging Face Daily Papers

本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。

基于可靠性的双目标投资组合优化的深度强化学习

arXiv cs.LG

本文提出了一种深度强化学习框架(MORP-DRL),用于多目标基于可靠性的投资组合优化,在实践约束下使用CVaR和EVaR联合优化期望收益和下行风险,并在不同市场体制下的全球股票指数上展示了性能。