multi-reward

标签

Cards List
#multi-reward

GD^2PO: 通过组动态奖励解耦策略优化缓解多奖励冲突

Hugging Face Daily Papers · 2026-06-15 缓存

GD^2PO引入了一种冲突感知过滤机制,以缓解大型语言模型强化学习中的多奖励冲突,防止信号抵消并加速训练效率。

0 人收藏 0 人点赞
#multi-reward

DVAO:多奖励强化学习中的动态方差自适应优势优化

Hugging Face Daily Papers · 2026-05-25 缓存

DVAO 根据奖励方差自适应地加权目标,以提升多奖励强化学习的训练稳定性和多目标性能。

0 人收藏 0 人点赞
#multi-reward

UniDoc-RL:基于层次化动作与密集奖励的粗到细视觉RAG

Hugging Face Daily Papers · 2026-04-16 缓存

UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈