标签
GD^2PO引入了一种冲突感知过滤机制,以缓解大型语言模型强化学习中的多奖励冲突,防止信号抵消并加速训练效率。
DVAO 根据奖励方差自适应地加权目标,以提升多奖励强化学习的训练稳定性和多目标性能。
UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。