advantage-shaping

标签

Cards List
#advantage-shaping

超越熵:通过对比策略优化的正确性感知优势塑造

Hugging Face Daily Papers · 2026-07-16 缓存

本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。

0 人收藏 0 人点赞
#advantage-shaping

过程优势信号塑形:用于LLM推理器中过程监督强化学习的范式无关中间件

arXiv cs.AI · 2026-06-30 缓存

PASS是一种中间件,它修复了LLM推理器过程监督强化学习中的三种病理现象,通过独立标准化流、按值分块和使用平均价值密度来改进GRPO。它在数学推理和多跳问答中显示出持续的增益。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈