@xennygrimmato_: 如果你想知道这篇论文中token级别的拒绝采样是如何工作的,这里是他们的做法:M_t = max_v [ pi_the…
摘要
解释RLHF/PPO中的token级别拒绝采样,其中重要性比率M_t是词汇表上的最大值,token根据w_t / M_t进行伯努利采样接受。
查看缓存全文
缓存时间: 2026/07/11 19:28
如果你想知道这篇论文中的 token 级拒绝采样是如何实现的,下面是具体做法:
M_t = max_v [ pi_theta(v) / pi_old(v) ] z_t ~ Bernoulli( w_t / M_t ) w̃_t = 1 if z_t=1 else w_t L(θ) = E[ Σt w̃_t(θ) · Ât ]
M_t 是词汇表上的最大重要性比率。 w_t 是第 i 个 token 的重要性比率。 Ât 来自 GRPO/PPO。
Rosinality (@rosinality): https://t.co/o4bRt58hDD
使用拒绝采样将接受的 token 视为在策略(on-policy)的 token。
相似文章
突破熵界:通过带拒绝采样的多 token 预测加速 RL 训练
Bebop 提出了熵感知的多 token 预测,结合拒绝采样和一种新的 TV 损失,以加速 LLM 的 RL 训练,实现最高 1.8 倍的加速。该方法通过优化训练目标,解决了 RL 训练中接受率下降的问题。
并非所有Token都同等重要:通过强化学习中的Token重要性实现高效LLM推理
本文提出了一个强化学习框架,通过建模Token重要性来选择性地对不重要的Token进行惩罚,同时保留关键推理步骤,采用重要性感知奖励和动态长度奖励来减少冗余,在不牺牲准确性的前提下提高效率。
S2T-RLHF:面向稳定偏好型RLHF的分层信用分配
S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。
超越LLM强化学习中的统一令牌级信任区域
本文介绍了CPPO,这是一种通过使用位置加权阈值和累积前缀预算来改进基于可验证奖励的LLM强化学习方法,旨在解决统一令牌级信任区域的局限性。
超越熵:从令牌级分布偏差中学习以提升LLM推理
提出独立组合令牌(ICT)框架,利用令牌logit分布之间的Jensen-Shannon散度识别关键分支点,防止RLVR在LLM推理中的熵坍缩和熵爆炸。在Qwen模型上实现了高达14.9%的pass@4改进。