@xennygrimmato_: 如果你想知道这篇论文中token级别的拒绝采样是如何工作的,这里是他们的做法:M_t = max_v [ pi_the…

X AI KOLs Timeline 论文

摘要

解释RLHF/PPO中的token级别拒绝采样,其中重要性比率M_t是词汇表上的最大值,token根据w_t / M_t进行伯努利采样接受。

如果你想知道这篇论文中token级别的拒绝采样是如何工作的,这里是他们的做法: M_t = max_v [ pi_theta(v) / pi_old(v) ] z_t ~ Bernoulli( w_t / M_t ) w̃_t = 1 if z_t=1 else w_t L(θ) = E[ Σₜ w̃_t(θ) · Âₜ ] M_t 是词汇表上的最大重要性比率。 w_t 是第i个token的重要性比率。 Âₜ 来自GRPO/PPO。
查看原文
查看缓存全文

缓存时间: 2026/07/11 19:28

如果你想知道这篇论文中的 token 级拒绝采样是如何实现的,下面是具体做法:

M_t = max_v [ pi_theta(v) / pi_old(v) ] z_t ~ Bernoulli( w_t / M_t ) w̃_t = 1 if z_t=1 else w_t L(θ) = E[ Σt w̃_t(θ) · Ât ]

M_t 是词汇表上的最大重要性比率。 w_t 是第 i 个 token 的重要性比率。 Ât 来自 GRPO/PPO。

Rosinality (@rosinality): https://t.co/o4bRt58hDD

使用拒绝采样将接受的 token 视为在策略(on-policy)的 token。

相似文章

S2T-RLHF:面向稳定偏好型RLHF的分层信用分配

arXiv cs.AI

S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。

超越LLM强化学习中的统一令牌级信任区域

Hugging Face Daily Papers

本文介绍了CPPO,这是一种通过使用位置加权阈值和累积前缀预算来改进基于可验证奖励的LLM强化学习方法,旨在解决统一令牌级信任区域的局限性。