token-level-rejection-sampling

标签

Cards List
#token-level-rejection-sampling

@xennygrimmato_: 如果你想知道这篇论文中token级别的拒绝采样是如何工作的,这里是他们的做法:M_t = max_v [ pi_the…

X AI KOLs Timeline · 2026-07-11 缓存

解释RLHF/PPO中的token级别拒绝采样,其中重要性比率M_t是词汇表上的最大值,token根据w_t / M_t进行伯努利采样接受。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈