标签
本文介绍了 Neural Non-Equilibrium Hamiltonian Monte Carlo (NHMC),这是一种先训练后修正的方法,通过学习随机哈密顿风格路径并利用非平衡功进行校正,从而从未归一化的玻尔兹曼密度中采样。
解释RLHF/PPO中的token级别拒绝采样,其中重要性比率M_t是词汇表上的最大值,token根据w_t / M_t进行伯努利采样接受。
本文提出无界正非对称优化(UP),一种通用的即插即用目标函数,通过使用停止梯度锚定策略,解决了基于强化学习的大语言模型训练中的探索-稳定性困境,允许对正优势使用无裁剪梯度,同时对负优势进行裁剪。