标签
验证感知训练(VAT)通过在训练中模拟顺序验证并自适应损失权重以匹配接受模式,改进投机解码的草稿模型,从而提升接受长度和推理加速。
论文提出了TUP,一种基于排名分类的BoN式蒸馏方法,通过截断低排名的完成项并提升高排名的项,以改善对齐效率和性能。
This paper presents a narrow extension to Leader Reward training for neural combinatorial optimization, replacing the binary leader/non-leader distinction with a stabilized rank signal indexed by a sampling budget K. Tests on TSP-100 show modest improvements in Best-of-8 cost under independent sampling, though the authors make no universal superiority claims.
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
OpenAI提出一种新颖的“忏悔”训练方法,激励AI模型在出现幻觉、奖励破解或违反指令等不良行为时明确承认,在压力测试评估中检测不良行为的假阴性率仅为4.4%。