training-methods

标签

Cards List
#training-methods

投机解码的验证感知训练

Hugging Face Daily Papers · 2026-08-31 缓存

验证感知训练(VAT)通过在训练中模拟顺序验证并自适应损失权重以匹配接受模式,改进投机解码的草稿模型,从而提升接受长度和推理加速。

0 人收藏 0 人点赞
#training-methods

截断差项,提升优项:基于排名分类的BoN式蒸馏

arXiv cs.LG · 2026-08-21 缓存

论文提出了TUP,一种基于排名分类的BoN式蒸馏方法,通过截断低排名的完成项并提升高排名的项,以改善对齐效率和性能。

0 人收藏 0 人点赞
#training-methods

Stabilized Best-of-$K$ Training for Neural Combinatorial Optimization

arXiv cs.LG · 2026-08-04 缓存

This paper presents a narrow extension to Leader Reward training for neural combinatorial optimization, replacing the binary leader/non-leader distinction with a stabilized rank signal indexed by a sampling budget K. Tests on TSP-100 show modest improvements in Best-of-8 cost under independent sampling, though the authors make no universal superiority claims.

0 人收藏 0 人点赞
#training-methods

同策略蒸馏(5分钟阅读)

TLDR AI · 2026-05-26

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

0 人收藏 0 人点赞
#training-methods

忏悔如何让语言模型保持诚实

OpenAI Blog · 2025-12-03 缓存

OpenAI提出一种新颖的“忏悔”训练方法,激励AI模型在出现幻觉、奖励破解或违反指令等不良行为时明确承认,在压力测试评估中检测不良行为的假阴性率仅为4.4%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈