标签
FastGuide 是一种自适应的并行与自回归混合解码方法,通过复用奖励模型反向传播计算、利用 KV 缓存和稀疏注意力重计算来加速扩散大语言模型的梯度奖励引导,在三个奖励基准上实现最高 4.4× 加速同时保持相近生成质量。
AgenticGen 提出了一个基于奖励引导的代理框架,用于广告视频生成,将任务分解为策略选择和草稿生成,并由在线业务反馈和人类质量奖励进行监督,A/B 测试表明在 TikTok 上 CTR、CVR 和 Advv 有所提升。
GRIP提出了一种奖励引导的参数插值框架,通过融合推理与指令模型,在不重新训练的情况下改善大语言模型推理的准确率与效率权衡。
本文解释了奖励引导的流模型和扩散模型中奖励作弊的根本原因,将其归因于Doob h函数的有限粒子插件估计,并提出了一种奖励阻尼调度方案,在不增加计算成本的情况下校正模态内偏差。