reward-guidance

标签

Cards List
#reward-guidance

FastGuide:加速扩散大语言模型的奖励引导

arXiv cs.CL ↗ · 22小时前 缓存

FastGuide 是一种自适应的并行与自回归混合解码方法,通过复用奖励模型反向传播计算、利用 KV 缓存和稀疏注意力重计算来加速扩散大语言模型的梯度奖励引导,在三个奖励基准上实现最高 4.4× 加速同时保持相近生成质量。

0 人收藏 0 人点赞
#reward-guidance

AgenticGen: 基于奖励引导的代理式广告视频生成

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

AgenticGen 提出了一个基于奖励引导的代理框架,用于广告视频生成,将任务分解为策略选择和草稿生成,并由在线业务反馈和人类质量奖励进行监督,A/B 测试表明在 TikTok 上 CTR、CVR 和 Advv 有所提升。

0 人收藏 0 人点赞
#reward-guidance

GRIP:粒度奖励引导参数插值用于高效推理

arXiv cs.CL ↗ · 2026-08-27 缓存

GRIP提出了一种奖励引导的参数插值框架,通过融合推理与指令模型,在不重新训练的情况下改善大语言模型推理的准确率与效率权衡。

0 人收藏 0 人点赞
#reward-guidance

我们真的在倾斜吗?流模型与扩散模型中奖励引导的机制

arXiv cs.LG ↗ · 2026-06-03 缓存

本文解释了奖励引导的流模型和扩散模型中奖励作弊的根本原因,将其归因于Doob h函数的有限粒子插件估计,并提出了一种奖励阻尼调度方案,在不增加计算成本的情况下校正模态内偏差。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈