reward-guidance

Tag

Cards List
#reward-guidance

FastGuide: Accelerating Reward Guidance for Diffusion Large Language Models

arXiv cs.CL ↗ · yesterday Cached

FastGuide 是一种自适应的并行与自回归混合解码方法,通过复用奖励模型反向传播计算、利用 KV 缓存和稀疏注意力重计算来加速扩散大语言模型的梯度奖励引导,在三个奖励基准上实现最高 4.4× 加速同时保持相近生成质量。

0 favorites 0 likes
#reward-guidance

AgenticGen: Reward-Guided Agentic Video Generation for Advertising

Hugging Face Daily Papers ↗ · 2026-08-31 Cached

AgenticGen proposes a reward-guided agentic framework for advertising video generation, decomposing the task into strategy selection and draft generation supervised by online business feedback and human quality rewards, with A/B tests showing improvements in CTR, CVR, and Advv on TikTok.

0 favorites 0 likes
#reward-guidance

GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning

arXiv cs.CL ↗ · 2026-08-27 Cached

GRIP introduces a reward-guided parameter interpolation framework to merge reasoning and instruction models, improving accuracy-efficiency trade-off for LLM reasoning without retraining.

0 favorites 0 likes
#reward-guidance

Are we really tilting? The mechanics of reward guidance in flow and diffusion models

arXiv cs.LG ↗ · 2026-06-03 Cached

This paper explains the root cause of reward hacking in reward-guided flow and diffusion models, attributing it to finite-particle plug-in estimation of the Doob h-function, and proposes a reward damping schedule to correct within-mode bias without additional computational cost.

0 favorites 0 likes
← Back to home

Submit Feedback