RAVEN: 实时自回归视频外推与一致性模型GRPO
摘要
RAVEN 提出了一种实时自回归视频外推框架,结合了 CM-GRPO(一种用于一致性模型采样的新型强化学习方法),提升了长时程生成质量。
查看缓存全文
缓存时间: 2026/05/15 04:24
论文页面 - RAVEN: 基于一致性模型GRPO的实时自回归视频外推
来源:https://huggingface.co/papers/2605.15190
摘要
RAVEN通过改进训练对齐的因果自回归外推实现了实时视频生成,而CM-GRPO则利用应用于一致性模型采样的强化学习来进一步提升性能。
因果自回归视频扩散模型 (https://huggingface.co/papers?q=Causal%20autoregressive%20video%20diffusion%20models) 支持实时流式生成 (https://huggingface.co/papers?q=real-time%20streaming%20generation),通过从已生成内容中外推未来片段。从高保真双向教师模型中蒸馏此类生成器可得到较优的少步模型,但训练时遇到的历史分布与推理时出现的历史分布之间存在持续差距,限制了长时生成的生成质量。我们引入了实时自回归视频外推 (https://huggingface.co/papers?q=Video%20Extrapolation) 网络 (RAVEN),这是一种训练时测试框架,将每次自推断重新打包成交错序列 (https://huggingface.co/papers?q=interleaved%20sequence),其中包含干净的历史端点和带噪的去噪状态 (https://huggingface.co/papers?q=denoising%20states)。这种表述使训练注意力与推理时外推对齐,并允许下游片段损失 (https://huggingface.co/papers?q=chunk%20losses) 监督未来预测所依赖的历史表示。我们进一步提出了一致性模型组相对策略优化 (https://huggingface.co/papers?q=Policy%20Optimization) (CM-GRPO),它将一致性采样步骤重新表述为条件高斯转移 (https://huggingface.co/papers?q=Gaussian%20transition),并直接在此核上应用在线强化学习 (https://huggingface.co/papers?q=Reinforcement%20Learning) (RL),避免了先前流模型RL公式中采用的欧拉-丸山辅助过程 (https://huggingface.co/papers?q=Euler-Maruyama%20auxiliary%20process)。实验表明,RAVEN在质量、语义和动态程度评估上超越了最新的因果视频蒸馏 (https://huggingface.co/papers?q=distillation) 基线,且与RAVEN结合时CM-GRPO提供了进一步的增益。
查看arXiv页面 (https://arxiv.org/abs/2605.15190)查看PDF (https://arxiv.org/pdf/2605.15190)项目页面 (https://yanzuo.lu/raven/)GitHub3 (https://github.com/mvp-ai-lab/RAVEN)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.15190)
在您的智能体中获取此论文:
hf papers read 2605\.15190
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型1
mvp-lab/RAVEN 文本到视频• 约3小时前更新 (https://huggingface.co/mvp-lab/RAVEN)
引用该论文的数据集0
没有数据集链接此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2605.15190 来从此页面链接该数据集。
引用该论文的Space0
没有Space链接此论文
请在Space的 README.md 中引用 arxiv.org/abs/2605.15190 来从此页面链接该Space。
包含该论文的收藏集1
相似文章
RAVEN:一种面向金融时间序列预测的体制感知变上下文专家网络
本文提出了RAVEN,这是一种混合专家框架,能够自适应地为每个输入样本确定时间上下文窗口,以处理非平稳金融时间序列。该方法在金融和交通基准上取得了最先进的性能。
KVPO:基于ODE的原生GRPO框架通过KV语义探索实现自回归视频对齐
KVPO提出了一种基于ODE的原生在线GRPO框架,通过因果语义KV缓存探索和速度场替代策略,将流式自回归视频生成器与人类偏好对齐,在视觉质量和对齐度上实现了持续改进。
Crayotter:通过组相对偏好反向传播学习长视界视频编辑智能体
Crayotter 引入了组相对偏好反向传播(GRPB),一种训练长视界视频编辑智能体的方法,利用任务内偏好排序而非全局标量奖励。由此产生的 9B 模型在 AgenticVBench 上超越了多个专有系统。
LongLive-RAG:一种通用的检索增强长视频生成框架
LongLive-RAG将长视频生成形式化为检索增强生成问题,利用先前生成潜变量的动态记忆来减少误差积累和身份漂移,在多种自回归骨干网络上提升了生成质量。
重新思考长视频中的RAG:检索什么以及如何使用?
本文介绍了V-RAGBench,一个用于评估长自我中心视频中检索增强生成的基准,以及CARVE,一种自适应地为每个片段选择检索配置以提升VideoRAG性能的方法。