AV-GRPO:基于模态锚定的解耦扩散强化学习,用于联合音视频生成
摘要
本文提出AV-GRPO,一个用于联合音视频生成的模态锚定强化学习框架,相比现有方法,提高了生成质量、语义对齐和跨模态同步性。
查看缓存全文
缓存时间: 2026/09/25 15:46
论文页面 - AV-GRPO:基于模态锚定的解耦扩散强化学习用于音视频联合生成
来源:https://huggingface.co/papers/2609.29816
摘要
近年来,音视频联合生成领域取得了重大进展。现有模型仍面临以下局限:单模态保真度不足、文本模态对齐不够以及跨模态同步性较弱。尽管强化学习后训练提供了有前景的解决方案,但直接将其应用于音视频联合生成存在挑战。异构多模态奖励会混淆学习信号并使信用分配复杂化。由于双塔结构的动力学差异,其联合优化计算成本高昂。此外,同步性评估依赖配对样本的难度阻碍了公平的奖励比较。我们提出了AV-GRPO——一种基于模态锚定的在线扩散强化学习框架,以及5DAV——一个解耦的、难度可控的训练数据集。AV-GRPO包含三个关键模块:(1) 模态锚定rollout,用于解耦学习信号并稳定难度;(2) 轨迹锁定的冻结塔优化,以减少成本并重新分配信用;(3) 针对模态特定动力学的自适应目标与扰动强度。这将耦合的多模态偏好学习转化为单模态子问题,以实现更精确的奖励归因和更好的同步性。我们的5DAV数据集在五个维度上解耦样本,用于系统化训练。在JavisBench和VABench上的实验表明,在LoRA和全参数微调下,AV-GRPO在生成质量、语义对齐和跨模态同步性方面均优于LTX-2.3。消融实验验证了我们设计的有效性。代码与数据:https://github.com/zhiyuxu03/AV-GRPO
查看arXiv页面 (https://arxiv.org/abs/2609.29816)查看PDF (https://arxiv.org/pdf/2609.29816)GitHub 12 (https://github.com/zhiyuxu03/AV-GRPO)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.29816)
在您的代理中获取本文:
hf papers read 2609\.29816
尚未拥有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
Dr-Loser/AV-GRPO 文本转视频• 约2小时前更新 (https://huggingface.co/Dr-Loser/AV-GRPO)
引用本文的数据集0
无数据集链接本文
在数据集的README.md中引用arxiv.org/abs/2609.29816以从此页面链接。
引用本文的空间0
无空间链接本文
在空间的README.md中引用arxiv.org/abs/2609.29816以从此页面链接。
包含本文的收藏0
无收藏包含本文
将本文添加至收藏 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
强化多模态掩码扩散模型的生成顺序
本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。
AlphaGRPO:通过分解可验证奖励释放统一多模态模型中的自反式生成能力
AlphaGRPO 是一个新框架,将组相对策略优化(Group Relative Policy Optimization)应用于统一多模态模型(UMMs),通过自反式精炼和分解可验证奖励来增强生成效果。
VideoGen-Agent:增强视频生成智能体
本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。
OmniVAE:具有跨模态对齐的音频-视频VAE,用于联合生成
OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。
DACA-GRPO:扩散语言模型中强化学习的去噪感知信用分配
本文指出了现有扩散语言模型强化学习方法中的弱点——缺乏时间信用分配和偏差似然估计——并提出了DACA-GRPO,一种即插即用的增强方案,引入了去噪进度分数和分层掩码似然,在推理、代码生成和受约束生成等多个基准上取得了一致的改进。