AV-GRPO:基于模态锚定的解耦扩散强化学习,用于联合音视频生成

Hugging Face Daily Papers 论文

摘要

本文提出AV-GRPO,一个用于联合音视频生成的模态锚定强化学习框架,相比现有方法,提高了生成质量、语义对齐和跨模态同步性。

近年来,联合音视频生成取得了重大进展。现有模型仍然存在单模态保真度有限、文本模态对齐不足以及跨模态同步性弱的问题。虽然强化学习后训练提供了一种有前景的补救措施,但直接将其应用于联合音视频生成具有挑战性。异构多模态奖励会纠缠学习信号并使信用分配复杂化。考虑到两个模态塔的动态差异,联合优化在计算上成本高昂。此外,同步评估的难度取决于配对样本,阻碍了公平的奖励比较。我们提出AV-GRPO,一个模态锚定的在线扩散强化学习框架,以及5DAV,一个解耦的、难度可控的训练数据集。AV-GRPO包括三个关键模块:(1) 模态锚定的rollout,以解耦学习信号并稳定难度;(2) 轨迹锁定的冻结塔优化,以减少成本并重新分配信用;(3) 适应特定模态动态的自适应目标和扰动强度。这将耦合的多模态偏好学习转换为单模态子问题,以实现精确的奖励归属和更好的同步。我们的5DAV数据集跨五个维度解耦样本,以进行系统性训练。在JavisBench和VABench上的实验表明,在LoRA和全量微调下,AV-GRPO在生成质量、语义对齐和跨模态同步性方面优于LTX-2.3。消融实验验证了我们的设计。代码和数据:https://github.com/zhiyuxu03/AV-GRPO
查看原文
查看缓存全文

缓存时间: 2026/09/25 15:46

论文页面 - AV-GRPO:基于模态锚定的解耦扩散强化学习用于音视频联合生成

来源:https://huggingface.co/papers/2609.29816

摘要

近年来,音视频联合生成领域取得了重大进展。现有模型仍面临以下局限:单模态保真度不足、文本模态对齐不够以及跨模态同步性较弱。尽管强化学习后训练提供了有前景的解决方案,但直接将其应用于音视频联合生成存在挑战。异构多模态奖励会混淆学习信号并使信用分配复杂化。由于双塔结构的动力学差异,其联合优化计算成本高昂。此外,同步性评估依赖配对样本的难度阻碍了公平的奖励比较。我们提出了AV-GRPO——一种基于模态锚定的在线扩散强化学习框架,以及5DAV——一个解耦的、难度可控的训练数据集。AV-GRPO包含三个关键模块:(1) 模态锚定rollout,用于解耦学习信号并稳定难度;(2) 轨迹锁定的冻结塔优化,以减少成本并重新分配信用;(3) 针对模态特定动力学的自适应目标与扰动强度。这将耦合的多模态偏好学习转化为单模态子问题,以实现更精确的奖励归因和更好的同步性。我们的5DAV数据集在五个维度上解耦样本,用于系统化训练。在JavisBench和VABench上的实验表明,在LoRA和全参数微调下,AV-GRPO在生成质量、语义对齐和跨模态同步性方面均优于LTX-2.3。消融实验验证了我们设计的有效性。代码与数据:https://github.com/zhiyuxu03/AV-GRPO

查看arXiv页面 (https://arxiv.org/abs/2609.29816)查看PDF (https://arxiv.org/pdf/2609.29816)GitHub 12 (https://github.com/zhiyuxu03/AV-GRPO)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.29816)

在您的代理中获取本文:

hf papers read 2609\.29816

尚未拥有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

Dr-Loser/AV-GRPO 文本转视频• 约2小时前更新 (https://huggingface.co/Dr-Loser/AV-GRPO)

引用本文的数据集0

无数据集链接本文

在数据集的README.md中引用arxiv.org/abs/2609.29816以从此页面链接。

引用本文的空间0

无空间链接本文

在空间的README.md中引用arxiv.org/abs/2609.29816以从此页面链接。

包含本文的收藏0

无收藏包含本文

将本文添加至收藏 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

强化多模态掩码扩散模型的生成顺序

arXiv cs.LG

本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。

VideoGen-Agent:增强视频生成智能体

Hugging Face Daily Papers

本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。

DACA-GRPO:扩散语言模型中强化学习的去噪感知信用分配

arXiv cs.LG

本文指出了现有扩散语言模型强化学习方法中的弱点——缺乏时间信用分配和偏差似然估计——并提出了DACA-GRPO,一种即插即用的增强方案,引入了去噪进度分数和分层掩码似然,在推理、代码生成和受约束生成等多个基准上取得了一致的改进。