AAD-1:一步自回归视频生成的非对称对抗性蒸馏
摘要
AAD-1 引入具有分阶段训练的非对称对抗性蒸馏,以实现一步自回归视频生成,在 VBench 上优于先前方法。
查看缓存全文
缓存时间: 2026/06/04 03:41
论文页面 - AAD-1:面向单步自回归视频生成的非对称对抗蒸馏
来源:https://huggingface.co/papers/2606.03972
摘要
AAD-1 框架通过打破生成器与判别器之间的对称性,并采用分阶段训练来防止运动坍缩和训练不稳定,从而改进了单步自回归图像到视频的生成。
我们提出 AAD-1,一个面向单步自回归 (https://huggingface.co/papers?q=autoregressive) 图像到视频生成的非对称对抗蒸馏 (https://huggingface.co/papers?q=Adversarial%20Distillation) 框架。现有先进方法采用对抗蒸馏 (https://huggingface.co/papers?q=adversarial%20distillation),但存在运动坍缩 (https://huggingface.co/papers?q=motion%20collapse) 和训练不稳定 (https://huggingface.co/papers?q=training%20instability) 的问题,导致生成静态视频。AAD-1 通过在架构和训练策略上的两项关键设计来解决这些挑战。我们的核心架构洞察在于打破生成器与判别器之间的对称性:生成器保持因果性以保留自回归 (https://huggingface.co/papers?q=autoregressive) 采样能力,而判别器则对完整的时空上下文进行双向注意力,并为整个视频序列生成单一的整体真实性评分 (https://huggingface.co/papers?q=holistic%20realism%20score)。这种非对称设计 (https://huggingface.co/papers?q=asymmetric%20design) 使得判别器能够有效检测全局时间故障和长程漂移——这些正是导致自回归 (https://huggingface.co/papers?q=autoregressive) 生成中运动坍缩 (https://huggingface.co/papers?q=motion%20collapse) 的原因。为了稳定训练,我们引入了一种分阶段策略 (https://huggingface.co/papers?q=phased%20strategy):首先使用分布匹配 (https://huggingface.co/papers?q=distribution%20matching) 来引导一个稳定的单步生成器,作为预热阶段,在学生分布接近教师分布之后,再开始对抗蒸馏 (https://huggingface.co/papers?q=adversarial%20distillation)。在 VBench 上进行的大量实验表明,AAD-1 在单步自回归 (https://huggingface.co/papers?q=autoregressive) 视频生成中达到了最先进的性能。
查看 arXiv 页面 (https://arxiv.org/abs/2606.03972)查看 PDF (https://arxiv.org/pdf/2606.03972)项目页面 (https://aad-1.github.io/)GitHub27 (https://github.com/AutoLab-SAI-SJTU/AAD-1)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.03972)
在您的智能体中获取此论文:
hf papers read 2606.03972
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
Watay/AAD-1 图像到视频• 更新于1天前 (https://huggingface.co/Watay/AAD-1)
引用此论文的数据集0
没有数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.03972,即可从此页面链接。
引用此论文的 Space0
没有 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.03972,即可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection),即可从此页面链接。
相似文章
面向自回归视频生成的在线策略对抗流蒸馏
提出对抗流蒸馏(AFD),用于将异质黑盒视频生成模型蒸馏为自回归学生模型,采用在线策略反馈和前向过程流匹配更新。
长视频生成(阅读时间 4 分钟)
本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。
One-Forcing: 迈向稳定的单步自回归视频生成
One-Forcing 通过用辅助 GAN 损失增强 DMD 目标,改进了单步视频生成,以更低的训练成本实现了最先进的性能。
OPSD-V: 面向后训练少步自回归视频生成器的在线策略自蒸馏
OPSD-V 通过使用真实长视频数据作为训练时的时间上下文,提供密集的轨迹级监督,从而增强视觉质量和运动动态,同时不改变推理机制,改进了少步自回归视频扩散模型。
A^2RD:用于长视频一致性的代理式自回归扩散
A^2RD 是一篇新论文,介绍了一种用于长视频合成的代理式自回归扩散架构,通过闭环自改进流程实现了更好的一致性和叙事连贯性。