AAD-1:一步自回归视频生成的非对称对抗性蒸馏

Hugging Face Daily Papers 论文

摘要

AAD-1 引入具有分阶段训练的非对称对抗性蒸馏,以实现一步自回归视频生成,在 VBench 上优于先前方法。

我们提出了 AAD-1,一个用于一步自回归图像到视频生成的非对称对抗性蒸馏框架。现有最先进的方法采用对抗性蒸馏,但遭遇运动崩溃和训练不稳定性问题,导致生成静态视频。AAD-1 通过架构和训练策略上的两个关键设计来解决这些挑战。我们的核心架构见解是打破生成器和判别器之间的对称性。生成器保持因果性以保留自回归采样能力,而判别器则对完整时空上下文进行双向关注,并为整个视频序列生成一个单一的整体真实性评分。这种非对称设计使判别器能够有效检测导致自回归生成中运动崩溃的全局时间性失败和长程漂移。为稳定训练,我们引入了一种分阶段策略,首先使用分布匹配来引导一个稳定的一步生成器,提供一个预热阶段,使学生分布更接近教师分布,然后再开始对抗性蒸馏。在 VBench 上的大量实验表明,AAD-1 在一步自回归视频生成中达到了最先进的性能。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:41

论文页面 - AAD-1:面向单步自回归视频生成的非对称对抗蒸馏

来源:https://huggingface.co/papers/2606.03972

摘要

AAD-1 框架通过打破生成器与判别器之间的对称性,并采用分阶段训练来防止运动坍缩和训练不稳定,从而改进了单步自回归图像到视频的生成。

我们提出 AAD-1,一个面向单步自回归 (https://huggingface.co/papers?q=autoregressive) 图像到视频生成的非对称对抗蒸馏 (https://huggingface.co/papers?q=Adversarial%20Distillation) 框架。现有先进方法采用对抗蒸馏 (https://huggingface.co/papers?q=adversarial%20distillation),但存在运动坍缩 (https://huggingface.co/papers?q=motion%20collapse) 和训练不稳定 (https://huggingface.co/papers?q=training%20instability) 的问题,导致生成静态视频。AAD-1 通过在架构和训练策略上的两项关键设计来解决这些挑战。我们的核心架构洞察在于打破生成器与判别器之间的对称性:生成器保持因果性以保留自回归 (https://huggingface.co/papers?q=autoregressive) 采样能力,而判别器则对完整的时空上下文进行双向注意力,并为整个视频序列生成单一的整体真实性评分 (https://huggingface.co/papers?q=holistic%20realism%20score)。这种非对称设计 (https://huggingface.co/papers?q=asymmetric%20design) 使得判别器能够有效检测全局时间故障和长程漂移——这些正是导致自回归 (https://huggingface.co/papers?q=autoregressive) 生成中运动坍缩 (https://huggingface.co/papers?q=motion%20collapse) 的原因。为了稳定训练,我们引入了一种分阶段策略 (https://huggingface.co/papers?q=phased%20strategy):首先使用分布匹配 (https://huggingface.co/papers?q=distribution%20matching) 来引导一个稳定的单步生成器,作为预热阶段,在学生分布接近教师分布之后,再开始对抗蒸馏 (https://huggingface.co/papers?q=adversarial%20distillation)。在 VBench 上进行的大量实验表明,AAD-1 在单步自回归 (https://huggingface.co/papers?q=autoregressive) 视频生成中达到了最先进的性能。

查看 arXiv 页面 (https://arxiv.org/abs/2606.03972)查看 PDF (https://arxiv.org/pdf/2606.03972)项目页面 (https://aad-1.github.io/)GitHub27 (https://github.com/AutoLab-SAI-SJTU/AAD-1)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.03972)

在您的智能体中获取此论文:

hf papers read 2606.03972

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

Watay/AAD-1 图像到视频• 更新于1天前 (https://huggingface.co/Watay/AAD-1)

引用此论文的数据集0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.03972,即可从此页面链接。

引用此论文的 Space0

没有 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.03972,即可从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection),即可从此页面链接。

相似文章

长视频生成(阅读时间 4 分钟)

TLDR AI

本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。