视频生成的并行解码(10分钟阅读)
摘要
NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。
并行解码蒸馏是一种基于轨迹的方法,在每次模型评估中预测多个去噪步骤。它在多个图像和视频生成器上以四到八次评估达到了最先进的结果,同时提升了视频的多样性。
查看缓存全文
缓存时间: 2026/07/30 18:26
# 并行解码蒸馏:用于图像与视频生成
来源:https://research.nvidia.com/labs/genair/pdd/
使用PDD-LTX-2.3和PDD-Wan2.1-14B模型生成的视频。点击LTX-2.3视频右上角可开启声音。全优化快速加载
8 NFE PDD应用于LTX-2.3,配合超分辨率与精修模型:视频呈现恢弘场景,一位身着华丽盔甲的国王立于中央,两侧簇拥着一群同样身穿精致深蓝色镶金盔甲的士兵,沉重的金属碰撞声在石砌的巨大殿堂中轻轻回荡。每位士兵手持利剑,剑刃在昏暗光线下闪烁寒光,暗示着即将到来的战斗或仪典,刀锋划过皮革剑鞘时发出微弱的节奏性摩擦声,划破了沉重的寂静。士兵队列纪律严明,有的笔直站立,有的略微前倾,在远处火炬摇曳的低沉嗡鸣声中,营造出一种蓄势待发的紧张氛围。国王凭借其居高临下的位置与周围士兵恭敬的姿态凸显出威严气势,他在巡视队伍时用深沉沙哑的嗓音开口,声音充满权威地回荡在厅堂中:"站稳了,因为今天我们将开创属于我们的传奇。"整体氛围蕴含着紧张与肃穆,石砌建筑发出的闷响与环境的厚重感为该事件的重要性奠定了基础。
4 NFE PDD应用于Wan2.1 14B:两只拟人化的猫,一只毛色乌黑光滑,另一只绒毛蓬松雪白,在聚光灯照耀的拳击台上进行激烈的对决。它们身着鲜艳舒适的运动短裤和亮红色拳击手套。黑猫面带坚定神情,白猫则显得专注备战。两只猫动作灵活,出拳闪避敏捷。背景中观众席人声鼎沸,五彩灯光与横幅营造出热烈气氛。中景镜头从侧面捕捉动态动作,突出两位拳击手的运动与互动。
4 NFE PDD应用于Wan2.1 14B:一只翅膀展开的雄伟巨鸟,优雅地飞向一座装饰有精致哥特式建筑的古老大教堂钟楼。钟楼上巨大的时钟指向早晨6点,为场景投下一层柔和的光芒。鸟儿羽毛在晨光中闪烁,它在空中翱翔。背景中,一座宁静的村庄被清晨薄雾笼罩。镜头从鸟儿飞行的中景开始,然后平滑过渡到特写,聚焦于逐渐靠近教堂高塔的鸟儿。相机捕捉到鸟儿翅膀的细致动作和时钟有规律的滴答声,营造出宁静而富有氛围感的场景。
4 NFE PDD应用于Wan2.1 14B:一个欢快的孩子,满脸笑容,双臂张开,在一个阳光明媚的后院里,奋力地荡着一副锈迹斑斑的老旧秋千。秋千架油漆剥落,链条吱嘎作响,与周围鲜绿的草地和盛开的鲜花形成鲜明对比。孩子的笑声回荡,他们越荡越高,每次弧底脚几乎不沾地。从低角度拍摄,强调秋千的高度,阳光为一切镀上温暖的光晕。中景聚焦于孩子和秋千。
4 NFE PDD应用于Wan2.1 14B:两名自行车骑手,一男一女,从相反方向驶向交叉路口的停车标志。男骑手戴红色头盔,穿黑色骑行服;女骑手戴蓝色头盔,穿白色骑行服。两人都朝停车标志骑行,渐渐靠近路口时放缓速度。男骑手向左张望,查看车流;女骑手则直视前方。背景是一条安静的郊区街道,绿树成荫,停着几辆车。视频以跟拍镜头捕捉他们的靠近,逐渐放大每位骑手,直到他们完全停下,保持平视视角。
8 NFE PDD应用于LTX-2.3,配合超分辨率与精修模型:一位微笑着的年轻女性自信地站在茂密的森林中,空气里充满了轻柔而有节奏的树叶沙沙声,远处传来鸣禽的美妙歌声,回荡在林间空地。她肤色白皙,眼睛碧绿,一头金色长卷发自由飘散,迎着光线,深吸一口清新空气,清晰可闻。她身穿休闲装:浅绿色衬衫和橄榄绿工装裤,双臂在身侧轻轻摆动,布料发出柔和的沙沙声。森林中高树参天,斑驳的阳光透过树冠洒下,她踩在苔藓覆盖的地面上,发出轻柔闷响。摄像机从中近景拍摄,聚焦于她欢乐的表情,她发出一声满足的轻叹,静谧的环境因树枝间轻风拂过的平和满浸声音而充满生机。
8 NFE PDD应用于LTX-2.3,配合超分辨率与精修模型:一个痛苦愤怒的人对着几英尺外的另一个人大喊,声音因原始激烈而嘶哑,他喊道:"我真不敢相信你做了这种事!"同时身体前倾,双臂伸直,拳头紧握,房间里充满了他粗重急促的呼吸声。第二个人沉默地站着,双臂防御性地交叉,眼睛低垂以避免对视,只有微弱的椅子的有节奏吱嘎声在昏暗的房间里回响。相机以中近景镜头捕捉强烈的情感,声学空间显得拥挤而令人窒息,第一个人怒目而视,声音降为粗哑颤抖的低语:"滚开。"接着是拳头击打木桌的尖锐回响。
4 NFE PDD应用于Wan2.1 14B:以文森特·梵高的风格,一名穿着头盔和宇航服的宇航员在落日的沙滩上骑着一头大奶牛。宇航员自信地坐在牛背上,牛稳步朝观众走来。牛神情安详,步态温驯。宇航员和牛的左侧站立着一棵高大的棕榈树,树叶旋转充满活力。他们身后的天空中充满鲜艳的漩涡笔触,橙色、黄色和蓝色交织,捕捉了梵高星空的精髓。中景,聚焦于宇航员和牛,背景可见棕榈树和沙滩。
4 NFE PDD应用于Wan2.1 14B:在一个充满活力的现场音乐会环境中,一名技艺精湛的吉他手站在舞台中央明亮聚光灯下。他充满激情和专注地弹奏电吉他,手指在指板上快速移动,用力拨动琴弦。镜头从广角拍摄,捕捉到挤满场馆的动态氛围,然后慢慢推近到吉他手的手和吉他,突出复杂的动作以及舞台灯光在乐器上反射的绚丽光芒。特写镜头聚焦吉他和演奏者的手。
## 摘要
图1:并行解码蒸馏(PDD) vs. 流匹配(FM):每次网络评估,PDD推进多步,而FM仅推进一步。在视频扩散或流模型中,生成过程由于缓慢迭代的采样过程而计算昂贵。当前最先进的加速方法严重依赖变分分数蒸馏(VSD)和对抗损失,将扩散模型蒸馏为少步生成器。虽然这些方法实现了高质量视频生成,但其训练损失难以优化且易出现模式崩塌,导致视频多样性和运动不足。
本文提出并行解码蒸馏(PDD),一种简化且可扩展的基于轨迹的蒸馏方法,用于扩散和流匹配模型的快速推理。我们的架构和训练流程与任何预训练模型兼容,并支持不同数量的函数评估(NFE)进行采样。PDD通过每次网络评估预测多个去噪步骤来加速生成。概念上,它学习了平均速度的表示,而无需通过JVPs或有限差分逼近来回归其导数。相反,它将固定区间上的平均速度预测分解为并行子区间预测。然后,每次训练迭代优化单个子区间,为学习全区间平均速度提供信号。
我们的方法在LTX-2.3文本到视频/音频、Wan2.1 14B文本到视频以及Qwen-Image文本到图像上,以4-8 NFE实现了最先进性能。此外,PDD在生成视频多样性方面显示出显著提升。
## 并行解码蒸馏(PDD):直觉
PDD示意图:采样轨迹被离散化为N个区间,分组为大小为L的块;并行解码器在一次评估中预测一个块内的所有平均速度。图2:采样轨迹被离散化为\(N\)个区间,分组为大小为\(L\)的块。并行解码器使用单次评估预测一个块内所有区间的平均速度。使用经典常微分方程(ODE)求解器对扩散和流匹配模型进行采样需要许多小的去噪步骤,导致数百次网络评估。基于轨迹的蒸馏方法用于训练少步生成器的常见策略是训练学生模型预测大步更新,本质上合并多个教师小步更新。在并行解码蒸馏(PDD)中,我们采用不同方法:不将教师更新合并为一个大更新,而是单次网络评估预测多个教师更新。具体来说,我们将时间\(t\in[0,1]\)离散化为固定序列的\(N\in\mathbb{N}\)个区间\([t_{n},t_{n+1}]\)(其中\(n=0,1,\ldots,N-1\)),并将它们分组为大小为\(L\leq N\)的块。训练期间,学生模型学会使用单次前向传递预测一个块内所有区间的教师ODE求解器步骤。然后,在生成时,每次学生评估推进\(L\)个区间,如图2所示。
教师:预训练流模型架构。
(a) 教师
学生训练:并行解码器架构。
(b) 学生训练
学生生成:融合的并行解码器架构。
(c) 学生生成
图3:并行解码器架构(b)与预训练流模型(a)的对比。值得注意的是,并行解码器使用相同的主干,但最终线性层被复制了\(N\)次。(c) 在生成时,我们可以不针对每个块内步骤分别应用线性层,而是将这些层融合为一个单一的线性层,直接预测整个块的步骤。图3(b)展示了我们的学生架构,与教师架构对比见图3(a)。我们从教师架构出发,将最终线性层简单地重复\(N\)次,其中\(N\)是网格大小。也就是说,对于离散化中的每个区间\([t_n,t_{n+1}]\),我们使用一个独立的最终线性层。预测\(N\)个网格级输出(而非仅\(L\)个块级输出)使得推理时能够使用可变NFE进行采样。我们通过训练时使用可变块大小来实现这一点,然后在生成时根据所需的NFE调整块大小。此外,由于线性变换的加权和本身就是线性变换,我们可以在生成时融合相关的线性层。因此,对于每个块,我们只需评估和存储一个融合的线性层;见图3(c)。最后,这种架构允许学生权重从教师权重无缝初始化。
训练期间的学生和教师轨迹。
(a) 训练中的学生与教师
并行解码损失示意图。
(b) 并行解码损失示意图
图4:蓝色向量表示学生轨迹,绿色向量表示区间\([t_n, t_{n+1}]\)上的ODE求解器步骤,红色向量表示由并行解码损失惩罚的残差。为了训练我们的并行解码器(学生),我们采用on-policy训练算法。目标是使每个学生输出与对应的教师ODE求解器步骤对齐。即,我们将第\(n\)个学生输出与区间\([t_n, t_{n+1}]\)上的教师ODE求解器步骤对齐。我们在图4中展示了一个块大小\(L=4\)的单步优化过程。首先,我们在时间步\(n\)采样一个噪声状态\(X_n\)。然后,从\(X_n\)开始,我们在下一块区间内滚动学生:
\[ X_n=\bar{X}_n,\ \bar{X}_{n+1},\ldots,\bar{X}_{n+L-1}. \]
接下来,我们从学生轨迹中采样单个状态\(\bar{X}_k\),其中\(k\in\{n,n+1,\ldots,n+L-1\}\)。最后,我们将第\(k\)个学生输出与在\(\bar{X}_k\)处评估的教师ODE求解器步骤进行匹配。图5显示了在一个玩具问题上的PDD训练模拟。对于每次迭代,我们绘制批次中误差最大的样本。值得注意的是,随着训练进行,学生轨迹逐渐与教师轨迹(标记为"最优轨迹")对齐。
图5:(左)PDD训练的多轮迭代动画,显示每轮迭代的一个批次样本。(中间)沿学生轨迹放大显示采样状态,比较该状态下的学生输出与教师输出。(右)训练迭代中的PDD损失。
## Wan2.1 14B T2V上PDD与教师模型及DMD2的对比
教师模型(Wan2.1 14B T2V)、PDD与DMD2的对比。教师模型由于CFG,每步需2次网络评估。每行对应一种方法;三个视频是同一提示词对应的三个不同噪声样本。使用侧边箭头或滑动浏览全部23个提示词。
模型|噪声1|噪声2|噪声3
---|---|---|---
教师 (2x50 NFE)||||
PDD (4 NFE)||||
DMD2 (4 NFE)||||
提示词:一个人在风景秀丽的公园小径上慢跑,周围绿树成荫,鲜花盛开。他们穿着颜色鲜艳、带有反光元素的运动服以确保安全,脸上专注而坚定,汗水与努力交织。慢跑者步伐稳定,手臂自然摆动。背景是清澈的蓝天和透过树叶洒下的斑驳阳光。场景从中距离捕捉慢跑者,提供环境和个人的平衡视角。
模型|噪声1|噪声2|噪声3
---|---|---|---
教师 (2x50 NFE)||||
PDD (4 NFE)||||
DMD2 (4 NFE)||||
提示词:宁静的非洲稀树草原景象,高草与稀疏树木遍布。一只高大的长颈鹿,米白色皮毛上有独特的棕色斑点,优雅地弯曲长颈,在宁静的河边饮水。长颈鹿的目光专注地盯着水面,低头时露出长长的睫毛和温柔的表情。河水倒映着午后夕阳的金色光芒,为场景投下温暖的光晕。背景是广阔的稀树草原和远处的山丘。视频为中近景,捕捉长颈鹿优雅的动作和宁静的环境。
模型|噪声1|噪声2|噪声3
---|---|---|---
教师 (2x50 NFE)||||
PDD (4 NFE)||||
DMD2 (4 NFE)||||
提示词:一匹野马在开阔的草原上疾驰,尘土飞扬,朝着一群马匹跑去。马群分散在远处。
相似文章
并行解码蒸馏加速图像与视频生成
并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。
Nvidia 的新型长视频生成技术(12分钟阅读)
NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。
nVIDIA/PiD
NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。
PiD:基于像素扩散的快速高分辨率潜在解码
PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。
@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。