Chimera:混合视觉扩散Transformer的设计与Chinchilla式缩放
摘要
本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - Chimera:设计并Chinchilla式扩展混合视觉扩散Transformer
来源:https://huggingface.co/papers/2607.28611
作者:
,
,
,
,
,
,
,
,
,
,
摘要
视觉生成越来越需要高分辨率图像、长视频和多模态上下文,这使得全注意力的二次成本变得不可接受。我们引入了 Chimera,一种具有原则性扩展方案的混合视觉扩散骨干网络。Chimera 在一个没有位置嵌入的栅格顺序流中处理文本、图像和视频 token。它结合了用于长上下文状态跟踪的 Kimi Delta Attention(KDA),复杂度为 O(N);交错的多头潜在注意力(MLA)用于直接的全局交互;以及模态感知的短卷积用于局部时空上下文。稀疏混合专家(MoE)层在控制激活计算的同时扩展了容量。为了扩展这种异构架构,我们引入了 HeteroP,一种模块级方案,根据每个张量的功能扇入和模型深度在宽度和深度之间迁移超参数。HeteroP 产生了一个一致调优的模型族,用于拟合 Chinchilla 风格的计算最优定律,涉及激活模型大小、训练 token 数和图像-视频数据比例。在这些定律的指导下,我们训练了一个 11B 参数、2B 激活参数的 Chimera。实验展示了三个结果。首先,以预训练扩散损失衡量,稠密骨干网络的计算效率是匹配的全注意力 Wan-2.1 2B 基线的 1.7 倍,而完整系统达到了 7.3 倍。其次,无需特定长度的微调,Chimera 可以从 5 秒训练片段零样本外推到 30 秒视频,最后五秒的 FID 仅下降 6.5%。第三,拟合的定律表明,计算最优的图像预训练在激活模型大小和训练 token 数之间几乎均匀地分配计算,而视频预训练在较高预算下适度偏向模型大小。这些结果为设计和扩展高效
相似文章
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。
DiffusionBench:扩散变换器的全面评估
研究人员引入了NanoGen,一个用于训练和评估扩散变换器的统一框架,并提出了DiffusionBench,一个结合了ImageNet类别条件和文本到图像生成的全面基准,以更好地评估生成建模的进展。
MMDiff: 扩展扩散变换器以实现多模态生成
MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。
Nemotron-Labs-Diffusion-Image:推进掩蔽离散扩散实现高分辨率图像合成
本文提出 Nemotron-Labs-Diffusion-Image,一种用于高分辨率文生图的掩蔽离散扩散模型,引入令牌编辑机制和分组交叉熵目标,以改进令牌精炼和训练效率。
@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…
MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。