Chimera:混合视觉扩散Transformer的设计与Chinchilla式缩放

Hugging Face Daily Papers 论文

摘要

本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。

视觉生成日益需要高分辨率图像、长视频和多模态上下文,这使得全注意力的二次方成本变得不可承受。我们引入了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络。Chimera在一个光栅顺序的流中处理文本、图像和视频token,无需位置嵌入。它结合了用于O(N)复杂度长上下文状态跟踪的Kimi Delta Attention(KDA)、用于直接全局交互的交错多头潜在注意力(MLA),以及用于局部时空上下文的模态感知短卷积。稀疏混合专家(MoE)层在控制激活计算的同时扩展容量。为了扩展这种异构架构,我们提出了HeteroP,一种模块级方案,根据每个张量的功能扇入和模型深度跨宽度和深度迁移超参数。HeteroP产生了一个一致调优的模型家族,用于拟合Chinchilla式计算最优定律,涉及激活模型大小、训练token数量和图像-视频数据比例。在这些定律的指导下,我们训练了一个具有20亿激活参数的110亿参数Chimera模型。实验显示了三个结果。首先,以预训练扩散损失衡量,密集骨干网络的计算效率是匹配的全注意力Wan-2.1 2B基线的1.7倍,而完整系统达到7.3倍。其次,在没有针对长度的微调情况下,Chimera从5秒训练片段零样本外推至30秒视频,最后五秒仅出现6.5%的FID退化。第三,拟合的定律表明,计算最优的图像预训练将计算几乎平均分配给激活模型大小和训练token数量,而视频预训练在更高预算下略微偏向模型大小。这些结果为设计和扩展高效的长上下文扩散架构奠定了基础。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - Chimera:设计并Chinchilla式扩展混合视觉扩散Transformer

来源:https://huggingface.co/papers/2607.28611

作者:

,

,

,

,

,

,

,

,

,

,

摘要

视觉生成越来越需要高分辨率图像、长视频和多模态上下文,这使得全注意力的二次成本变得不可接受。我们引入了 Chimera,一种具有原则性扩展方案的混合视觉扩散骨干网络。Chimera 在一个没有位置嵌入的栅格顺序流中处理文本、图像和视频 token。它结合了用于长上下文状态跟踪的 Kimi Delta Attention(KDA),复杂度为 O(N);交错的多头潜在注意力(MLA)用于直接的全局交互;以及模态感知的短卷积用于局部时空上下文。稀疏混合专家(MoE)层在控制激活计算的同时扩展了容量。为了扩展这种异构架构,我们引入了 HeteroP,一种模块级方案,根据每个张量的功能扇入和模型深度在宽度和深度之间迁移超参数。HeteroP 产生了一个一致调优的模型族,用于拟合 Chinchilla 风格的计算最优定律,涉及激活模型大小、训练 token 数和图像-视频数据比例。在这些定律的指导下,我们训练了一个 11B 参数、2B 激活参数的 Chimera。实验展示了三个结果。首先,以预训练扩散损失衡量,稠密骨干网络的计算效率是匹配的全注意力 Wan-2.1 2B 基线的 1.7 倍,而完整系统达到了 7.3 倍。其次,无需特定长度的微调,Chimera 可以从 5 秒训练片段零样本外推到 30 秒视频,最后五秒的 FID 仅下降 6.5%。第三,拟合的定律表明,计算最优的图像预训练在激活模型大小和训练 token 数之间几乎均匀地分配计算,而视频预训练在较高预算下适度偏向模型大小。这些结果为设计和扩展高效

相似文章

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。

DiffusionBench:扩散变换器的全面评估

Hugging Face Daily Papers

研究人员引入了NanoGen,一个用于训练和评估扩散变换器的统一框架,并提出了DiffusionBench,一个结合了ImageNet类别条件和文本到图像生成的全面基准,以更好地评估生成建模的进展。

MMDiff: 扩展扩散变换器以实现多模态生成

Hugging Face Daily Papers

MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。

@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…

X AI KOLs Timeline

MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。