标签
SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。
本文介绍了一种用于大语言模型(LLMs)的低秩注意力残差(LR-AttnRes),该方法通过使用低维键进行深度注意力,将路由与表示解耦,在减少FLOPs的同时提升了性能。
Kimi 团队的论文 'Attention Residuals'(AttnRes)将 Transformer 中的均匀残差连接替换为基于深度的 softmax 注意力,使每一层能够动态选择先前的表示。该模型在 1.4 万亿个 token 上预训练,拥有 48B 参数,稳定了隐藏状态,并显著提升了推理任务的表现。
Delta Attention Residuals 通过关注特征变化(增量)而非累积隐藏状态,改进了Transformer模型中的逐层路由,在220M到7.6B参数的规模上实现了1.7-8.2%的验证困惑度提升。