标签
VDN-Minimax-H3 是一款开源混合注意力模型,能够在几乎无损的质量下加速视频生成,具有快速推理和即插即用适配器的特性,由 MiniMax H3 提供支持。
本文发布了Qwen3.8-Flash-Next模型的FP8量化权重,介绍了如混合注意力机制(Hybrid Attention with QSA)、门控残差(Gated Residual)和N-gram嵌入(N-gram Embedding)等架构创新,以提高大型语言模型的效率。
发布 Qwen3.8-Flash-Next,一款开放权重的 AI 模型,引入混合注意力(Hybrid Attention)与 QSA 以及门控残差(Gated Residual)等架构创新,提升效率和可扩展性,预览未来的 Qwen4 架构。
This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.
inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数量124B,激活参数量5.1B,采用混合线性注意力架构(KDA+MLA)与稀疏MoE。其性能与上一代1T级模型 Ring-2.6-1T 相当或更优,同时计算效率大幅提升,并内置智能体与长上下文优化。
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。
Kimi K3 是一个 2.8 万亿参数的多模态 MoE 模型,具有 100 万 token 的上下文窗口,现已获得 vLLM 的 day-0 支持。本指南详细介绍了 vLLM 如何服务于 K3 的新颖架构,包括 Kimi Delta Attention、Attention Residuals 以及推测解码,最高可达 370 tok/s。
Ramp Labs 开源了 PorTAL,这是一个用于共享任务表示和跨模型 LoRA 适配的框架,支持混合注意力模型以及包括 Gemma 4、Mistral 7B 和 Inkling 在内的多模态系统。
NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。
SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。
Upstage 发布了 Solar Open2 250B,这是一个 2500 亿参数的混合专家模型,仅需 150 亿活跃参数,采用混合注意力机制,支持高效长上下文推理,最高可达 100 万 token,专为代理型用例(如工具调用和多步推理)设计。
Upstage发布了Solar Open 2,这是一个拥有2500亿参数、采用混合注意力机制的开放权重MoE模型,性能与DeepSeek V4 Flash相当,同时在智能体工作流中表现出高效性。
提出了一种无需训练的NLL引导方法,用于在混合注意力模型中选择保留全注意力的层,在长上下文任务中,使用1/4全注意力层即可达到与1/2周期性基线相当的准确率。
FlashMorph 是一种高效的层选择方法,将混合层选择表述为预算约束优化问题,利用可变形模型和线性化正则化来提高 Transformers 中的长上下文效率。
DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。
HydraHead 是一种新颖的注意力混合架构,通过在头部层级结合完全注意力和线性注意力,利用可解释性驱动的选择和尺度归一化融合,实现长上下文性能卓越并减少训练开销。
ConSA是一个框架,它通过L0正则化和增广拉格朗日约束,在用户指定的稀疏性目标下学习全注意力和滑动窗口注意力之间的最优分配。在0.6B和1.7B规模的LLM上,它相比基于规则的基线表现出一致的提升。
CHIAR-Former使用基于谱熵的路由,动态选择DCT、RBF和自注意力算子,在大规模文本数据集上实现了效率提升,同时通过混合注意力机制保持性能。
InstructSAM 提出了一个统一的框架,用于多实例分割,采用指令驱动的查询,桥接视觉语言模型和 SAM3,在复杂基准上取得了强劲结果。