hybrid-attention

标签

Cards List
#hybrid-attention

PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力

arXiv cs.AI · 4天前 缓存

PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。

0 人收藏 0 人点赞
#hybrid-attention

GLIDE: 引导的逐层混合注意力实现高效LLM推理

arXiv cs.AI · 4天前 缓存

GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。

0 人收藏 0 人点赞
#hybrid-attention

K3 部署的推理引擎指南(10 分钟阅读)

TLDR AI · 4天前 缓存

Kimi K3 是一个 2.8 万亿参数的多模态 MoE 模型,具有 100 万 token 的上下文窗口,现已获得 vLLM 的 day-0 支持。本指南详细介绍了 vLLM 如何服务于 K3 的新颖架构,包括 Kimi Delta Attention、Attention Residuals 以及推测解码,最高可达 370 tok/s。

0 人收藏 0 人点赞
#hybrid-attention

@jerryjliu0:如果我只看X上的帖子,我会以为Ramp是一个AI实验室

X AI KOLs Following · 5天前 缓存

Ramp Labs 开源了 PorTAL,这是一个用于共享任务表示和跨模型 LoRA 适配的框架,支持混合注意力模型以及包括 Gemma 4、Mistral 7B 和 Inkling 在内的多模态系统。

0 人收藏 0 人点赞
#hybrid-attention

Nvidia 的新型长视频生成技术(12分钟阅读)

TLDR AI · 6天前 缓存

NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。

0 人收藏 0 人点赞
#hybrid-attention

SANA-Video 2.0:基于混合线性注意力和注意力残差的高效视频生成

Hugging Face Daily Papers · 2026-07-23 缓存

SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。

0 人收藏 0 人点赞
#hybrid-attention

@_akhaliq: Solar Open2 250B 刚刚在 Hugging Face 上发布 https://huggingface.co/upstage/Solar-Open2-250B…

X AI KOLs Following · 2026-07-22 缓存

Upstage 发布了 Solar Open2 250B,这是一个 2500 亿参数的混合专家模型,仅需 150 亿活跃参数,采用混合注意力机制,支持高效长上下文推理,最高可达 100 万 token,专为代理型用例(如工具调用和多步推理)设计。

0 人收藏 0 人点赞
#hybrid-attention

Upstage推出'Solar open2',性能与DeepSeek V4 Flash相当。

Reddit r/LocalLLaMA · 2026-07-22 缓存

Upstage发布了Solar Open 2,这是一个拥有2500亿参数、采用混合注意力机制的开放权重MoE模型,性能与DeepSeek V4 Flash相当,同时在智能体工作流中表现出高效性。

0 人收藏 0 人点赞
#hybrid-attention

无需训练的滑动窗口适配中NLL引导的全注意力层选择

arXiv cs.CL · 2026-06-29 缓存

提出了一种无需训练的NLL引导方法,用于在混合注意力模型中选择保留全注意力的层,在长上下文任务中,使用1/4全注意力层即可达到与1/2周期性基线相当的准确率。

0 人收藏 0 人点赞
#hybrid-attention

变形为混合注意力模型

Hugging Face Daily Papers · 2026-06-29 缓存

FlashMorph 是一种高效的层选择方法,将混合层选择表述为预算约束优化问题,利用可变形模型和线性化正则化来提高 Transformers 中的长上下文效率。

0 人收藏 0 人点赞
#hybrid-attention

deepseek-ai/DeepSeek-V4-Flash-DSpark

Hugging Face Models Trending · 2026-06-27 缓存

DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。

0 人收藏 0 人点赞
#hybrid-attention

HydraHead:从头部级功能异质性到专注意力混合

Hugging Face Daily Papers · 2026-06-18 缓存

HydraHead 是一种新颖的注意力混合架构,通过在头部层级结合完全注意力和线性注意力,利用可解释性驱动的选择和尺度归一化融合,实现长上下文性能卓越并减少训练开销。

0 人收藏 0 人点赞
#hybrid-attention

ConSA: 通过可学习分配实现混合注意力中的可控稀疏性

arXiv cs.CL · 2026-06-17 缓存

ConSA是一个框架,它通过L0正则化和增广拉格朗日约束,在用户指定的稀疏性目标下学习全注意力和滑动窗口注意力之间的最优分配。在0.6B和1.7B规模的LLM上,它相比基于规则的基线表现出一致的提升。

0 人收藏 0 人点赞
#hybrid-attention

Chiaroscuro Attention:在黑暗中运用计算

Hugging Face Daily Papers · 2026-06-06 缓存

CHIAR-Former使用基于谱熵的路由,动态选择DCT、RBF和自注意力算子,在大规模文本数据集上实现了效率提升,同时通过混合注意力机制保持性能。

0 人收藏 0 人点赞
#hybrid-attention

InstructSAM:根据任意指令分割任意实例

Hugging Face Daily Papers · 2026-05-25 缓存

InstructSAM 提出了一个统一的框架,用于多实例分割,采用指令驱动的查询,桥接视觉语言模型和 SAM3,在复杂基准上取得了强劲结果。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈