sparse-attention

标签

Cards List
#sparse-attention

FastVideo/FastVideo-FastH3-四步-预览版-v1-VSA-无数据

Hugging Face Models Trending ↗ · 2026-08-27 缓存

FastVideo 发布 FastH3 预览版 v1,这是一个 AI 模型检查点,能够从文本生成同步视频和音频,使用四次 Transformer 前向传播,通过无数据 DMD2 和 VSA-H3 在 90% 稀疏度下训练。

0 人收藏 0 人点赞
#sparse-attention

EditaLive! 用于直播的统一角色视频编辑

Hugging Face Daily Papers ↗ · 2026-08-27 缓存

EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。

0 人收藏 0 人点赞
#sparse-attention

Qwen4的架构提前到来,从125B参数中激活6B参数(3分钟阅读)

TLDR AI ↗ · 2026-08-27 缓存

阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是Qwen4架构的开源预览版,仅从125B参数中激活6B参数,以降低推理成本并解决硬件限制。

0 人收藏 0 人点赞
#sparse-attention

unsloth/GLM-5.3-Flash-GGUF

Hugging Face Models Trending ↗ · 2026-08-26 缓存

GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活跃参数,采用混合稀疏线性注意力架构以降低成本,同时在基准测试中性能超越前代版本并接近 Claude Opus 4.8。

0 人收藏 0 人点赞
#sparse-attention

@threerouter_com: 今晚 23 点阿里要在魔搭开源 Qwen3.8-Flash-Next,消息是准的。 但说实话,没跑分就放出来,我持保留态度。官方说是为了给完整 Qwen4 家族做适配,意思就是“你们先试用,我们后面再补成绩单”。架构看着是挺牛——Qwen…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

阿里巴巴将于今晚23点在魔搭开源Qwen3.8-Flash-Next模型,采用Qwen4的GDN混合层和稀疏注意力架构,但缺乏基准测试数据。

0 人收藏 0 人点赞
#sparse-attention

zai-org/GLM-5.3-Flash

Hugging Face Models Trending ↗ · 2026-08-25 缓存

GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活动参数,通过重新设计的混合架构提高了效率,性能超越之前的版本并接近 Claude Opus 4.8。

0 人收藏 0 人点赞
#sparse-attention

BF1: 用于高效长上下文Transformer的因果二元稀疏注意力改造

arXiv cs.LG ↗ · 2026-08-24 缓存

本文介绍BF1,一种因果二元稀疏注意力改造,旨在提升Transformer在长上下文处理中的效率。

0 人收藏 0 人点赞
#sparse-attention

高效Transformer中的稀疏令牌路由

arXiv cs.CL ↗ · 2026-08-24 缓存

本文使用SEWN(一种带有学习门控的双流模型用于令牌路由)评估了Transformer中的自适应计算,表明SEWN-sparse在准确性略有损失的情况下,相比BERT-base和DistilBERT实现了显著的吞吐量提升,并提供了可解释的令牌重要性信号。

0 人收藏 0 人点赞
#sparse-attention

学习如何遗忘:针对长上下文稀疏注意力的微调

arXiv cs.CL ↗ · 2026-08-21 缓存

本文提出了一种新方法,用于对具有稀疏注意力的transformer语言模型进行微调,以实现高效的长上下文推理,通常优于使用精确注意力训练的模型,并介绍了高效的实现和一个新的开源库。

0 人收藏 0 人点赞
#sparse-attention

FlashPrefill V2:面向长上下文LLM服务的块稀疏预填充注意力

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

FlashPrefill V2通过均值校正的稀疏注意力和优化的GPU算子改善了长上下文LLM服务,相比FlashAttention-2和稠密基线提供了显著的加速。

0 人收藏 0 人点赞
#sparse-attention

有人尝试过构建带有退出门、稀疏化、压缩与高度压缩注意力机制、层级注意力以及扩散优化的循环语言模型吗?

Reddit r/ArtificialInteligence ↗ · 2026-08-20

作者描述了构建一个实验性的Loop语言模型,该模型具有退出门控、稀疏/压缩注意力机制以及基于扩散的优化技术。在受限硬件环境下训练后,初步结果表明其在效率提升方面具有潜力。

0 人收藏 0 人点赞
#sparse-attention

Daedalus-150M:专为CPU推理设计的卷积-注意力混合模型

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

本文介绍了Daedalus-150M,一种结合了卷积和注意力机制的混合语言模型,专为CPU推理优化,在显著更少的训练数据下实现了比更大模型更好的基准性能。

0 人收藏 0 人点赞
#sparse-attention

分区支持,重构残差:面向视频生成和世界模型的训练无关稀疏注意力

Hugging Face Daily Papers ↗ · 2026-08-19 缓存

SparsePR 是一种训练无关的方法,通过使用响应耦合分区和探测拟合残差重构来减少注意力误差,同时保持生成质量,从而加速视频变换器。

0 人收藏 0 人点赞
#sparse-attention

EDITBRIDGE:迈向忠实且高效的超高分辨率图像编辑

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

EditBridge 是一个扩散桥框架,通过将低分辨率编辑转换为高分辨率输出并利用稀疏注意力,实现高达4K的高效超高分辨率图像编辑,显著提升速度并保留源细节。

0 人收藏 0 人点赞
#sparse-attention

🤡 如何让任何稀疏注意力/KV压缩看起来更好?🤡

Reddit r/ArtificialInteligence ↗ · 2026-08-17

这篇文章批判了AI研究中的常见做法,通过利用基准测试缺陷和实现细节,使稀疏注意力和KV缓存压缩技术看起来比实际更有效。

0 人收藏 0 人点赞
#sparse-attention

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

arXiv cs.CL ↗ · 2026-08-10 缓存

AoH is a data-free method that identifies retrieval and streaming heads from the spectral geometry of query-key projections, enabling sparse attention without runtime attention scores. At 50% sparsity it retains 96.5% of full-attention performance while reducing prefill/decode latency and KV-cache memory.

0 人收藏 0 人点赞
#sparse-attention

OasisKV:利用前瞻稀疏预取将解码中KV缓存扩展到HBM之外

Hugging Face Daily Papers ↗ · 2026-08-08 缓存

OasisKV是一个以内存为中心的LLM推理系统,通过使用来自推测解码的前瞻令牌预取稀疏且重要的KV块,将完整KV缓存存储与HBM解耦,与密集vLLM相比实现了高达2.1倍的吞吐量提升,且精度损失极小。

0 人收藏 0 人点赞
#sparse-attention

基于二值主成分的无训练哈希注意力

arXiv cs.LG ↗ · 2026-08-06 缓存

介绍了BinaryPC,一种面向长上下文大语言模型的无训练哈希稀疏注意力方法,利用二值主成分构建哈希码,在保持准确率的同时,解码吞吐量较FlashAttention提升了3.56倍。

0 人收藏 0 人点赞
#sparse-attention

ATFlash: Per-RoPE-Wavelength Attention Windows for Compute/Memory-Efficient LLM Inference

arXiv cs.LG ↗ · 2026-08-05 缓存

ATFlash introduces a per-RoPE-wavelength distance window that prunes query-key inner-product terms proportional to each frequency pair's wavelength, cutting 37-48% of attention compute with minimal quality loss and up to 1.31x speedups on long-context LLM inference.

0 人收藏 0 人点赞
#sparse-attention

图注意力何时应稀疏?学习逐边的 Tsallis 指数

arXiv cs.LG ↗ · 2026-08-05 缓存

本文提出了 LTGA,一种图注意力层,学习逐边的 Tsallis 熵指数,以在重尾、softmax 和紧支撑注意力之间插值,提供可解释的稀疏注意力,并在图基准上取得有竞争力的性能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈