标签
FastVideo 发布 FastH3 预览版 v1,这是一个 AI 模型检查点,能够从文本生成同步视频和音频,使用四次 Transformer 前向传播,通过无数据 DMD2 和 VSA-H3 在 90% 稀疏度下训练。
EditaLive是一个用于实时以人为中心的直播视频编辑的新颖框架,它通过因果生成和蒸馏技术来适应图像动画模型,以实现高效的流式推理。
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是Qwen4架构的开源预览版,仅从125B参数中激活6B参数,以降低推理成本并解决硬件限制。
GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活跃参数,采用混合稀疏线性注意力架构以降低成本,同时在基准测试中性能超越前代版本并接近 Claude Opus 4.8。
阿里巴巴将于今晚23点在魔搭开源Qwen3.8-Flash-Next模型,采用Qwen4的GDN混合层和稀疏注意力架构,但缺乏基准测试数据。
GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活动参数,通过重新设计的混合架构提高了效率,性能超越之前的版本并接近 Claude Opus 4.8。
本文介绍BF1,一种因果二元稀疏注意力改造,旨在提升Transformer在长上下文处理中的效率。
本文使用SEWN(一种带有学习门控的双流模型用于令牌路由)评估了Transformer中的自适应计算,表明SEWN-sparse在准确性略有损失的情况下,相比BERT-base和DistilBERT实现了显著的吞吐量提升,并提供了可解释的令牌重要性信号。
本文提出了一种新方法,用于对具有稀疏注意力的transformer语言模型进行微调,以实现高效的长上下文推理,通常优于使用精确注意力训练的模型,并介绍了高效的实现和一个新的开源库。
FlashPrefill V2通过均值校正的稀疏注意力和优化的GPU算子改善了长上下文LLM服务,相比FlashAttention-2和稠密基线提供了显著的加速。
作者描述了构建一个实验性的Loop语言模型,该模型具有退出门控、稀疏/压缩注意力机制以及基于扩散的优化技术。在受限硬件环境下训练后,初步结果表明其在效率提升方面具有潜力。
本文介绍了Daedalus-150M,一种结合了卷积和注意力机制的混合语言模型,专为CPU推理优化,在显著更少的训练数据下实现了比更大模型更好的基准性能。
SparsePR 是一种训练无关的方法,通过使用响应耦合分区和探测拟合残差重构来减少注意力误差,同时保持生成质量,从而加速视频变换器。
EditBridge 是一个扩散桥框架,通过将低分辨率编辑转换为高分辨率输出并利用稀疏注意力,实现高达4K的高效超高分辨率图像编辑,显著提升速度并保留源细节。
这篇文章批判了AI研究中的常见做法,通过利用基准测试缺陷和实现细节,使稀疏注意力和KV缓存压缩技术看起来比实际更有效。
AoH is a data-free method that identifies retrieval and streaming heads from the spectral geometry of query-key projections, enabling sparse attention without runtime attention scores. At 50% sparsity it retains 96.5% of full-attention performance while reducing prefill/decode latency and KV-cache memory.
OasisKV是一个以内存为中心的LLM推理系统,通过使用来自推测解码的前瞻令牌预取稀疏且重要的KV块,将完整KV缓存存储与HBM解耦,与密集vLLM相比实现了高达2.1倍的吞吐量提升,且精度损失极小。
介绍了BinaryPC,一种面向长上下文大语言模型的无训练哈希稀疏注意力方法,利用二值主成分构建哈希码,在保持准确率的同时,解码吞吐量较FlashAttention提升了3.56倍。
ATFlash introduces a per-RoPE-wavelength distance window that prunes query-key inner-product terms proportional to each frequency pair's wavelength, cutting 37-48% of attention compute with minimal quality loss and up to 1.31x speedups on long-context LLM inference.
本文提出了 LTGA,一种图注意力层,学习逐边的 Tsallis 熵指数,以在重尾、softmax 和紧支撑注意力之间插值,提供可解释的稀疏注意力,并在图基准上取得有竞争力的性能。