介绍 DWARF-55M-Base

Reddit r/LocalLLaMA 模型

摘要

DWARF-55M-Base 是一种新型语言模型,采用近乎全稀疏注意力架构(DSQG),仅包含一个完整因果注意力层,能够实现高达2048 token的可靠检索,并可外推至该上下文长度的3倍。该模型作为研究原型发布,供社区实验使用。

经过数月的研究,基于DWARF架构的第一个模型终于可供大家查看和实验!DWARF是一种近乎全稀疏注意力架构,使用9个动态稀疏查询收集(DSQG)层作为传输骨干,并在25%层深度处设置一个完整的因果注意力层。例如,如果模型有32层,则只需在L7层设置一个完整的因果注意力层作为全局混合器,即可在训练的2048上下文长度内实现持续可靠的检索。初步结果还表明,仅使用N=2048进行训练,即可在3倍训练长度(本例中N=6144)下产生持续可靠的检索,但这仍有待进一步测试确认。DSQG用一组固定的因果近程和远程token偏移取代了全注意力,因此每个token只查阅其过去的一小部分多尺度样本,而不是所有之前的token。然后,它学习哪些采样位置是重要的,并使用查询/键探测信号调整它们的值,旨在以更低的注意力成本保留有用的内容敏感通信。由于DSQG解码每个新token时只处理固定数量的偏移,而非扫描整个历史,因此其每个token的KV缓存带宽和注意力工作几乎与上下文长度无关(O(1))。这是一个研究原型的基础模型,使用Dolma3 Mix 150B中的10B token进行训练,采用经过ChatML修改的OLMo1 Base分词器(50282个token)。GitHub上的代码允许用户尝试HISA路径,该路径用L3层的全注意力替代方案,以获得与全注意力混合模型相当的性能,但本质上是纯稀疏的。HISA路径目前处于实验阶段,尚未完全完善。Huggingface Github
查看原文

相似文章

deepseek-ai/DeepSeek-V4-Flash-DSpark

Hugging Face Models Trending

DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。

SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力

arXiv cs.CL

SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。