Daedalus-150M:专为CPU推理设计的卷积-注意力混合模型

Hugging Face Daily Papers 论文

摘要

本文介绍了Daedalus-150M,一种结合了卷积和注意力机制的混合语言模型,专为CPU推理优化,在显著更少的训练数据下实现了比更大模型更好的基准性能。

小型语言模型通常像大型模型一样构建,然后再挤到CPU上。我们反其道而行之:首先固定目标,一次一个用户、一个令牌、4位权重、普通CPU,并选择适合的架构。结果是在其18个块中只有6个保留了完整的注意力。其他12个使用短卷积,无论对话多长,其内存宽度仅为两个时间步,因此网络的三分之二永远不需要重新读取不断增长的缓存。 在59.9B令牌上从头训练,该模型在五任务基准上得分47.31,而训练开始前设定的目标是42.20。它击败了GPT-2 124M、Pythia-160M、OPT-125M和GPT-neo-125M,这些模型都在三到六倍更多的数据上训练,并且尽管MobileLLM-125M使用了万亿令牌,但该模型的发布分数仍被超越。验证每字节位数为0.8685。 为了检查架构而非训练方法,我们在相同数据上训练了一个相同大小的常规全注意力模型,并在评分前记录了获胜条件。混合模型在选定的质量指标上以0.81%的优势获胜,在下游任务中匹配,产生的4位文件小6.3%,并且在2048令牌上下文下解码速度提高1.76倍,相比外部相似大小模型提高2.08倍。在所有测量中,速度优势在空上下文时接近零,并随长度增加,这正是机制所预测的,而更精简的模型不会显示这一点。简单的带宽计算仅预测1.17倍,因此仅内存容量无法解释差距。 我们还报告了哪些方法无效:未减轻的4位质量成本,大约一半的卷积通道最终变得惰性且无法移除,以及词汇表超出了此模型大小的合理范围。
查看原文
查看缓存全文

缓存时间: 2026/08/24 08:28

论文页面 - Daedalus-150M:专为CPU推理设计的卷积-注意力混合架构

来源:https://huggingface.co/papers/2608.20210
发布于 8月20日
·
提交者:https://huggingface.co/Unseen1980

Ck (https://huggingface.co/Unseen1980) 于 8月24日

摘要

一种采用稀疏注意力和短卷积的小型混合语言模型,尽管训练数据远少于大型常规模型,却在CPU上实现了更快的推理速度和更优的基准测试分数。

小型语言模型通常按大模型架构构建,再压缩至CPU运行。我们反其道而行:首先明确目标硬件环境——单一用户、逐token处理、4位权重(https://huggingface.co/papers?q=4-bit%20weights)、普通CPU,再据此选择适配架构。最终模型仅在18个模块中的6个保留完整注意力机制,其余12个采用短卷积(https://huggingface.co/papers?q=short%20convolutions),其内存宽度固定为两个时间步长(无论对话多长),使得三分之二网络永不重复读取持续增长的缓存。该模型从头开始在599亿token数据上训练,在五任务基准测试中获得47.31分,超越训练前设定的42.20分基线。它击败了GPT-2 124M、Pythia-160M、OPT-125M和GPT-neo-125M(这些模型使用三到六倍数据训练),尽管MobileLLM-125M使用了万亿token训练,该模型仍超越其公布分数。验证集字节位值(https://huggingface.co/papers?q=bits-per-byte)为0.8685。为验证架构优势而非训练方案,我们在相同数据上训练了同规模的传统全注意力模型,并在评分前预先设定了胜出条件。该混合模型在选定的质量指标上领先0.81%,在下游任务中表现持平,生成的4位模型文件体积减小6.3%,在2048 token上下文长度下解码速度快1.76倍(对比相似规模的外部模型则达2.08倍)。所有测量均显示:空上下文时速度优势近乎为零,随长度增加而扩大——这与机制预测相符,且仅为精简参数的模型无法呈现的现象。简单的带宽(https://huggingface.co/papers?q=bandwidth)计算仅能预测1.17倍提升,说明存储容量差异无法完全解释性能差距。我们亦报告了未成功的尝试:未缓解的4位量化质量损失,约半数卷积通道最终失效且无法移除,以及超出该模型规模所需的词表容量。

查看arXiv页面 (https://arxiv.org/abs/2608.20210) | 查看PDF (https://arxiv.org/pdf/2608.20210) | 项目页面 (https://huggingface.co/Unseen1980/daedalus-150m-instruct) | GitHub0 (https://github.com/unseen1980/daedalus) | 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.20210)

通过终端获取本文:
hf papers read 2608\.20210
未安装最新CLI?执行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

无模型链接本论文
在模型README.md中引用 arxiv.org/abs/2608.20210 即可从本页建立链接。

引用本论文的数据集0

无数据集链接本论文
在数据集README.md中引用 arxiv.org/abs/2608.20210 即可从本页建立链接。

引用本论文的Spaces0

无Space链接本论文
在Space README.md中引用 arxiv.org/abs/2608.20210 即可从本页建立链接。

包含本论文的收藏集0

无收藏集包含本论文
将本论文添加至收藏夹 (https://huggingface.co/new-collection) 即可从本页建立链接。

相似文章

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。

SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力

arXiv cs.CL

SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。

Retrofitting Linear Attention into Diffusion Language Models

arXiv cs.LG

This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.

训练具有部分双向性的混合块扩散语言模型

arXiv cs.LG

本文提出了一种用于块扩散语言模型的混合Mamba-注意力架构,该架构将反向Mamba扫描限制在活跃去噪块内,从而实现了块间的精确缓存,并在长上下文生成中达到了高吞吐量。