Daedalus-150M:专为CPU推理设计的卷积-注意力混合模型
摘要
本文介绍了Daedalus-150M,一种结合了卷积和注意力机制的混合语言模型,专为CPU推理优化,在显著更少的训练数据下实现了比更大模型更好的基准性能。
查看缓存全文
缓存时间: 2026/08/24 08:28
论文页面 - Daedalus-150M:专为CPU推理设计的卷积-注意力混合架构
来源:https://huggingface.co/papers/2608.20210
发布于 8月20日
·
提交者:https://huggingface.co/Unseen1980
Ck (https://huggingface.co/Unseen1980) 于 8月24日
摘要
一种采用稀疏注意力和短卷积的小型混合语言模型,尽管训练数据远少于大型常规模型,却在CPU上实现了更快的推理速度和更优的基准测试分数。
小型语言模型通常按大模型架构构建,再压缩至CPU运行。我们反其道而行:首先明确目标硬件环境——单一用户、逐token处理、4位权重(https://huggingface.co/papers?q=4-bit%20weights)、普通CPU,再据此选择适配架构。最终模型仅在18个模块中的6个保留完整注意力机制,其余12个采用短卷积(https://huggingface.co/papers?q=short%20convolutions),其内存宽度固定为两个时间步长(无论对话多长),使得三分之二网络永不重复读取持续增长的缓存。该模型从头开始在599亿token数据上训练,在五任务基准测试中获得47.31分,超越训练前设定的42.20分基线。它击败了GPT-2 124M、Pythia-160M、OPT-125M和GPT-neo-125M(这些模型使用三到六倍数据训练),尽管MobileLLM-125M使用了万亿token训练,该模型仍超越其公布分数。验证集字节位值(https://huggingface.co/papers?q=bits-per-byte)为0.8685。为验证架构优势而非训练方案,我们在相同数据上训练了同规模的传统全注意力模型,并在评分前预先设定了胜出条件。该混合模型在选定的质量指标上领先0.81%,在下游任务中表现持平,生成的4位模型文件体积减小6.3%,在2048 token上下文长度下解码速度快1.76倍(对比相似规模的外部模型则达2.08倍)。所有测量均显示:空上下文时速度优势近乎为零,随长度增加而扩大——这与机制预测相符,且仅为精简参数的模型无法呈现的现象。简单的带宽(https://huggingface.co/papers?q=bandwidth)计算仅能预测1.17倍提升,说明存储容量差异无法完全解释性能差距。我们亦报告了未成功的尝试:未缓解的4位量化质量损失,约半数卷积通道最终失效且无法移除,以及超出该模型规模所需的词表容量。
查看arXiv页面 (https://arxiv.org/abs/2608.20210) | 查看PDF (https://arxiv.org/pdf/2608.20210) | 项目页面 (https://huggingface.co/Unseen1980/daedalus-150m-instruct) | GitHub0 (https://github.com/unseen1980/daedalus) | 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.20210)
通过终端获取本文:
hf papers read 2608\.20210
未安装最新CLI?执行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
无模型链接本论文
在模型README.md中引用 arxiv.org/abs/2608.20210 即可从本页建立链接。
引用本论文的数据集0
无数据集链接本论文
在数据集README.md中引用 arxiv.org/abs/2608.20210 即可从本页建立链接。
引用本论文的Spaces0
无Space链接本论文
在Space README.md中引用 arxiv.org/abs/2608.20210 即可从本页建立链接。
包含本论文的收藏集0
无收藏集包含本论文
将本论文添加至收藏夹 (https://huggingface.co/new-collection) 即可从本页建立链接。
相似文章
重新思考高效注意力在混合架构中的作用
本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。
SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力
SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。
OpenAI与Broadcom联合宣布专为大规模LLM推理设计的芯片
OpenAI与Broadcom宣布推出Jalapeño,这是一款专为数据中心大型语言模型推理定制的ASIC芯片。该芯片承诺在每瓦性能上显著优于当前最先进水平。
Retrofitting Linear Attention into Diffusion Language Models
This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.
训练具有部分双向性的混合块扩散语言模型
本文提出了一种用于块扩散语言模型的混合Mamba-注意力架构,该架构将反向Mamba扫描限制在活跃去噪块内,从而实现了块间的精确缓存,并在长上下文生成中达到了高吞吐量。