大规模 Memory Decoder:一种预训练的、参数化长期记忆

Hugging Face Daily Papers 论文

摘要

本文介绍了 Memory Decoder at Scale,将参数化长期记忆模型扩展至 6.9B 参数,并在 300B token 上预训练,表明独立扩展记忆比单独扩展基础模型更具参数效率。

仅解码器(Decoder-only)语言模型将长期记忆与推理纠缠在单一参数集中,使得难以独立扩展记忆容量。Memory Decoder 引入了一个参数化长期记忆模块,但仅在相对较小的规模下进行了研究。在这项工作中,我们提出了 Memory Decoder at Scale,将记忆模型扩展到 6.9B 参数,并在 300B token 上预训练。在此数据规模下,索引与搜索的联合成本使得标准 Faiss 流水线不可行。我们通过用于 Faiss 索引和检索的分布式流水线,以及 kNN 分布的稀疏、按批次加载,解决了这一瓶颈。在不同模型规模上,我们发现将更多参数分配给记忆比单独扩展基础模型能带来更好的参数-性能权衡。在 17 个基准测试上,将 6.9B 通用记忆与 Pythia-410M 搭配使用,可将其平均得分从 29.86 提升至 37.34,以少 39% 的总参数超越了 Pythia-12B(37.24)。对于从 0.6B 到 14B 的 Qwen3 Base 模型,1.7B 领域记忆在每个规模下将三个领域的平均得分提高了超过 9 分。总体而言,我们的结果表明,独立扩展预训练记忆为提升语言模型性能提供了一条更具参数效率的路径。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:52

论文页面 - Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

来源:https://huggingface.co/papers/2607.27919

摘要

仅解码器语言模型将长期记忆和推理纠缠在单一参数集中,使得独立扩展记忆容量变得困难。Memory Decoder 引入了一个参数化长期记忆模块,但仅在相对较小的规模上进行了研究。在这项工作中,我们提出了 Memory Decoder at Scale,将记忆模型扩展到 6.9B 参数,并在 300B tokens 上进行预训练。在此数据规模下,索引和搜索的联合成本使得标准 Faiss 流水线不可行。我们通过一个用于 Faiss 索引和检索的分布式流水线,以及 kNN 分布的稀疏、批式加载来解决这一瓶颈。跨模型规模,我们发现与仅扩展基础模型相比,将更多参数分配给记忆能带来更好的参数-性能权衡。在 17 个基准测试上,将 6.9B 通用记忆与 Pythia-410M 配对可将其平均得分从 29.86 提升至 37.34,以总参数少 39% 的优势超过了 Pythia-12B(37.24)。对于从 0.6B 到 14B 的 Qwen3 Base 模型,1.7B 领域记忆在每个规模上都将三个领域的平均得分提升了超过 9 分。总体而言,我们的结果表明,独立扩展预训练记忆为提升语言模型性能提供了一条更具参数效率的路径。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27919)查看 PDF (https://arxiv.org/pdf/2607.27919)项目页面 (https://rubin-wei.github.io/memory-decoder-at-scale/)GitHub0 (https://github.com/LUMIA-Group/MemoryDecoder-at-Scale)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27919)

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27919 以从此页面链接它。

引用此论文的数据集1

Rubin-Wei/MemoryDecoder-at-Scale-domain-data 查看器 • 约4小时前更新 • 11M • 9 (https://huggingface.co/datasets/Rubin-Wei/MemoryDecoder-at-Scale-domain-data)

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27919 以从此页面链接它。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

大规模下的Hidden Decoding: 大型语言模型的潜在计算扩展

arXiv cs.CL

本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。

δ-mem:大型语言模型的高效在线记忆机制

Hugging Face Daily Papers

本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。