大规模 Memory Decoder:一种预训练的、参数化长期记忆
摘要
本文介绍了 Memory Decoder at Scale,将参数化长期记忆模型扩展至 6.9B 参数,并在 300B token 上预训练,表明独立扩展记忆比单独扩展基础模型更具参数效率。
查看缓存全文
缓存时间: 2026/07/31 05:52
论文页面 - Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
来源:https://huggingface.co/papers/2607.27919
摘要
仅解码器语言模型将长期记忆和推理纠缠在单一参数集中,使得独立扩展记忆容量变得困难。Memory Decoder 引入了一个参数化长期记忆模块,但仅在相对较小的规模上进行了研究。在这项工作中,我们提出了 Memory Decoder at Scale,将记忆模型扩展到 6.9B 参数,并在 300B tokens 上进行预训练。在此数据规模下,索引和搜索的联合成本使得标准 Faiss 流水线不可行。我们通过一个用于 Faiss 索引和检索的分布式流水线,以及 kNN 分布的稀疏、批式加载来解决这一瓶颈。跨模型规模,我们发现与仅扩展基础模型相比,将更多参数分配给记忆能带来更好的参数-性能权衡。在 17 个基准测试上,将 6.9B 通用记忆与 Pythia-410M 配对可将其平均得分从 29.86 提升至 37.34,以总参数少 39% 的优势超过了 Pythia-12B(37.24)。对于从 0.6B 到 14B 的 Qwen3 Base 模型,1.7B 领域记忆在每个规模上都将三个领域的平均得分提升了超过 9 分。总体而言,我们的结果表明,独立扩展预训练记忆为提升语言模型性能提供了一条更具参数效率的路径。
查看 arXiv 页面 (https://arxiv.org/abs/2607.27919)查看 PDF (https://arxiv.org/pdf/2607.27919)项目页面 (https://rubin-wei.github.io/memory-decoder-at-scale/)GitHub0 (https://github.com/LUMIA-Group/MemoryDecoder-at-Scale)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27919)
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.27919 以从此页面链接它。
引用此论文的数据集1
Rubin-Wei/MemoryDecoder-at-Scale-domain-data 查看器 • 约4小时前更新 • 11M • 9 (https://huggingface.co/datasets/Rubin-Wei/MemoryDecoder-at-Scale-domain-data)
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.27919 以从此页面链接它。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
大规模下的Hidden Decoding: 大型语言模型的潜在计算扩展
本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。
Mem0:利用可扩展的长期记忆构建生产就绪的 AI 智能体
Mem0 引入了一种基于图表示的可扩展内存中心架构,旨在提升大语言模型(LLM)在长期对话中的连贯性,在显著降低延迟和 Token 成本的同时,性能优于现有的记忆系统。
δ-mem:大型语言模型的高效在线记忆机制
本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。
理解在早期完成:大型语言模型中的深度分工及其用于无界上下文记忆
本文介绍了CoMem,一种利用LLM中深度方向分工的方法,它缓存中间残差张量,并且仅重新计算上层以进行检索,从而实现有界的读取计算和内存,与存储的上下文长度无关。在Qwen3-8B上评估,CoMem在长上下文任务上取得了强劲性能,同时显著节省内存并加速预填充。
内存高效型循环Transformer:循环语言模型中的计算与内存解耦
提出内存高效型循环Transformer(MELT),这是一种新型循环大语言模型架构,通过跨循环共享单一KV缓存,并结合插值过渡与注意力对齐蒸馏的分块训练方法,实现了推理深度与内存消耗的解耦。