MoME:上下文感知稀疏查找的混合记忆嵌入

Hugging Face Daily Papers 论文

摘要

介绍MoME,一种面向大语言模型的上下文感知记忆机制,它通过使用混合槽位来处理词元多义性,在预训练实验中优于基线方法。

高效扩展大语言模型激发了稀疏容量机制的研究,例如混合专家模型,以及近年来的条件记忆:通过词元索引的嵌入表,用低成本的参数查找来增强骨干网络。现有的记忆嵌入方法通过词表面形式的确定性函数进行检索,这会将同一词元的不同上下文含义(例如,作为编程语言的python与作为动物的python)坍缩为单一固定条目。我们提出混合记忆嵌入,这是一种上下文感知的记忆机制,它用包含M个槽位的混合体取代每个词元的单一记忆行,并利用一个基于隐藏状态的可学习门控来选择在每个位置读取哪些槽位。在nanochat、Llama-3/MobileLLM和Qwen3骨干网络上进行的受控预训练实验中,MoME在等参数和等训练计算量设置下优于值嵌入、二元组和STEM基线模型,在亚十亿规模上展现出更有潜力的记忆规模扩展趋势,并且在训练和推理中保持高效。对多义词的定性路由分析进一步表明,所学习的混合体展现了一定程度的语义可解释性,能根据不同的含义将表面形式相同的词元分派到不同的记忆槽位。
查看原文
查看缓存全文

缓存时间: 2026/09/21 07:19

论文页面 - MoME:面向上下文感知稀疏查找的记忆混合嵌入

来源:https://huggingface.co/papers/2609.15126

摘要

为了高效扩展大语言模型,稀疏容量机制(如混合专家模型,以及近期出现的条件记忆:基于令牌索引的嵌入表)得到发展,它通过低成本的参数查找来增强主干模型。现有记忆嵌入方法仅通过令牌表面形式的确定性函数进行检索,这使得同一令牌在不同语境中的含义(例如,Python编程语言与蟒蛇)被压缩到一个固定的条目中。我们提出了记忆混合嵌入(MoME),这是一种上下文感知的记忆机制。它将每个令牌的单一记忆行替换为 M 个槽位的混合,并使用一个基于隐藏状态的学习门控机制,来决定在每个位置读取哪些槽位。在涵盖 nanochat、Llama-3/MobileLLM 和 Qwen3 主干模型的可控预训练实验中,MoME 在等参数和等训练 FLOP 设置下,性能优于 Value Embedding、Bigram 和 STEM 基线方法;在亚十亿参数规模下,显示出更佳的内存规模扩展趋势;同时在训练和推理中均保持高效。对多义词令牌的定性路由分析进一步表明,学习到的混合机制表现出一定程度的语义可解释性,能够在不同语义下将相同的表面令牌分派到不同的记忆槽位。

查看 arXiv 页面 (https://arxiv.org/abs/2609.15126)查看 PDF (https://arxiv.org/pdf/2609.15126)GitHub6 (https://github.com/jojo23333/Mixutre-Of-Memory-Embedding)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.15126)

在你的代理中获取此论文:

hf papers read 2609.15126

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2609.15126 以从此页面链接。

引用此论文的数据集0

无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.15126 以从此页面链接。

引用此论文的 Spaces0

无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2609.15126 以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

MemTrain:自监督上下文记忆训练

arXiv cs.CL

MemTrain 提出了一种自监督训练框架,通过在维基百科语料上使用掩码重建和中间记忆召回代理任务,增强 LLM 智能体的上下文记忆能力,在下游记忆密集型 QA 基准上取得了高达 17.67 个百分点的提升。