NGM:一种即插即用、无需训练的大型语言模型记忆模块
摘要
NGM是一种无需训练、即插即用的大型语言模型记忆模块,通过利用预训练的词元嵌入进行N-gram知识检索,无需额外训练或检索管道即可提升性能,在代码生成和知识任务上最高可获得3个百分点的提升。
查看缓存全文
缓存时间: 2026/05/19 10:31
论文页面 - NGM:面向LLM的即插即用免训练记忆模块
来源:https://huggingface.co/papers/2605.16893 发布于5月16日
·
提交于https://huggingface.co/Automationyw
曲彧彣 (https://huggingface.co/Automationyw) 于5月19日
摘要
一种免训练的 N-gram 记忆模块通过直接利用预训练的词元嵌入进行知识检索,从而增强语言模型性能,无需额外的记忆表或检索管道。
近期研究引入了将知识存储与神经计算解耦的条件记忆模块,实现了更直接的知识访问。与依赖动态计算路径的 MoE 相比,显式查找提供了一种更高效的知识检索机制。然而,这些方法仍然依赖学习到的记忆嵌入,需要额外训练且灵活性受限。针对此问题,我们提出了 N-gram 记忆(NGM),一种由 因果 N-gram 编码器和 余弦门控记忆注入器组成的免训练、即插即用模块。因果 N-gram 编码器直接对主干模型的预训练词元嵌入进行平均,以构建 N-gram 表示,从而无需从头训练单独的 N-gram 嵌入。这一设计既不需要额外的记忆表,也不需要检索管道。余弦门控记忆注入器随后使用非参数的余弦门控(配合 ReLU)将检索到的嵌入调制到上下文表示中。我们在 0.6B 至 14B 的 Qwen3 系列模型上对 NGM 进行了八个基准测试的评估。NGM 将平均性能提升 0.5 至 1.2 个点,在代码生成和知识密集型任务上尤其明显(例如 Qwen3-14B 在 LiveCodeBench 上提升 +3.0,在 GPQA 上提升 +3.03)。此外,NGM 在多模态基准上也提升了性能(例如 Qwen3-VL-2B 在 MMStar 上提升 +1.53)。
查看 arXiv 页面查看 PDFGitHub 0添加到收藏
在您的代理中获取此论文:
hf papers read 2605\.16893
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2605.16893 即可从此页面链接。
引用此论文的数据集 0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.16893 即可从此页面链接。
引用此论文的 Space 0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2605.16893 即可从此页面链接。
包含此论文的收藏集 0
暂无收藏集包含此论文
将此论文添加到收藏集即可从此页面链接。
相似文章
NGM:一种即插即用、无需训练的大语言模型记忆模块
本文提出NGM,一种即插即用、无需训练的大语言模型记忆模块,采用因果N元编码器和余弦门控记忆注入器,无需额外训练即可提升代码生成和知识密集型任务的性能。
SimpleMem: 面向大语言模型智能体的高效终身记忆
介绍SimpleMem,一种面向LLM智能体的高效记忆框架,利用语义无损压缩提升准确率并降低token消耗,F1分数提升26.4%,推理时token使用量减少高达30倍。
MemGym:面向LLM智能体的长时记忆环境
MemGym是一个基准测试,用于评估LLM智能体在长时任务中的记忆形成,它统一了现有的智能体gym和合成流水线,并采用记忆隔离得分。它涵盖工具使用对话、多轮搜索、编码和计算机使用,并包含一个轻量级奖励模型(MemRM)以实现高效评估。
TokenMem: 面向冻结大语言模型的忠实知识注入
TokenMem通过专用的交叉注意力通道向冻结的大语言模型注入知识,训练一个轻量的门控适配器(两阶段课程),以提升在反事实知识下的知识合规性,在反事实基准上实现了69-70%的知识合规率(KC),而传统RAG仅为20-52%。
@dair_ai: // 记忆即模型 // 该论文为任何LLM增加一个单独训练的记忆模型,用于存储、检索和整合…
MeMo 引入了一种模块化记忆模型,可为任何 LLM 增强存储、检索和整合新知识的能力,无需重新训练或担心灾难性遗忘。它在 BrowseComp-Plus、NarrativeQA 和 MuSiQue 等基准测试上优于基于 RAG 的方法。