NGM:一种即插即用、无需训练的大型语言模型记忆模块

Hugging Face Daily Papers 论文

摘要

NGM是一种无需训练、即插即用的大型语言模型记忆模块,通过利用预训练的词元嵌入进行N-gram知识检索,无需额外训练或检索管道即可提升性能,在代码生成和知识任务上最高可获得3个百分点的提升。

近期研究引入了条件记忆模块,将知识存储与神经计算解耦,从而实现更直接的知识访问。与依赖动态计算路径的混合专家模型(MoE)相比,显式查找提供了一种更高效的知识检索机制。然而,这些方法仍然依赖于学习到的记忆嵌入,需要额外训练且灵活性受限。为解决这一问题,我们提出N-gram记忆(NGM),一种由因果N-gram编码器和余弦门控记忆注入器组成的即插即用、无需训练的模块。因果N-gram编码器直接对骨干模型的预训练词元嵌入进行平均,以构建N-gram表示,从而无需从头训练独立的N-gram嵌入。该设计既不需要额外的记忆表,也不需要检索管道。余弦门控记忆注入器随后使用非参数化的余弦门控与ReLU,将检索到的嵌入调制到上下文表示中。我们在Qwen3系列(0.6B至14B参数规模)上对NGM进行了八个基准的评估。NGM将平均性能提升了0.5到1.2个百分点,在代码生成和知识密集型任务上尤其明显(例如,在Qwen3-14B上,LiveCodeBench提升3.0,GPQA提升3.03)。此外,NGM在多模态基准上也有提升(例如,Qwen3-VL-2B的MMStar提升1.53)。
查看原文
查看缓存全文

缓存时间: 2026/05/19 10:31

论文页面 - NGM:面向LLM的即插即用免训练记忆模块

来源:https://huggingface.co/papers/2605.16893 发布于5月16日

·

提交于https://huggingface.co/Automationyw

曲彧彣 (https://huggingface.co/Automationyw) 于5月19日

摘要

一种免训练的 N-gram 记忆模块通过直接利用预训练的词元嵌入进行知识检索,从而增强语言模型性能,无需额外的记忆表或检索管道。

近期研究引入了将知识存储与神经计算解耦的条件记忆模块,实现了更直接的知识访问。与依赖动态计算路径的 MoE 相比,显式查找提供了一种更高效的知识检索机制。然而,这些方法仍然依赖学习到的记忆嵌入,需要额外训练且灵活性受限。针对此问题,我们提出了 N-gram 记忆(NGM),一种由 因果 N-gram 编码器余弦门控记忆注入器组成的免训练、即插即用模块。因果 N-gram 编码器直接对主干模型的预训练词元嵌入进行平均,以构建 N-gram 表示,从而无需从头训练单独的 N-gram 嵌入。这一设计既不需要额外的记忆表,也不需要检索管道。余弦门控记忆注入器随后使用非参数的余弦门控(配合 ReLU)将检索到的嵌入调制到上下文表示中。我们在 0.6B 至 14B 的 Qwen3 系列模型上对 NGM 进行了八个基准测试的评估。NGM 将平均性能提升 0.5 至 1.2 个点,在代码生成知识密集型任务上尤其明显(例如 Qwen3-14B 在 LiveCodeBench 上提升 +3.0,在 GPQA 上提升 +3.03)。此外,NGM 在多模态基准上也提升了性能(例如 Qwen3-VL-2B 在 MMStar 上提升 +1.53)。

查看 arXiv 页面查看 PDFGitHub 0添加到收藏

在您的代理中获取此论文:

hf papers read 2605\.16893

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2605.16893 即可从此页面链接。

引用此论文的数据集 0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.16893 即可从此页面链接。

引用此论文的 Space 0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2605.16893 即可从此页面链接。

包含此论文的收藏集 0

暂无收藏集包含此论文

将此论文添加到收藏集即可从此页面链接。

相似文章

MemGym:面向LLM智能体的长时记忆环境

arXiv cs.CL

MemGym是一个基准测试,用于评估LLM智能体在长时任务中的记忆形成,它统一了现有的智能体gym和合成流水线,并采用记忆隔离得分。它涵盖工具使用对话、多轮搜索、编码和计算机使用,并包含一个轻量级奖励模型(MemRM)以实现高效评估。

TokenMem: 面向冻结大语言模型的忠实知识注入

arXiv cs.AI

TokenMem通过专用的交叉注意力通道向冻结的大语言模型注入知识,训练一个轻量的门控适配器(两阶段课程),以提升在反事实知识下的知识合规性,在反事实基准上实现了69-70%的知识合规率(KC),而传统RAG仅为20-52%。