MemSFT:利用外部参数化记忆缓解对齐税

Hugging Face Daily Papers 论文

摘要

MemSFT是一篇研究论文,提出通过使用外部参数化记忆来缓解大语言模型微调中的对齐税,该记忆将领域专业化与骨干网络参数更新解耦,从而能够跨不同规模的LLM重用,同时保持通用性能。

将大语言模型(LLM)适配到专业领域通常会带来对齐税,因为在领域特定任务上的微调可能导致灾难性遗忘,并显著降低通用任务性能。我们提出MemSFT,通过即插即用的参数化记忆将领域专业化与骨干网络参数更新解耦,从而缓解对齐税。该记忆经过训练,模仿在领域数据上运行的非参数检索器的行为,从而记住原本需要通过检索访问的知识和模式。一旦在特定领域上完成训练,该记忆即可在不同规模的LLM之间复用。在生成过程中,一个学习得到的路由器在每个解码步骤动态融合记忆和骨干网络的输出分布,从而选择性地调用领域专业知识。在生物学、地球科学和法律领域,使用从Qwen3-8B到Qwen3-235B-A22B的模型进行的评估表明,MemSFT在通用性能几乎无下降的情况下持续提升领域性能,而完整SFT则在通用任务上遭受严重遗忘。总体而言,我们的结果展示了一条在参数层面将通用模型能力与领域特定知识解耦的实用路径,从而使LLM在不牺牲通用能力的情况下获得新的专业能力。
查看原文
查看缓存全文

缓存时间: 2026/08/05 01:42

论文页面 - MemSFT:利用外部参数化记忆缓解对齐税

Source: https://huggingface.co/papers/2607.25614

摘要

将大语言模型(LLMs)适配到专业领域通常会产生对齐税,因为针对特定领域任务的微调可能导致灾难性遗忘,并显著降低在通用任务上的性能。我们提出了MemSFT,通过一个即插即用式的参数化记忆将领域专业化与骨干网络参数更新解耦,从而缓解对齐税。该记忆被训练用于模仿非参数化检索器在领域数据上的行为,从而记住原本需要通过检索才能获取的知识和模式。在特定领域上训练完成后,该记忆可以跨不同规模的LLM复用。在生成过程中,一个学习得到的路由器在每个解码步骤动态融合记忆和骨干网络的输出分布,从而可以选择性地调用领域专业知识。在生物学、地球科学和法律领域,使用从Qwen3-8B到Qwen3-235B-A22B的模型进行的评估表明,MemSFT持续提升领域性能,同时对通用性能的损害可忽略不计,而完全SFT在通用任务上则遭受严重遗忘。总体而言,我们的结果展示了一条在参数层面将通用模型能力与领域特定知识解耦的实用路径,从而在不损害通用能力的前提下为LLM装备新的专业化能力。

查看arXiv页面 (https://arxiv.org/abs/2607.25614) 查看PDF (https://arxiv.org/pdf/2607.25614) GitHub1 (https://github.com/LUMIA-Group/MemSFT) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25614)

在你的 Agent 中获取此论文:

hf papers read 2607\.25614

还没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 6

Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-1.7B 文本生成 • 2B • 更新于1天前 • 20 (https://huggingface.co/Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-1.7B)

Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-4B 文本生成 • 4B • 更新于1天前 • 28 (https://huggingface.co/Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-4B)

Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-8B 文本生成 • 8B • 更新于1天前 • 22 (https://huggingface.co/Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-8B)

Jiarui-Wang/MemSFT-Qwen3-OpenSWI-Memory-8B 文本生成 • 8B • 更新于1天前 • 21 (https://huggingface.co/Jiarui-Wang/MemSFT-Qwen3-OpenSWI-Memory-8B)

浏览引用此论文的6个模型 (https://huggingface.co/models?other=arxiv:2607.25614)

引用此论文的数据集 0

暂无关联此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2607.25614,即可从此页面链接到该数据集。

引用此论文的 Space 0

暂无关联此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2607.25614,即可从此页面链接到该 Space。

包含此论文的收藏集 0

暂无包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到该收藏集。

相似文章

DimMem:面向高效长期智能体记忆的维度结构化

arXiv cs.CL

DimMem 提出了一种用于 LLM 智能体的维度记忆框架,将记忆表示为具有显式字段的原子化、类型化单元,在 LoCoMo-10 和 LongMemEval-S 上实现了最先进的准确率,同时将 token 成本降低了 24%。