MemSFT:利用外部参数化记忆缓解对齐税
摘要
MemSFT是一篇研究论文,提出通过使用外部参数化记忆来缓解大语言模型微调中的对齐税,该记忆将领域专业化与骨干网络参数更新解耦,从而能够跨不同规模的LLM重用,同时保持通用性能。
查看缓存全文
缓存时间: 2026/08/05 01:42
论文页面 - MemSFT:利用外部参数化记忆缓解对齐税
Source: https://huggingface.co/papers/2607.25614
摘要
将大语言模型(LLMs)适配到专业领域通常会产生对齐税,因为针对特定领域任务的微调可能导致灾难性遗忘,并显著降低在通用任务上的性能。我们提出了MemSFT,通过一个即插即用式的参数化记忆将领域专业化与骨干网络参数更新解耦,从而缓解对齐税。该记忆被训练用于模仿非参数化检索器在领域数据上的行为,从而记住原本需要通过检索才能获取的知识和模式。在特定领域上训练完成后,该记忆可以跨不同规模的LLM复用。在生成过程中,一个学习得到的路由器在每个解码步骤动态融合记忆和骨干网络的输出分布,从而可以选择性地调用领域专业知识。在生物学、地球科学和法律领域,使用从Qwen3-8B到Qwen3-235B-A22B的模型进行的评估表明,MemSFT持续提升领域性能,同时对通用性能的损害可忽略不计,而完全SFT在通用任务上则遭受严重遗忘。总体而言,我们的结果展示了一条在参数层面将通用模型能力与领域特定知识解耦的实用路径,从而在不损害通用能力的前提下为LLM装备新的专业化能力。
查看arXiv页面 (https://arxiv.org/abs/2607.25614) 查看PDF (https://arxiv.org/pdf/2607.25614) GitHub1 (https://github.com/LUMIA-Group/MemSFT) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25614)
在你的 Agent 中获取此论文:
hf papers read 2607\.25614
还没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 6
Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-1.7B 文本生成 • 2B • 更新于1天前 • 20 (https://huggingface.co/Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-1.7B)
Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-4B 文本生成 • 4B • 更新于1天前 • 28 (https://huggingface.co/Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-4B)
Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-8B 文本生成 • 8B • 更新于1天前 • 22 (https://huggingface.co/Jiarui-Wang/MemSFT-Qwen3-Bio-Memory-8B)
Jiarui-Wang/MemSFT-Qwen3-OpenSWI-Memory-8B 文本生成 • 8B • 更新于1天前 • 21 (https://huggingface.co/Jiarui-Wang/MemSFT-Qwen3-OpenSWI-Memory-8B)
浏览引用此论文的6个模型 (https://huggingface.co/models?other=arxiv:2607.25614)
引用此论文的数据集 0
暂无关联此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2607.25614,即可从此页面链接到该数据集。
引用此论文的 Space 0
暂无关联此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2607.25614,即可从此页面链接到该 Space。
包含此论文的收藏集 0
暂无包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到该收藏集。
相似文章
LoRA如何记忆?面向LLM微调的参数化记忆定律
本文使用LoRA作为探针,研究了大语言模型中参数化记忆的定量极限,建立了幂律关系,并引入了一种名为MemFT的阈值引导优化方法,以提升记忆性能。
@AdinaYakup: Memtensor Research Group 发布 Metis 记忆基础模型,可能是首个将记忆内化到…的 LLM
Memtensor Research Group 发布了 Metis,这是一个 LLM 系列(4B/9B/27B),将记忆内化到骨干网络中,从而无需外部 RAG。该模型在单次前向传播中完成记忆读写,并以冻结权重的方式部署,如同标准 LLM。
自我识别微调可以预防和逆转涌现性对齐失调
本文提出自我识别微调作为一种干预措施,用于预防和逆转大语言模型中的涌现性对齐失调,表明它稳定了模型的对齐特征,而非采用失调的角色。
SimpleMem: 面向大语言模型智能体的高效终身记忆
介绍SimpleMem,一种面向LLM智能体的高效记忆框架,利用语义无损压缩提升准确率并降低token消耗,F1分数提升26.4%,推理时token使用量减少高达30倍。
DimMem:面向高效长期智能体记忆的维度结构化
DimMem 提出了一种用于 LLM 智能体的维度记忆框架,将记忆表示为具有显式字段的原子化、类型化单元,在 LoCoMo-10 和 LongMemEval-S 上实现了最先进的准确率,同时将 token 成本降低了 24%。