大型语言模型中记忆缓解的输出向量编辑
摘要
提出输出向量编辑,一种约束优化的权重编辑方法,通过修改MLP神经元的输出向量而不是将激活归零来缓解LLM中的记忆化,实现了高达87.9%的抑制效果,且局部性失败极少。
arXiv:2606.18767v1 公告类型:新
摘要:大型语言模型会记忆并复现训练数据中的序列,从而带来隐私、版权和安全风险。现有的神经元级缓解方法将编辑等同于将神经元激活归零,但激活仅控制神经元是否参与;输出向量才是写入残差流的内容,并通过叠加编码多个特征。我们提出输出向量编辑,一种约束优化的权重编辑方法,定位一组负责记忆化续写的小型MLP神经元,并最小限度地修改它们的输出向量,以在词汇空间中引入干扰项,从而重定向其对残差流的贡献,同时保持激活不变。在四个参数量从360M到7B的模型(SmolLM-360M、OLMo-1B、OLMo-7B、Llama2-7B)上进行评估时,我们主要关注OLMo-7B(其开放权重和预训练语料库支持系统性挖掘),并挖掘了6831个记忆化序列,实现了高达87.9%的抑制效果。与对相同定位神经元进行零消融相比,2.7倍的差距表明抑制来自输出向量编辑,而不仅仅是定位。四种编辑模式覆盖了从积极抑制到最小重定向的光谱;集成使用时覆盖了96.5%的记忆化序列,而我们推荐的单一模式配置达到了81.5%,且没有灾难性的局部性失败。我们进一步发现了一个机制边界:约14%的序列无法通过仅MLP编辑到达;虽然这些失败总体上并非由注意力驱动,但消融贡献最大的注意力头可恢复其中60–64%的序列,且对从前缀复制token的续写恢复更强,从而将注意力定位为互补的回退机制而非主要机制。编辑模式的顺序以及成功与局部性之间的权衡在四个模型间迁移,成功率随模型大小而非家族而缩放。
查看缓存全文
缓存时间: 2026/06/18 05:46
# 大型语言模型中用于缓解记忆问题的输出向量编辑 来源:https://arxiv.org/html/2606.18767 Ahmad Dawar Hakimi¹,²,³,\*, Kaiwei Lei¹,\*, Isabelle Augenstein², ⁴, Hinrich Schütze¹,³ 1 慕尼黑大学信息与语言处理中心,德国 2 哥本哈根大学计算机科学系,丹麦 3 慕尼黑机器学习中心,德国 4 丹麦人工智能先锋中心 [email protected] \* 同等贡献 ###### 摘要 大型语言模型会记忆并复现训练数据中的序列,从而带来隐私、版权和安全风险。现有的神经元级缓解方法将编辑等同于将神经元激活置零,但激活仅控制神经元是否参与;输出向量才是写入残差流的内容,并通过叠加编码多个特征。我们提出输出向量编辑,一种约束优化的权重编辑方法:找到负责记忆续写的少量MLP神经元,最小程度地修改它们的输出向量,在词汇空间中引入一个干扰项,从而重定向其对残差流的贡献,同时保持激活不变。我们在四个模型(SmolLM-360M、OLMo-1B、OLMo-7B、Llama2-7B)上进行评估,参数规模从360M到7B不等;我们以OLMo-7B为中心(其开源权重和预训练语料库支持系统性挖掘),挖掘出6,831条记忆序列,最高达到87.9%的抑制率。在同一组定位神经元上,我们的方法与零消融相比有2.7倍的差距,说明抑制效果来自输出向量编辑本身,而非仅凭定位。四种编辑模式涵盖从激进抑制到最小重定向的光谱;组合使用时覆盖96.5%的记忆序列,而我们推荐的单一模式配置可达81.5%且没有灾难性的局部性失败。我们进一步识别了一个机制边界:约14%的序列无法通过仅MLP编辑处理;虽然这些失败总体上并非由注意力驱动,但消融贡献最大的注意力头可恢复其中60–64%,对从前缀复制token的续写恢复更强,因此注意力可作为互补的后备机制而非主要机制。编辑模式的排序以及成功-局部性的权衡在所有四个模型上具有迁移性,成功率随模型规模扩大而非模型家族增加。 ## 1 引言 参见图1标题 图1:对MLP层ℓ中索引为i的记忆神经元进行的三种干预。提示:“It is a truth universally acknowledged, that a”。(A) 原始模型将目标神经元的输出向量v_i路由到残差流中,产生逐字续写。(B) 将激活置零 (a_i=0) 无法抑制记忆。(C) 我们的方法保留激活 (a_i>0) 并应用约束优化的权重编辑 v_i → v′_i,生成流畅的新颖续写。 大型语言模型会记忆并复现训练数据中的序列 (Carlini等, 2021, 2023),从而带来具体风险:模型复述敏感材料导致隐私泄露、逐字复制引发版权侵权、以及可通过对抗性提取利用的安全漏洞 (Hartmann等, 2023; Schwinn等, 2023)。现有的缓解策略作用于不同的干预点:训练时预防 (Lee等, 2022; Hans等, 2024) 需要完全重新训练且无法追溯应用;事后遗忘会改变全局模型行为,但底层编码保持不变,允许良性重学习恢复被抑制的内容 (Hu等, 2025);解码器层过滤 (Ippolito等, 2023) 在输出层而非在记忆内容的表示所在的权重上进行干预。定位然后编辑范式 (Dai等, 2022; Meng等, 2022, 2023) 识别负责的模型组件并进行精确修改,在处理存储为三元组的事实知识方面取得了强劲结果。这些方法依赖于稳定的输入模板,该模板指定一个特定的答案位置,从而允许它们定位模型的决策点并将其重写为特定的替代项。序列记忆不具备这种结构:前缀是自由形式的,记忆承诺逐字续写的位置必须被发现,并且没有规范的替代项来重写模型。因此,先前关于记忆的神经元级工作只保留了范式中的定位一半,将编辑一半简化为置零或移除定位到的神经元 (Maini等, 2023; Chang等, 2024)。我们认为这种退化是不必要且具有破坏性的。单个神经元通过叠加参与多个特征的表示 (Cunningham等, 2023),将其激活置零并不能精确移除记忆内容;它会破坏该神经元编码的一切。 我们提出输出向量编辑 (图1C),一种权重层级的干预方法,修改与记忆续写相关的MLP神经元的输出向量v_i。其闭式解是沿着所选“干扰token”的解嵌入方向进行的秩一更新,将ROME (Meng等, 2022) 的秩一权重更新机制从矩阵级事实编辑适配为每个神经元的输出重定向。与激活引导 (Suri等, 2025) 不同——它在每次前向传播时从残差流中减去一个固定方向——我们的编辑对每个记忆序列只计算一次并直接应用于权重;推理时模型运行不变。 我们的贡献有两方面。(i) 我们展示了MLP神经元中激活和输出向量扮演着可分离的角色,并且修改输出向量以引入干扰项是一种不同于先前神经元级工作所采用的激活置零的独立干预。(ii) 我们评估了4种编辑模式(改变干扰项:序列结束、红色标记、次优、直接抑制目标),在4个参数从360M到7B的模型上,与零消融、随机神经元和激活引导基线进行比较。我们聚焦于OLMo-7B(完全开放的权重和训练语料库),从其预训练语料库中挖掘出6,831条记忆序列。先前的神经元级编辑工作使用单一模型,最多约500条序列,且局部性覆盖有限 (Chang等, 2024)。三个发现如下: 成功-局部性权衡具有3个工作点:保守编辑(红色标记,抑制率31.7%)几乎无局部性代价;实用编辑(次优,k=5,抑制率81.5%)无灾难性编辑;激进编辑(EOS,抑制率87.9%)在少量编辑中产生尾部风险。 模式互补性:四种编辑模式并非冗余:每种模式在其他模式失败的序列上成功。组合覆盖96.5%的记忆序列,次优模式独特地抑制了161条其他模式无法触及的序列。 基于MLP编辑的机制边界:约14%的记忆序列抵抗所有基于MLP的配置。注意力层分析显示这些失败并非整体由注意力驱动,但在目标位置消融贡献最大的注意力头可恢复其中60–64%,将注意力定位为互补的后备机制而非主要机制,并激励混合MLP加注意力的流水线。 ## 2 相关工作 **MLP神经元作为知识存储。** MLP作为键值记忆:神经元在特定输入模式上激活,并通过输出向量写入残差流 (Geva等, 2021)。神经元是多语义的,通过叠加编码多个特征 (Gurnee等, 2023; Cunningham等, 2023),其输出向量在词汇空间中促进特定token (Geva等, 2022)。我们的定位通过L1邻近性扩展了基于相似性的归因 (Ferrando和Voita, 2024);我们的编辑是对输出向量应用秩一更新,而非将激活置零。 **定位然后编辑用于事实知识。** ROME (Meng等, 2022) 和 MEMIT (Meng等, 2023) 对MLP层应用秩一权重更新;改进包括知识神经元 (Dai等, 2022) 和几何编辑 (Feng等, 2025)。所有这些方法都假设序列记忆所缺乏的结构(§1)。事实编辑在大规模应用时会降低模型质量 (Yang等, 2024; Gupta等, 2024, 2025),这激励了我们的每编辑设计并配合权重恢复。 **记忆的机制理解。** 逐字记忆 (Carlini等, 2023; Huang等, 2024) 由训练数据重复和模型规模驱动 (Meeus等, 2024; Wuhrmann等, 2025)。机制研究将其定位到各层和电路 (Haviv等, 2023; Stoehr等, 2024; Lasy等, 2025)。Maini等 (2023) 将记忆定位到约5个神经元,Chang等 (2024) 训练二进制掩码识别负责的神经元;两者都将编辑等同于置零激活,丢弃了神经元编码的一切。我们改为编辑输出向量。 **记忆缓解。** 训练时预防 (Lee等, 2022; Kandpal等, 2022; Hans等, 2024) 需要重新训练(§1)。解码时过滤 (Ippolito等, 2023) 在每次前向传播时过滤训练集n-gram,不修改权重,但在推理时增加运行时开销。输出向量编辑不会增加推理成本。事后遗忘和偏好方法 (Kassem等, 2023; Chen等, 2025; Yao等, 2024) 改变全局模型行为而非针对存储内容,留下底层编码可在良性重学习下恢复 (Hu等, 2025)。神经元和特征层干预会剪枝神经元 (Sakarvadia等, 2025; Liu等, 2025) 或钳制SAE特征 (Zhang等, 2026),后者需要预训练的稀疏自编码器。激活引导 (Suri等, 2025) 是我们方法最接近的邻居,它从残差流中减去一个记忆方向,但无论输入内容如何都对每个输入应用相同的干预,局部性代价更高(§5.1)。我们的方法是权重级、序列级、无梯度的,编辑输出向量而非置零激活。 ## 3 方法 ### 3.1 为什么编辑输出向量而不是激活? MLP层的输出可以分解为每个神经元贡献的总和 (Geva等, 2021; Cunningham等, 2023): \text{MLP}(x) = \sum_{i=1}^{d_{\text{mlp}}} a_i \cdot v_i (1) 其中 a_i 是神经元 i 在非线性激活后的标量激活,v_i ∈ R^d 是其输出向量(W_out 的第 i 列)。对于 SwiGLU MLP,a_i = (x W_in)_i · SiLU((x W_gate)_i),其中 SiLU(z) = z·σ(z),我们通过 TransformerLens (Nanda and Bloom, 2022) 的 hook_post(非线性后缓存点)读取。将激活置零 (a_i=0) 会消除神经元对残差流的贡献。然而,单个神经元的输出向量可以编码多条不同的信息,这是叠加的结果 (Cunningham等, 2023):因为网络表示的 feature 数量多于神经元数量,一个输出向量可以编码多个语义方向(这些方向可以对应不同的 token)。(附录M 通过 OLMo-7B 单个神经元的激活修补说明了这一点。) 我们的方法利用这一点:我们不将激活置零(这会丢弃完整的贡献以及其中编码的所有方向和 token),而是编辑输出向量以重定向一个编码的 token,同时保持激活和其他编码内容不变。 ### 3.2 记忆序列挖掘 由于不同模型记忆不同的序列,我们直接从每个模型的预训练语料库中挖掘记忆内容。遵循 Carlini 等 (2023) 的方法,我们使用教师强制预测;教师强制和自回归输出在第一个续写 token 上一致,这也是我们编辑的目标,而教师强制为更长的续写提供了上界。对于 OLMo-7B(我们分析的重点),我们扫描了 Dolma v1.7 (Soldaini等, 2024) 的 Books 和 CC-En-Head 分区;完整扫描统计见附录A。对于跨模型评估,我们对每个模型自己的语料库(OLMo-1B 使用 Dolma v1.7;SmolLM-360M 使用 smollm-corpus)以及当原始语料未公开时的社区标准代理(Llama2-7B 使用 SlimPajama-6B)应用相同流程;细节见附录G.2。我们在每个句子上滑动一个20 token 的窗口,如果窗口级 BLEU 与真实值大于 0.5,则将其分类为记忆序列,并保留 BLEU 最高的位置 p*。上下文前缀是 x_{0..p*},续写是 x_{p*+1..p*+5}。我们要求所有 5 个续写 token 都逐字匹配(即 δ=1),但如果并非全部 5 个都超过阈值,则可使用更少的 token;我们保留 δ>0.2 的序列,或如果不足 5 个 token 满足条件则使用更少。 (后续部分待续,但根据翻译规则我们只需翻译给定的内容。给定的内容到此为止。) 注意:由于原文在“我们保留 δ>0.2 的序列”处似乎被截断,我们按照所给的文本翻译,不补充未给出的部分。# 大型语言模型中用于缓解记忆问题的输出向量编辑 来源:https://arxiv.org/html/2606.18767 Ahmad Dawar Hakimi¹,²,³,\*, Kaiwei Lei¹,\*, Isabelle Augenstein²,⁴, Hinrich Schütze¹,³ 1 慕尼黑大学信息与语言处理中心,德国 2 哥本哈根大学计算机科学系,丹麦 3 慕尼黑机器学习中心,德国 4 丹麦人工智能先锋中心 [email protected] \* 同等贡献 ###### 摘要 大型语言模型会记忆并复现训练数据中的序列,从而带来隐私、版权和安全风险。现有的神经元级缓解方法将编辑等同于将神经元激活置零,但激活仅控制神经元是否参与;输出向量才是写入残差流的内容,并通过叠加编码多个特征。我们提出输出向量编辑,一种约束优化的权重编辑方法:找到负责记忆续写的少量MLP神经元,最小程度地修改它们的输出向量,在词汇空间中引入一个干扰项,从而重定向其对残差流的贡献,同时保持激活不变。我们在四个模型(SmolLM-360M、OLMo-1B、OLMo-7B、Llama2-7B)上进行评估,参数规模从360M到7B不等;我们以OLMo-7B为中心(其开源权重和预训练语料库支持系统性挖掘),挖掘出6,831条记忆序列,最高达到87.9%的抑制率。在同一组定位神经元上,我们的方法与零消融相比有2.7倍的差距,说明抑制效果来自输出向量编辑本身,而非仅凭定位。四种编辑模式涵盖从激进抑制到最小重定向的光谱;组合使用时覆盖96.5%的记忆序列,而我们推荐的单一模式配置可达81.5%且没有灾难性的局部性失败。我们进一步识别了一个机制边界:约14%的序列无法通过仅MLP编辑处理;虽然这些失败总体上并非由注意力驱动,但消融贡献最大的注意力头可恢复其中60–64%,对从前缀复制token的续写恢复更强,因此注意力可作为互补的后备机制而非主要机制。编辑模式的排序以及成功-局部性的权衡在所有四个模型上具有迁移性,成功率随模型规模扩大而非模型家族增加。 ## 1 引言 参见图1标题 图1:对MLP层ℓ中索引为i的记忆神经元进行的三种干预。提示:“It is a truth universally acknowledged, that a”。(A) 原始模型将目标神经元的输出向量v_i路由到残差流中,产生逐字续写。(B) 将激活置零 (a_i=0) 无法抑制记忆。(C) 我们的方法保留激活 (a_i>0) 并应用约束优化的权重编辑 v_i → v′_i,生成流畅的新颖续写。 大型语言模型会记忆并复现训练数据中的序列 (Carlini等, 2021, 2023),从而带来具体风险:模型复述敏感材料导致隐私泄露、逐字复制引发版权侵权、以及可通过对抗性提取利用的安全漏洞 (Hartmann等, 2023; Schwinn等, 2023)。现有的缓解策略作用于不同的干预点:训练时预防 (Lee等, 2022; Hans等, 2024) 需要完全重新训练且无法追溯应用;事后遗忘会改变全局模型行为,但底层编码保持不变,允许良性重学习恢复被抑制的内容 (Hu等, 2025);解码器层过滤 (Ippolito等, 2023) 在输出层而非在记忆内容的表示所在的权重上进行干预。定位然后编辑范式 (Dai等, 2022; Meng等, 2022, 2023) 识别负责的模型组件并进行精确修改,在处理存储为三元组的事实知识方面取得了强劲结果。这些方法依赖于稳定的输入模板,该模板指定一个特定的答案位置,从而允许它们定位模型的决策点并将其重写为特定的替代项。序列记忆不具备这种结构:前缀是自由形式的,记忆承诺逐字续写的位置必须被发现,并且没有规范的替代项来重写模型。因此,先前关于记忆的神经元级工作只保留了范式中的定位一半,将编辑一半简化为置零或移除定位到的神经元 (Maini等, 2023; Chang等, 2024)。我们认为这种退化是不必要且具有破坏性的。单个神经元通过叠加参与多个特征的表示 (Cunningham等, 2023),将其激活置零并不能精确移除记忆内容;它会破坏该神经元编码的一切。 我们提出输出向量编辑 (图1C),一种权重层级的干预方法,修改与记忆续写相关的MLP神经元的输出向量v_i。其闭式解是沿着所选“干扰token”的解嵌入方向进行的秩一更新,将ROME (Meng等, 2022) 的秩一权重更新机制从矩阵级事实编辑适配为每个神经元的输出重定向。与激活引导 (Suri等, 2025) 不同——它在每次前向传播时从残差流中减去一个固定方向——我们的编辑对每个记忆序列只计算一次并直接应用于权重;推理时模型运行不变。 我们的贡献有两方面。(i) 我们展示了MLP神经元中激活和输出向量扮演着可分离的角色,并且修改输出向量以引入干扰项是一种不同于先前神经元级工作所采用的激活置零的独立干预。(ii) 我们评估了4种编辑模式(改变干扰项:序列结束、红色标记、次优、直接抑制目标),在4个参数从360M到7B的模型上,与零消融、随机神经元和激活引导基线进行比较。我们聚焦于OLMo-7B(完全开放的权重和训练语料库),从其预训练语料库中挖掘出6,831条记忆序列。先前的神经元级编辑工作使用单一模型,最多约500条序列,且局部性覆盖有限 (Chang等, 2024)。三个发现如下: 成功-局部性权衡具有3个工作点:保守编辑(红色标记,抑制率31.7%)几乎无局部性代价;实用编辑(次优,k=5,抑制率81.5%)无灾难性编辑;激进编辑(EOS,抑制率87.9%)在少量编辑中产生尾部风险。 模式互补性:四种编辑模式并非冗余:每种模式在其他模式失败的序列上成功。组合覆盖96.5%的记忆序列,次优模式独特地抑制了161条其他模式无法触及的序列。 基于MLP编辑的机制边界:约14%的记忆序列抵抗所有基于MLP的配置。注意力层分析显示这些失败并非整体由注意力驱动,但在目标位置消融贡献最大的注意力头可恢复其中60–64%,将注意力定位为互补的后备机制而非主要机制,并激励混合MLP加注意力的流水线。 ## 2 相关工作 **MLP神经元作为知识存储。** MLP作为键值记忆:神经元在特定输入模式上激活,并通过输出向量写入残差流 (Geva等, 2021)。神经元是多语义的,通过叠加编码多个特征 (Gurnee等, 2023; Cunningham等, 2023),其输出向量在词汇空间中促进特定token (Geva等, 2022)。我们的定位通过L1邻近性扩展了基于相似性的归因 (Ferrando和Voita, 2024);我们的编辑是对输出向量应用秩一更新,而非将激活置零。 **定位然后编辑用于事实知识。** ROME (Meng等, 2022) 和 MEMIT (Meng等, 2023) 对MLP层应用秩一权重更新;改进包括知识神经元 (Dai等, 2022) 和几何编辑 (Feng等, 2025)。所有这些方法都假设序列记忆所缺乏的结构(§1)。事实编辑在大规模应用时会降低模型质量 (Yang等, 2024; Gupta等, 2024, 2025),这激励了我们的每编辑设计并配合权重恢复。 **记忆的机制理解。** 逐字记忆 (Carlini等, 2023; Huang等, 2024) 由训练数据重复和模型规模驱动 (Meeus等, 2024; Wuhrmann等, 2025)。机制研究将其定位到各层和电路 (Haviv等, 2023; Stoehr等, 2024; Lasy等, 2025)。Maini等 (2023) 将记忆定位到约5个神经元,Chang等 (2024) 训练二进制掩码识别负责的神经元;两者都将编辑等同于置零激活,丢弃了神经元编码的一切。我们改为编辑输出向量。 **记忆缓解。** 训练时预防 (Lee等, 2022; Kandpal等, 2022; Hans等, 2024) 需要重新训练(§1)。解码时过滤 (Ippolito等, 2023) 在每次前向传播时过滤训练集n-gram,不修改权重,但在推理时增加运行时开销。输出向量编辑不会增加推理成本。事后遗忘和偏好方法 (Kassem等, 2023; Chen等, 2025; Yao等, 2024) 改变全局模型行为而非针对存储内容,留下底层编码可在良性重学习下恢复 (Hu等, 2025)。神经元和特征层干预会剪枝神经元 (Sakarvadia等, 2025; Liu等, 2025) 或钳制SAE特征 (Zhang等, 2026),后者需要预训练的稀疏自编码器。激活引导 (Suri等, 2025) 是我们方法最接近的邻居,它从残差流中减去一个记忆方向,但无论输入内容如何都对每个输入应用相同的干预,局部性代价更高(§5.1)。我们的方法是权重级、序列级、无梯度的,编辑输出向量而非置零激活。 ## 3 方法 ### 3.1 为什么编辑输出向量而不是激活? MLP层的输出可以分解为每个神经元贡献的总和 (Geva等, 2021; Cunningham等, 2023): \text{MLP}(x) = \sum_{i=1}^{d_{\text{mlp}}} a_i \cdot v_i (1) 其中 a_i 是神经元 i 在非线性激活后的标量激活,v_i ∈ R^d 是其输出向量(W_out 的第 i 列)。对于 SwiGLU MLP,a_i = (x W_in)_i · SiLU((x W_gate)_i),其中 SiLU(z) = z·σ(z),我们通过 TransformerLens (Nanda and Bloom, 2022) 的 hook_post(非线性后缓存点)读取。将激活置零 (a_i=0) 会消除神经元对残差流的贡献。然而,单个神经元的输出向量可以编码多条不同的信息,这是叠加的结果 (Cunningham等, 2023):因为网络表示的 feature 数量多于神经元数量,一个输出向量可以编码多个语义方向(这些方向可以对应不同的 token)。(附录M 通过 OLMo-7B 单个神经元的激活修补说明了这一点。) 我们的方法利用这一点:我们不将激活置零(这会丢弃完整的贡献以及其中编码的所有方向和 token),而是编辑输出向量以重定向一个编码的 token,同时保持激活和其他编码内容不变。 ### 3.2 记忆序列挖掘 由于不同模型记忆不同的序列,我们直接从每个模型的预训练语料库中挖掘记忆内容。遵循 Carlini 等 (2023) 的方法,我们使用教师强制预测;教师强制和自回归输出在第一个续写 token 上一致,这也是我们编辑的目标,而教师强制为更长的续写提供了上界。对于 OLMo-7B(我们分析的重点),我们扫描了 Dolma v1.7 (Soldaini等, 2024) 的 Books 和 CC-En-Head 分区;完整扫描统计见附录A。对于跨模型评估,我们对每个模型自己的语料库(OLMo-1B 使用 Dolma v1.7;SmolLM-360M 使用 smollm-corpus)以及当原始语料未公开时的社区标准代理(Llama2-7B 使用 SlimPajama-6B)应用相同流程;细节见附录G.2。我们在每个句子上滑动一个20 token 的窗口,如果窗口级 BLEU 与真实值大于 0.5,则将其分类为记忆序列,并保留 BLEU 最高的位置 p*。上下文前缀是 x_{0..p*},续写是 x_{p*+1..p*+5}。我们要求所有 5 个续写 token 都逐字匹配(即 δ=1),但如果并非全部 5 个都超过阈值,则可使用更少的 token;我们保留 δ>0.2 的序列,或如果不足 5 个 token 满足条件则使用更少。
相似文章
编辑单个神经元能否修复LLMs中的重复循环?
本文研究了通过编辑单个神经元能否修复Gemma 4模型在长序列事实列举任务中的重复循环问题。研究发现,对少量MLP神经元进行有针对性的权重编辑可以显著减少循环故障,但无法完全消除较大模型中的末日循环(doom looping)。
体积微小,效果显著:大语言模型中的缩放向量研究
本文系统地研究了LLM归一化层中的缩放向量,揭示了它们通过自放大预条件效应优化训练,并提出了三种轻量级改进方案,在几乎不增加开销的情况下提升性能和扩展行为。
大型语言模型多语言知识编辑的合并方法:一项实证探索
本文对大型语言模型中多语言知识编辑的向量合并方法进行了实证评估,发现共享协方差的向量求和是最可靠的策略,并指出任务奇异向量合并(TSVM)在减少多语言干扰方面的效果有限。
Δ-Mem:大型语言模型的高效在线记忆
提出 delta-Mem,一种轻量级在线记忆机制,利用紧凑状态矩阵并通过增量规则学习进行更新,以提升冻结大型语言模型的长上下文性能,无需全量微调或上下文扩展。
基于Gated Singular Vector Shrinkage的选择性知识编辑逆转
本文提出了一种基于频谱的框架,用于在大语言模型中选择性逆转知识编辑,允许移除有害编辑同时保留有益编辑。