编辑单个神经元能否修复LLMs中的重复循环?

arXiv cs.LG 论文

摘要

本文研究了通过编辑单个神经元能否修复Gemma 4模型在长序列事实列举任务中的重复循环问题。研究发现,对少量MLP神经元进行有针对性的权重编辑可以显著减少循环故障,但无法完全消除较大模型中的末日循环(doom looping)。

arXiv:2606.13705v1 公告类型:新 摘要:是的。能治愈末日循环吗?大概不能。 Gemma 4指令调优模型存在一个可重现的失败模式:在长序列事实列举提示(例如列出电视剧的每一集、88个IAU星座或151只原始宝可梦)中,模型会陷入重复,要么是严格的逐字循环,要么是列表条目逐渐退化到单一答案。这些循环的出现率高达95%,并且能够抵御提示改写、推理引擎更改以及大多数采样调整。本文探讨这种行为是否足够局部化,从而可以通过权重编辑予以移除。为了定位原因,我们使用逐层消融和逐神经元归因,然后通过完整生成扫描确认最强候选。循环可追溯到一小部分MLP神经元(在26B-A4B混合专家模型中,则是一些路由的专家),我们通过静态权重编辑抑制这些神经元。这些“手术”可以小到单个符号反转的神经元(在E2B模型中)。有效编辑的规模随模型规模增大而增大,但在所有情况下,循环模式可以在正常生成预算下得到处理,同时保持通用基准测试分数。然而,编辑并不能解决所有问题:我们还研究了更长的思考预算,其中两个较大的模型最明显地进入末日循环,即一种非收敛状态,模型在一个无法回忆的事实上自我纠正循环,耗尽预算而无法承诺最终答案。我们表明,同样的编辑可以减少但无法消除这种残余失败,并认为这从根本上是一个知识精度问题,而非可移除的电路;权重手术可以删除一个循环,但无法提供缺失的事实。我们的结果既是可行性证明——即有证据表明具体的生成病理可以定位到少数参数并编辑移除——也是对该方法适用范围的界定。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:06

# 编辑一个神经元能修复 LLM 中的重复循环吗? 来源:https://arxiv.org/html/2606.13705 Aristotelis Lazaridis·Aman Sharma·Dylan Bates·Brian King·Vincent Lu·Jack FitzGerald Edgerunner AI research@edgerunnerai\.com ###### 摘要 是的。它能修复末日循环吗?可能不行。Gemma 4 指令微调模型存在一个可复现的故障:在长事实枚举提示(例如列出某电视连续剧的每一集、88 个IAU星座,或151个原始宝可梦)时,模型会崩溃为重复输出,要么是严格的逐字循环,要么是列表条目退化到单一答案。这些循环的发生率高达95%,并且能抵抗提示重写、推理引擎更改以及大多数采样参数调整。在本文中,我们探究这种行为是否足够局部化,从而可以通过权重编辑来消除。为了定位原因,我们使用逐层消融和逐神经元归因,然后通过完整生成扫描确认最强的候选对象。这些循环追溯到一小部分MLP神经元(或者,在26B-A4B混合专家模型中,追溯到少数路由专家),我们通过静态权重编辑来抑制它们。这些“手术”可以小到单个符号反转的神经元(在E2B模型中)。有效编辑的规模随模型规模增大而增大,但在所有情况下,这种循环模式都可以在正常的生成预算内得到解决,同时保留通用基准测试评分。然而,编辑并不能解决一切:我们还研究了更长的思考预算,在这类情况下,两个较大的模型最明显地进入末日循环,即一种非收敛状态,模型在无法回忆的事实的自纠正中兜圈子,耗尽预算而无法给出最终答案。我们表明,相同的编辑可以减少但并不能消除这种残余故障,并论证这本质上是一个知识精度问题,而非可移除的电路;权重手术可以删除一个循环,但不能补充一个缺失的事实。我们的结果既是一次可行性证明(即证据表明一种具体的生成病态可以定位到少数参数并通过编辑消除),也划定了这种方法失效的边界。 ## 1 引言 Gemma 4 模型家族在长事实枚举任务上表现出可复现的重复故障。诸如列出系列剧《火线》或《萤火虫》的剧集、列举第一代宝可梦或列出星座的提示,要求模型在生成过程中维持一个中等长度的事实序列。在默认采样配置¹(¹温度为0.7,top\_p=0.95,top\_k=64,无重复惩罚)下,基线失败率范围从较低故障率模型的约10%到gemma-4-31B-it模型在要求列出《火线》五季所有剧集的提示下的95%。这些故障不仅仅是严格的字符串重复:有时模型陷入紧密循环,锁定一个短短语并重复直到生成预算耗尽;而在其他情况下,它们保持枚举列表的表面结构,但许多条目收敛到相同的(重复的)答案。两种形式都能抵抗提示重写、推理引擎更改和大多数标准采样调整。 我们探究这些重复故障是否可以追溯到网络中紧凑、可识别的组件,以及对这些组件进行有针对性的静态权重编辑(即权重手术)是否能显著减少观察到的故障。通过逐层归因分析以及跨一系列手术操作(MLP神经元归零、符号反转、放大和专家槽掩码)的经验扫描,我们发现循环行为确实集中在所有四个研究模型网络中微小、可局部化的部分。在gemma-4-E2B-it(以下简称E2B)中,单个MLP(多层感知器)神经元修改就足以消除观察到的循环,仅带来轻微的基准代价,而双神经元变体可将该代价大致减半。在gemma-4-E4B-it(E4B)和gemma-4-31B-it(31B)中,移除了一小组MLP神经元(E4B中43万零80个神经元中的3个;31B中1100个神经元)。在gemma-4-26B-A4B-it(26B)中,一个混合专家(MoE)模型,从3840个层专家槽中屏蔽了三个路由专家位置²。²选定的编辑模型变体可在Hugging Face上获取:https://huggingface.co/edgerunner-ai/gemma-4-E2B-it-noloop https://huggingface.co/edgerunner-ai/gemma-4-E4B-it-noloop https://huggingface.co/edgerunner-ai/gemma-4-26B-A4B-it-noloop https://huggingface.co/edgerunner-ai/gemma-4-31B-it-noloop 所需编辑的规模随模型规模增大而增大:E2B中一个MLP神经元,E4B中三个,31B中1100个,26B中三个路由专家位置。这种差异反映了循环机制在整个模型家族内部组织方式的真实差异。在所有四个模型中,编辑显著减少或消除观察到的循环,同时将基准性能保持在很小的百分点差异内。这些结果旨在作为可行性证明,因为所报告的干预措施是一组有效的配置,而更系统的探索可能会产生更小、更通用或更有效的修改。 本研究的动机源于这样一个问题:高级语言模型生成故障是否可以映射到足够小的内部机制,从而可以直接编辑。我们从Kazemi等人(2026 (https://arxiv.org/html/2606.13705#bib.bib1))最近的机制可解释性工作中汲取灵感,该工作表明单个MLP神经元可以调节安全微调LLM中的拒绝轴。本着同样的精神,我们考察Gemma 4的重复故障是否具有可编辑的循环电路。对于本文研究的模型和故障模式,答案是肯定的:该机制证明足够小,可以定位、编辑并通过标准基准评估进行验证,尽管所需的具体操作因模型而异。 本研究的主要贡献如下: - •诊断Gemma 4模型家族中的循环故障模式。 - •表征两种循环表型(紧密循环和软循环),以及一种与提示无关的、用于两者的确定性循环检测器。 - •一种逐层归因方法,用于识别每个模型中最强关联于循环行为的MLP神经元和MoE专家槽。 - •跨四个Gemma 4模型的经验性权重手术可行性演示,使用多种手术操作,表明在E2B中单个MLP神经元修改足以消除故障,并且在E4B、31B和26B中类似的小规模编辑能显著减少故障。 - •对扩展生成预算下末日循环的分析:一种非收敛的自纠正状态,即使在主要循环故障被消除后,仍可能在两个较大模型中持续存在,我们认为这反映了事实知识限制,而非可通过手术移除的循环电路。 ## 2 相关工作 Holtzman等人(2020 (https://arxiv.org/html/2606.13705#bib.bib3))描述了基于似然训练的模型中重复文本退化现象,并提出了核采样。我们从机制角度解决相同现象,而不是通过解码变更。另一条互补的研究路线通过训练目标(如unlikelihood训练(Welleck等人,2020 (https://arxiv.org/html/2606.13705#bib.bib25)))来减轻重复,并通过重复标记的自我强化动态(Xu等人,2022 (https://arxiv.org/html/2606.13705#bib.bib23))和标记分布中的高流入问题(Fu等人,2021 (https://arxiv.org/html/2606.13705#bib.bib24))分析其根源;这些方法作用于数据、目标或解码层面,而我们则直接定位并编辑负责的权重。 在机制可解释性方面,Olsson等人(2022 (https://arxiv.org/html/2606.13705#bib.bib8))将归纳头识别为一种核心复制机制,其病态过度激活可能是重复吸引子的基础。Wang等人(2022 (https://arxiv.org/html/2606.13705#bib.bib9))和Conmy等人(2023 (https://arxiv.org/html/2606.13705#bib.bib10))开发了用于电路发现的因果干预方法,这启发了我们的逐层消融方法;McDougall等人(2023 (https://arxiv.org/html/2606.13705#bib.bib11))表明,GPT-2 Small中的单个注意力头介导了复制抑制,这与我们发现单个MLP神经元可以介导反循环行为相似。Elhage等人(2022 (https://arxiv.org/html/2606.13705#bib.bib16))表明特征以叠加方式存储,这使神经元级分析复杂化,然而Gurnee等人(2023 (https://arxiv.org/html/2606.13705#bib.bib14))证明单个神经元仍然可以编码可解释的高层特征,Marks等人(2025 (https://arxiv.org/html/2606.13705#bib.bib15))将电路发现扩展到细粒度稀疏特征编辑。Kovaleva等人(2021 (https://arxiv.org/html/2606.13705#bib.bib17))和Puccetti等人(2022 (https://arxiv.org/html/2606.13705#bib.bib18))表明,预训练变换器对移除极少量的异常维度(<< 0.0001% 的权重)是脆弱的,为极端的参数级敏感性建立了先例。 对于模型编辑,Meng等人(2022a (https://arxiv.org/html/2606.13705#bib.bib5))引入了因果追踪和ROME,用于有针对性的MLP权重编辑。Meng等人(2022b (https://arxiv.org/html/2606.13705#bib.bib6))将其扩展到数千次编辑,Hase等人(2023 (https://arxiv.org/html/2606.13705#bib.bib7))发现定位和最优编辑层可能不同,我们在E2B中证实了这一结果,其中通过消融识别的层与最佳干预层并不重合。Turner等人(2023 (https://arxiv.org/html/2606.13705#bib.bib12))和Zou等人(2023 (https://arxiv.org/html/2606.13705#bib.bib13))开发了推理时应用的激活空间引导方法。我们的符号反转编辑与之类似,但永久编码到静态权重中。最直接的是,Kazemi等人(2026 (https://arxiv.org/html/2606.13705#bib.bib1))证明单个MLP神经元调节安全微调LLM中的拒绝轴,启发我们探究重复故障是否类似地局部化;Wei等人(2024 (https://arxiv.org/html/2606.13705#bib.bib4))表明安全关键区域仅占约3%的参数,这与我们发现驱动循环的行为集中在FFN神经元的0.0007–0.085%中具有结构上的相似性。 ## 3 故障表型与采样控制 我们将观察到的重复行为分为两种表型。第一种是**紧密循环**:模型锁定一个短短语并逐字重新输出,重复相同的标记序列直到生成预算耗尽。第二种是**软循环**,即列表崩塌式重复:模型继续枚举列表的表面结构,但多个条目的内容崩溃到相同的答案。 - •**紧密循环**。这种表型在31B和26B模型中最为明显。在思考块中经过几百个标记后,模型可能锁定一个单词或短语(如“S1E6: The Detail ... no.”)并重复输出相同的短标记序列,直到达到最大响应长度。 - •**软循环**。这种表型在E2B、E4B和26B模型中最为明显。模型不会锁定到重复的标记序列;相反,编号的列表脚手架在句法上保持完整,而许多条目收敛到相同的项目。例如,在星座探测提示(E2B,禁用思考)上,列表正确打开前约47个条目,然后崩塌: > ... 45. Vela 46. Volans 47. Virgo 48. Volans 49. Volans ... 87. Volans 88. Volans 88个列表项中有41个是字面单词Volans。编号继续递增,保持了列表的视觉结构,但语义内容已经完全崩溃到单一答案上。 我们将这两种表型统称为**快速提交循环**:模型在第一次生成传递中就锁定到重复输出并持续到预算上限的故障。这使它们与**末日循环**区分开来,后者是一种在扩展生成预算下出现的非收敛自纠正状态,模型花费数千个标记重新审视和重新表述同一个不确定的事实,而不解决它。我们在第7.1节(https://arxiv.org/html/2606.13705#S7.SS1)中更详细地讨论末日循环。 在所有模型中,故障在不同推理引擎和框架实现中持续存在:我们在HF Transformers和vLLM上都重现了它们,以排除实现特定的原因。它们在提示重写下以及启用或禁用Gemma 4多标记预测(MTP)起草器时也持续存在。然而,大多数采样更改并不能消除这种行为。至少为1.15的重复惩罚可以在某些情况下减少重复,但这并不是一个可靠的解决方案,因为它可能降低无关的生成行为。例如,在E4B模型上,将重复惩罚增加到1.30会破坏代码生成:30个Rust代码生成提示中有22个达到最大输出长度,且语法逐渐退化。下面给出了一个退化的Rust代码生成示例: writeln\!\(stdout\(\),"\\nINFERENCESTATUS:"\)?\)?; writeln\!\(stdout\(\),"\-\-\-\-\-\-\-\-\-\-\-\-\-\-\-"\)?; writable\!\(cout,Cursor::Cyan\)\(concat\!\("ActiveRequests:",inf\.in\_flight\_requests\)\)?; writable\!\(cout,Cursor::Magenta\)\(concat\!\("AvgThroughput:",nf\!\(inf\.avg\_tokens\_per\_second,"\.1"\)\)\)?; writable\!\(cout,Cursor::White\)\(concat\!\("LatestIDFound:",&\(nf\!\(inf 在这个例子中,模型已偏离到虚构的语法:writable\!不是一个Rust宏;它是一个幻觉替代品,在writeln\!因重复出现而被惩罚后产生。同样的效果在拒绝语言中可见:在repetition\_penalty=1.30时,“I cannot help with that”变成“I cannot help with thus”或“I cannot assist with such”,因为标准措辞在重复使用后受到惩罚。在repetition\_penalty=1.15和基线值1.00时,我们的测试中代码生成不受影响。在我们的Rust测试中,在31B模型上未观察到这种副作用,但我们预计同样的机制会在其他提示或模型上显现,其中习惯用法的标记余量较小。更广泛地说,重复惩罚的副作用依赖于工作负载和模型,这使其成为不可靠的通用解决方案。所选的权重编辑针对驱动循环的内部机制,并在repetition\_penalty=1.0下运行,完全避免了这种权衡。完整的定量结果在附录D(https://arxiv.org/html/2606.13705#A4)中报告。 ## 4 方法论 - 实验设置 本节描述我们用于触发循环的提示套件、循环检测机制、基于激活的定位程序以及贯穿全文使用的评估基准协议。 我们使用一套八个**枚举探测**(或**触发器**),即要求模型生成长度足够的事实列表以暴露上述故障模式(例如,命名一个电视连续剧的剧集,或列举一个固定的科学类别)的提示。每个探测的完整提示文本、枚举目标和故障模式角色见附录A(https://arxiv.org/html/2606.13705#A1)。八个探测标识符为: - •firefly\_list - •wire\_episodes - •pokemon\_gen1 - •mcu\_films - •noble\_gases - •constellations - •us\_presidents - •eu\_member\_states 对于每个模型变体,循环扫描包括这8个探测 × 8个种子 × 2种思考模式(思考未完整,但翻译应保持原文结构)

相似文章

大型语言模型中记忆缓解的输出向量编辑

arXiv cs.CL

提出输出向量编辑,一种约束优化的权重编辑方法,通过修改MLP神经元的输出向量而不是将激活归零来缓解LLM中的记忆化,实现了高达87.9%的抑制效果,且局部性失败极少。