混合大语言模型中的注意力遗忘:思维链微调如何破坏长程记忆及其修复方法
摘要
本文发现,在混合线性注意力模型中,思维链监督微调通过将注意力梯度偏向短程模式,从而降低长上下文召回能力,并提出QK-Restore——一种无需训练的方法,可在保留推理性能的同时恢复长上下文召回。
查看缓存全文
缓存时间: 2026/06/10 05:44
论文页面 - 混合LLM中的注意力遗忘:当CoT微调破坏长程召回时,以及如何修复
来源:https://huggingface.co/papers/2606.11052 发布于 6月9日
·
由 https://huggingface.co/xinyu04
Zhou (https://huggingface.co/xinyu04) 于 6月10日提交
摘要
思维链监督微调通过将注意力梯度偏向短程模式,削弱了混合线性注意力模型的长上下文召回能力,但一种名为 QK-Restore 的无训练方法可以通过恢复查询-键投影来恢复长上下文能力,同时保持推理性能。
思维链(CoT)监督微调(SFT)被广泛用于提升推理能力,但我们发现它系统性地削弱了混合线性注意力模型的长上下文召回能力。在包括 HypeNet 和 Jet-Nemotron 在内的多种架构中,CoT-SFT 导致“大海捞针”(NIAH)任务上的检索性能大幅下降,且下降幅度在更困难的检索设置和更长的上下文窗口下更为严重。例如,HypeNet-9B 在 NIAH-S2@256K 上的性能从 67.2% 降至 9.4%。我们将其归因于 CoT-SFT 将注意力梯度偏向短程模式,从而破坏了负责长程路由的查询-键投影(W_Q、W_K)。基于这一观察,我们提出了 QK-Restore,一种无训练方法,仅从 SFT 前的检查点恢复 W_Q 和 W_K,同时保留所有其他 SFT 后的参数。我们还引入了一种 Procrustes 变体,以在路由保持和推理适应之间取得平衡。在多种架构上,QK-Restore 在零训练成本下一致地恢复长上下文能力,同时保持推理性能;例如,在 HypeNet-5B 上,它将 S3@256K 从 65.4% 提升至 76.4%,同时保持强劲的推理性能。
查看 arXiv 页面 (https://arxiv.org/abs/2606.11052)查看 PDF (https://arxiv.org/pdf/2606.11052)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11052)
在您的 Agent 中获取此论文:
hf papers read 2606.11052
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。
引用此论文的数据集0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。
引用此论文的 Spaces0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。
包含此论文的收藏集0
暂无收藏集包含此论文
请将此论文添加至一个收藏集 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
学习如何遗忘:针对长上下文稀疏注意力的微调
本文提出了一种新方法,用于对具有稀疏注意力的transformer语言模型进行微调,以实现高效的长上下文推理,通常优于使用精确注意力训练的模型,并介绍了高效的实现和一个新的开源库。
重新思考高效注意力在混合架构中的作用
本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。
基于代理上下文的链式思维微调长上下文推理
提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。
LongAct:利用内在激活模式进行长上下文强化学习
LongAct 提出了一种显著性引导的稀疏更新策略,通过选择性更新与查询和键向量中高幅值激活相关的权重来改进 LLMs 的长上下文推理能力,在 LongBench v2 上实现了约 8% 的提升。
选择性遗忘:一个基于图的长期LLM代理记忆框架
本文评估了一个面向长期LLM代理的基于图的记忆框架,发现该框架在召回指标上并不优于扁平向量检索,但选择性遗忘模块能以最小性能损失有效减少存储。