混合大语言模型中的注意力遗忘:思维链微调如何破坏长程记忆及其修复方法
摘要
本文发现,在混合线性注意力模型中,思维链监督微调通过将注意力梯度偏向短程模式,从而降低长上下文召回能力,并提出QK-Restore——一种无需训练的方法,可在保留推理性能的同时恢复长上下文召回。
查看缓存全文
缓存时间: 2026/06/10 05:44
论文页面 - 混合LLM中的注意力遗忘:当CoT微调破坏长程召回时,以及如何修复
来源:https://huggingface.co/papers/2606.11052 发布于 6月9日
·
由 https://huggingface.co/xinyu04
Zhou (https://huggingface.co/xinyu04) 于 6月10日提交
摘要
思维链监督微调通过将注意力梯度偏向短程模式,削弱了混合线性注意力模型的长上下文召回能力,但一种名为 QK-Restore 的无训练方法可以通过恢复查询-键投影来恢复长上下文能力,同时保持推理性能。
思维链(CoT)监督微调(SFT)被广泛用于提升推理能力,但我们发现它系统性地削弱了混合线性注意力模型的长上下文召回能力。在包括 HypeNet 和 Jet-Nemotron 在内的多种架构中,CoT-SFT 导致“大海捞针”(NIAH)任务上的检索性能大幅下降,且下降幅度在更困难的检索设置和更长的上下文窗口下更为严重。例如,HypeNet-9B 在 NIAH-S2@256K 上的性能从 67.2% 降至 9.4%。我们将其归因于 CoT-SFT 将注意力梯度偏向短程模式,从而破坏了负责长程路由的查询-键投影(W_Q、W_K)。基于这一观察,我们提出了 QK-Restore,一种无训练方法,仅从 SFT 前的检查点恢复 W_Q 和 W_K,同时保留所有其他 SFT 后的参数。我们还引入了一种 Procrustes 变体,以在路由保持和推理适应之间取得平衡。在多种架构上,QK-Restore 在零训练成本下一致地恢复长上下文能力,同时保持推理性能;例如,在 HypeNet-5B 上,它将 S3@256K 从 65.4% 提升至 76.4%,同时保持强劲的推理性能。
查看 arXiv 页面 (https://arxiv.org/abs/2606.11052)查看 PDF (https://arxiv.org/pdf/2606.11052)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11052)
在您的 Agent 中获取此论文:
hf papers read 2606.11052
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。
引用此论文的数据集0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。
引用此论文的 Spaces0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。
包含此论文的收藏集0
暂无收藏集包含此论文
请将此论文添加至一个收藏集 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
重新思考高效注意力在混合架构中的作用
本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。
基于代理上下文的链式思维微调长上下文推理
提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。
LongAct:利用内在激活模式进行长上下文强化学习
LongAct 提出了一种显著性引导的稀疏更新策略,通过选择性更新与查询和键向量中高幅值激活相关的权重来改进 LLMs 的长上下文推理能力,在 LongBench v2 上实现了约 8% 的提升。
更少的上下文,更高的准确性:一种用于LLM代理的双时态记忆引擎,其中精简检索的上下文胜过了完整历史
本文介绍了Engram,一个开源的用于LLM代理的双时态记忆引擎,它通过检索一个紧凑的上下文片段(约9.6k token),在LongMemEval上以混合读取路径融合稠密、词汇、图和时间信号,比完整历史基线(79k token)高出10.4个准确率点。
@omarsar0:新论文值得一读。(收藏)基本思路是将压缩循环状态与一个小型精确记忆配…
HOLA(海马体线性注意力)受海马记忆启发,通过一个有界的精确KV缓存增强线性注意力,在不牺牲效率的情况下改善长程召回和困惑度。在340M参数规模下,它在Wikitext上优于全注意力Transformer,并在高达32k token的范围内实现稳健的针召回。