混合大语言模型中的注意力遗忘:思维链微调如何破坏长程记忆及其修复方法

Hugging Face Daily Papers 论文

摘要

本文发现,在混合线性注意力模型中,思维链监督微调通过将注意力梯度偏向短程模式,从而降低长上下文召回能力,并提出QK-Restore——一种无需训练的方法,可在保留推理性能的同时恢复长上下文召回。

思维链(CoT)监督微调(SFT)被广泛用于提升推理能力,然而我们发现它会在混合线性注意力模型中系统性地降低长上下文召回能力。在包括HypeNet和Jet-Nemotron在内的多种架构中,经过CoT-SFT后,Needle-In-A-Haystack(NIAH)上的检索性能大幅下降,且检索难度越高、上下文窗口越长,退化越严重。例如,HypeNet-9B在NIAH-S2@256K上的性能从67.2%降至9.4%。我们认为这是由于CoT-SFT将注意力梯度偏向短程模式,扰乱了负责长程路由的查询-键投影(W_Q, W_K)。基于这一发现,我们提出QK-Restore——一种无需训练的方法,仅从SFT前的检查点恢复W_Q和W_K,同时保留所有SFT后的其他参数。我们还引入了一种Procrustes变体,以平衡路由保留与推理适应。在多种架构上,QK-Restore在零训练成本下持续恢复长上下文能力,同时保持推理性能;例如,在HypeNet-5B上,它使S3@256K从65.4%提升至76.4%,同时保持强大的推理性能。
查看原文
查看缓存全文

缓存时间: 2026/06/10 05:44

论文页面 - 混合LLM中的注意力遗忘:当CoT微调破坏长程召回时,以及如何修复

来源:https://huggingface.co/papers/2606.11052 发布于 6月9日

·

由 https://huggingface.co/xinyu04

Zhou (https://huggingface.co/xinyu04) 于 6月10日提交

摘要

思维链监督微调通过将注意力梯度偏向短程模式,削弱了混合线性注意力模型的长上下文召回能力,但一种名为 QK-Restore 的无训练方法可以通过恢复查询-键投影来恢复长上下文能力,同时保持推理性能。

思维链(CoT)监督微调(SFT)被广泛用于提升推理能力,但我们发现它系统性地削弱了混合线性注意力模型的长上下文召回能力。在包括 HypeNet 和 Jet-Nemotron 在内的多种架构中,CoT-SFT 导致“大海捞针”(NIAH)任务上的检索性能大幅下降,且下降幅度在更困难的检索设置和更长的上下文窗口下更为严重。例如,HypeNet-9B 在 NIAH-S2@256K 上的性能从 67.2% 降至 9.4%。我们将其归因于 CoT-SFT 将注意力梯度偏向短程模式,从而破坏了负责长程路由的查询-键投影(W_Q、W_K)。基于这一观察,我们提出了 QK-Restore,一种无训练方法,仅从 SFT 前的检查点恢复 W_Q 和 W_K,同时保留所有其他 SFT 后的参数。我们还引入了一种 Procrustes 变体,以在路由保持和推理适应之间取得平衡。在多种架构上,QK-Restore 在零训练成本下一致地恢复长上下文能力,同时保持推理性能;例如,在 HypeNet-5B 上,它将 S3@256K 从 65.4% 提升至 76.4%,同时保持强劲的推理性能。

查看 arXiv 页面 (https://arxiv.org/abs/2606.11052)查看 PDF (https://arxiv.org/pdf/2606.11052)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11052)

在您的 Agent 中获取此论文:

hf papers read 2606.11052

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。

引用此论文的数据集0

暂无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。

引用此论文的 Spaces0

暂无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.11052 以将其链接至此页面。

包含此论文的收藏集0

暂无收藏集包含此论文

请将此论文添加至一个收藏集 (https://huggingface.co/new-collection) 以将其链接至此页面。

相似文章

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。

基于代理上下文的链式思维微调长上下文推理

arXiv cs.CL

提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。

LongAct:利用内在激活模式进行长上下文强化学习

Hugging Face Daily Papers

LongAct 提出了一种显著性引导的稀疏更新策略,通过选择性更新与查询和键向量中高幅值激活相关的权重来改进 LLMs 的长上下文推理能力,在 LongBench v2 上实现了约 8% 的提升。