谱移(SpectralShift):通过谱重参数化有效扩展门控 DeltaNet 的上下文窗口

Hugging Face Daily Papers 论文

摘要

谱移引入了一种谱重参数化方法,通过重塑衰减谱来有效扩展门控 DeltaNet 模型的上下文窗口,并通过持续预训练提升其长上下文处理能力。

近期,在大规模长上下文建模中,线性注意力层正越来越多地被用来替代 softmax 注意力。然而,现有的上下文扩展方法通常直接进行持续预训练,而不修改这些层,忽略了线性注意力状态动态的谱特性。本研究从过渡矩阵的谱视角研究了门控 DeltaNet (GDN) 的长上下文扩展,并确定了支配长距离信息检索的两个关键因素:(1) 一个足够宽的慢频谱带,与目标依赖长度对齐;(2) 为状态清理和上下文切换而保持快速衰减模式。基于此观察,我们提出了谱移,一种用于 GDN 长上下文持续预训练的谱重参数化方法。具体而言,谱移通过增强慢传播能力,对 alpha 投影初始化进行重参数化以重塑衰减谱,并进一步引入了针对 alpha 投影的学习率缩放策略以促进长上下文训练。实验表明,谱移在训练过程中持续提升了长上下文能力,为线性注意力模型的上下文窗口扩展提供了一种高效且有效的解决方案。代码已开源于 https://github.com/RUCAIBox/GDN-SpectralShift。
查看原文
查看缓存全文

缓存时间: 2026/09/17 06:52

论文页面 - SpectralShift:通过谱重参数化有效扩展门控DeltaNet的上下文窗口

来源:https://huggingface.co/papers/2609.14320

摘要

近年来,线性注意力层在大规模长上下文建模中逐渐取代Softmax注意力。然而,现有的上下文扩展方法通常直接进行持续预训练,而未修改这些线性注意力层,忽略了线性注意力状态动态的谱特性。本研究从转移矩阵的谱视角研究了门控DeltaNet(Gated DeltaNet, GDN)的长上下文扩展,识别出控制长程信息检索的两个关键因素:(1) 足够宽的慢谱带以匹配目标依赖长度;(2) 保留快速衰减模式以实现状态清除和上下文切换。基于这一观察,我们提出了SpectralShift,一种用于GDN长上下文持续预训练的谱重参数化方法。具体而言,SpectralShift对α投影初始化进行重参数化,通过增强慢速传播能力重塑衰减谱,并进一步引入α投影的学习率缩放以促进长上下文训练。实验表明,SpectralShift在训练过程中一致地提升了长上下文能力,为扩展线性注意力模型的上下文窗口提供了高效且有效的解决方案。代码已在https://github.com/RUCAIBox/GDN-SpectralShift开源。

查看arXiv页面 (https://arxiv.org/abs/2609.14320) 查看PDF (https://arxiv.org/pdf/2609.14320) GitHub1 (https://github.com/RUCAIBox/GDN-SpectralShift) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.14320)

通过代理获取此论文:

hf papers read 2609\.14320

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文

在模型README.md中引用arxiv.org/abs/2609.14320以从此页面链接到该模型。

引用本文的数据集 0

没有数据集链接本文

在数据集README.md中引用arxiv.org/abs/2609.14320以从此页面链接到该数据集。

引用本文的空间 0

没有空间链接本文

在空间README.md中引用arxiv.org/abs/2609.14320以从此页面链接到该空间。

包含本文的收藏 0

没有收藏包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接到该收藏。

相似文章

密集段落检索中嵌入压缩的谱调整方法

arXiv cs.CL

谱调整(SpecTemp)提出了一种无需学习的密集段落检索嵌入压缩方法,该方法基于信噪比分析自适应地确定最优的谱缩放系数,性能优于PCA和白化等固定超参数方法。

偏好微调作为频谱更新重组

arXiv cs.CL

该论文揭示,基于偏好的后训练会诱导出具有频谱头-尾组织的参数更新,其中紧凑的头部承载主要的行为偏移,而微弱的尾部对于完整解恢复是必要的,从而将对齐重新定义为结构化的更新重组,而非单一的整体修正。

谱遗忘恢复:无需重新训练即可事后恢复受损能力

arXiv cs.LG

本文提出DG-Hard,一种事后谱修复方法,仅使用预训练和微调检查点,即可恢复因微调而受损的能力,无需重新训练。该方法将Donoho-Gavish硬奇异值阈值应用于权重更新,去除噪声并恢复退化的性能。