Gated DeltaNet-2:线性注意力中的擦除与写入解耦
摘要
Gated DeltaNet-2 为线性注意力引入了独立的擦除门和写入门,在长上下文语言建模和检索任务中实现了优越的性能。
查看缓存全文
缓存时间: 2026/05/22 02:29
论文页面 - Gated DeltaNet-2:在线性注意力中解耦擦除与写入
来源:https://huggingface.co/papers/2605.22791
摘要
Gated DeltaNet-2 通过使用不同的通道级门控(通道级门控)将擦除和写入操作分离,改进了现有的线性注意力模型,在长上下文语言建模和检索任务中实现了更优的性能。
线性注意力(https://huggingface.co/papers?q=Linear%20attention)用固定大小的循环状态(https://huggingface.co/papers?q=recurrent%20state)替换了 softmax 注意力(https://huggingface.co/papers?q=softmax%20attention)的无界缓存,将序列混合复杂度降至线性时间,并将解码过程的内存占用压缩为常量。难点不仅在于决定忘记什么,还在于如何编辑这个压缩记忆而不打乱已有的关联。
Delta 规则模型(https://huggingface.co/papers?q=Delta-rule%20models)在写入新值之前会减去当前读取的内容;Kimi Delta 注意力(https://huggingface.co/papers?q=Kimi%20Delta%20Attention)(KDA)则通过通道级衰减(https://huggingface.co/papers?q=channel-wise%20decay)来强化遗忘机制。但主动编辑仍然使用单个标量门控来控制两件不同的事:在键(key)一侧擦除多少旧内容,以及在值(value)一侧提交多少新内容。
我们提出了 Gated DeltaNet-2,它同时泛化了 Gated DeltaNet(https://huggingface.co/papers?q=Gated%20DeltaNet)和 KDA:继承了自适应遗忘与通道级衰减,同时解决了它们共有的限制——即擦除与写入之间的标量耦合。Gated Delta Rule-2 通过一个通道级擦除门控(https://huggingface.co/papers?q=erase%20gate)b_t 和一个通道级写入门控(https://huggingface.co/papers?q=write%20gate)w_t 将这两个角色分离;当两个门控退化为同一个标量时,它约简为 KDA;而当衰减也退化时,约简为 Gated DeltaNet(https://huggingface.co/papers?q=Gated%20DeltaNet)。我们推导了一种快速权重更新视角(https://huggingface.co/papers?q=fast-weight%20update)、一种将通道级衰减吸收为不对称擦除因子的分块 WY 算法(https://huggingface.co/papers?q=chunkwise%20WY%20algorithm),以及一种保持高效并行训练的门控感知反向传播(https://huggingface.co/papers?q=gate-aware%20backward%20pass)。
在 1.3B 参数规模下使用 100B FineWeb-Edu 令牌进行训练,Gated DeltaNet-2 在语言建模、常识推理和检索任务中,在 Mamba-2(https://huggingface.co/papers?q=Mamba-2)、Gated DeltaNet(https://huggingface.co/papers?q=Gated%20DeltaNet)、KDA 和 Mamba-3(https://huggingface.co/papers?q=Mamba-3)等各种变体中取得了最强的综合结果。其优势在长上下文 RULER(https://huggingface.co/papers?q=RULER)“大海捞针”基准测试(https://huggingface.co/papers?q=needle-in-a-haystack%20benchmarks)中尤为显著,改进了评估的多键检索设置,并在循环和混合设置中均保持强大性能。代码已开源:https://github.com/NVlabs/GatedDeltaNet-2。
查看 arXiv 页面(https://arxiv.org/abs/2605.22791)查看 PDF(https://arxiv.org/pdf/2605.22791)GitHub 19(https://github.com/NVlabs/GatedDeltaNet-2)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.22791)
在您的代理中获取此论文:
hf papers read 2605\.22791
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型与此论文关联
请在模型的 README.md 中引用 arxiv.org/abs/2605.22791 以从此页面链接。
引用此论文的数据集0
没有数据集与此论文关联
请在数据集的 README.md 中引用 arxiv.org/abs/2605.22791 以从此页面链接。
引用此论文的 Spaces0
没有 Space 与此论文关联
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.22791 以从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
请将此论文添加到收藏集(https://huggingface.co/new-collection)中以从此页面链接。
相似文章
介绍 Toast 1
Mixedbread 推出 Toast 1,这是一款专用搜索代理,其质量可与前沿模型媲美,同时成本最高降低 10 倍,速度最高提升 12 倍。它自动化了代理式搜索循环,并在 OfficeQA Pro V2 和法律知识任务等基准测试中取得了最先进的结果。
MARCH:利用内容路由状态锚点扩展循环记忆
本文介绍了MARCH,一种网络架构,通过将累积的循环状态检查点缓存为内容可寻址的状态锚点,将循环状态空间模型扩展到固定尺寸维度之外,从而实现高效的长程记忆检索,在长上下文基准测试中优于线性注意力变体。
超越检索:长时程智能体轨迹的查询条件复用
本文识别出检索后复用是长时程智能体记忆的瓶颈,并提出查询条件复用(QCR)——一种简单的目标绑定笔记格式,在WebArena、WorkArena和AppWorld上展示了更高的成功率和token效率。
当智能体打开聊天应用:对原始聊天日志的智能体控制搜索媲美结构化记忆
本文介绍了 ReFind,一种智能体控制的搜索界面,它使用词法索引和迭代关键词搜索对原始、未修改的聊天日志进行操作,表明它可以在对话记忆基准测试中媲美 HippoRAG 2 等结构化记忆系统,而无需构建任何语义结构。
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
This paper presents a cost-aware comparison of LLMs versus dedicated embedding models across 37 tasks, finding that the best LLM and embedding model are nearly tied on aggregate performance but LLMs are up to 1,431x more expensive and slower, leading to a recommended division of labor.