卡尔曼增量网络:不确定性感知的联想记忆

Hugging Face Daily Papers 论文

摘要

介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。

线性注意力日益应用于前沿语言模型,以实现高效的长上下文推理和固定内存解码。然而,其固定大小的循环记忆需要在每个标记处进行在线决策:在不知道未来查询需要哪些信息的情况下,应该写入什么以及以多强的力度覆盖现有关联。增量规则模型从当前标记嵌入中学习此强度,但不追踪记忆估计的置信度,导致每次写入无法适应累积证据。为了显式表示这种不确定性,我们将循环联想记忆重新表述为一个线性-高斯状态空间模型(卡尔曼滤波器是其最优递归估计器),并引入了一类新的模型:卡尔曼增量网络。在卡尔曼增量网络中,状态转移同时传播记忆状态及其不确定性,允许卡尔曼增益根据累积证据和观测可靠性来加权每次残差写入。在此表述下,增量式更新作为一种特殊情况出现,它用逐标记的各向同性替代预测协方差,并省略协方差追踪。然而,精确追踪涉及一个密集的、状态相关的Riccati递推,不适用于GPU并行的线性注意力扫描。为了解决这个问题,我们引入了两种与扫描兼容的卡尔曼增量网络近似方法。对角卡尔曼增量网络通过在线均场变分推断将每个一步后验投影到对角高斯族;各向同性卡尔曼增量网络则使用每头一个不确定性标量的各向同性近似。它们的不确定性递推是Mobius映射,支持具有对数并行深度的联想扫描。在750M和1.3B参数的受控预训练中,卡尔曼增量网络变体在困惑度和下游平均准确率上持续优于最先进的线性注意力模型。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:29

论文页面 - Kalman Delta Networks:具有不确定性的联想记忆

来源:https://huggingface.co/papers/2609.07816

摘要

Kalman Delta Networks 将线性注意力重新表述为一个线性-高斯状态空间模型,利用卡尔曼滤波更新来跟踪记忆不确定性,从而生成高效的、兼容扫描机制的近似计算方法,提升了语言建模的性能。

线性注意力(https://huggingface.co/papers?q=Linear%20attention)正越来越多地被应用于前沿语言模型中,以实现高效的长上下文推理和常量内存解码。然而,其固定大小的循环记忆要求在每个 token 处做出在线决策:在已知未来查询需要何种信息之前,决定写入什么以及以多大强度覆盖现有联想。Delta 规则(https://huggingface.co/papers?q=Delta-rule)模型从当前的 token 嵌入中学习这种强度,但不跟踪记忆估计的置信度,导致每次写入无法根据累积证据进行自适应调整。为了显式地表示这种不确定性,我们将循环联想记忆(https://huggingface.co/papers?q=recurrent%20associative%20memory)重新表述为一个线性-高斯状态空间模型,对于该模型,卡尔曼滤波器(https://huggingface.co/papers?q=Kalman%20filter)是最优的递归估计器,并引入了一族新的模型——Kalman Delta Networks(https://huggingface.co/papers?q=Kalman%20Delta%20Networks)(KDNs)。在 KDN 中,状态转移同时传播记忆状态及其不确定性,使得卡尔曼增益(https://huggingface.co/papers?q=Kalman%20gain)能够根据累积证据和观测可靠性对每个残差写入进行加权。在此表述下,Delta 风格的更新成为一种特例,它用逐 token 的各向同性替代模型代替预测协方差,并省略了协方差跟踪。然而,精确跟踪涉及密集的、状态相关的 Riccati 递推(https://huggingface.co/papers?q=Riccati%20recursion),这并不适合 GPU 并行的线性注意力扫描。为了解决这个问题,我们引入了两种兼容扫描机制的 KDN 近似方法。对角 KDN(https://huggingface.co/papers?q=Diagonal%20KDN)通过在线平均场变分推断,将每一步后验投影到对角高斯族上;而各向同性 KDN(https://huggingface.co/papers?q=Isotropic%20KDN)则使用各向同性近似,每个注意力头仅用一个不确定性标量表示。它们的不确定性递推是莫比乌斯映射(https://huggingface.co/papers?q=Mobius%20maps),从而支持了具有对数并行深度的关联扫描(https://huggingface.co/papers?q=associative%20scans)。在参数量为 7.5 亿和 13 亿的受控预训练中,KDN 的各种变体在困惑度和下游任务平均准确率上均持续优于最先进的线性注意力模型。

查看 arXiv 页面 (https://arxiv.org/abs/2609.07816) 查看 PDF (https://arxiv.org/pdf/2609.07816) GitHub1 (https://github.com/ngocbh/kalman-delta-networks) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.07816)

通过您的代理获取本文:

hf papers read 2609.07816

没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有链接到本文的模型

在模型的 README.md 中引用 arxiv.org/abs/2609.07816 以将其从本页面链接。

引用本文的数据集 0

没有链接到本文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2609.07816 以将其从本页面链接。

引用本文的 Spaces 0

没有链接到本文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2609.07816 以将其从本页面链接。

包含本文的收藏集 0

没有包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其从本页面链接。

相似文章

变分线性注意力:用于长上下文 Transformer 的稳定联想记忆

arXiv cs.LG

本文介绍了变分线性注意力(VLA),这是一种用于稳定长上下文 Transformer 中线性注意力机制记忆状态的方法。VLA 将记忆更新重构为在线正则化最小二乘问题,证明了状态范数的有界性,并展示了相较于标准线性注意力和 DeltaNet 显著的速度提升以及更高的检索准确性。

动态线性注意力

arXiv cs.CL

本文提出DLA,一种用于多状态线性注意力的动态内存建模框架,它能根据令牌信息变化自适应地合并状态,并维护固定大小的状态缓存,从而在无需标准注意力二次复杂度的前提下实现更好的长上下文表示。

Δ-Mem:大型语言模型的高效在线记忆

Hacker News Top

提出 delta-Mem,一种轻量级在线记忆机制,利用紧凑状态矩阵并通过增量规则学习进行更新,以提升冻结大型语言模型的长上下文性能,无需全量微调或上下文扩展。