卡尔曼增量网络:不确定性感知的联想记忆
摘要
介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。
查看缓存全文
缓存时间: 2026/09/09 04:29
论文页面 - Kalman Delta Networks:具有不确定性的联想记忆
来源:https://huggingface.co/papers/2609.07816
摘要
Kalman Delta Networks 将线性注意力重新表述为一个线性-高斯状态空间模型,利用卡尔曼滤波更新来跟踪记忆不确定性,从而生成高效的、兼容扫描机制的近似计算方法,提升了语言建模的性能。
线性注意力(https://huggingface.co/papers?q=Linear%20attention)正越来越多地被应用于前沿语言模型中,以实现高效的长上下文推理和常量内存解码。然而,其固定大小的循环记忆要求在每个 token 处做出在线决策:在已知未来查询需要何种信息之前,决定写入什么以及以多大强度覆盖现有联想。Delta 规则(https://huggingface.co/papers?q=Delta-rule)模型从当前的 token 嵌入中学习这种强度,但不跟踪记忆估计的置信度,导致每次写入无法根据累积证据进行自适应调整。为了显式地表示这种不确定性,我们将循环联想记忆(https://huggingface.co/papers?q=recurrent%20associative%20memory)重新表述为一个线性-高斯状态空间模型,对于该模型,卡尔曼滤波器(https://huggingface.co/papers?q=Kalman%20filter)是最优的递归估计器,并引入了一族新的模型——Kalman Delta Networks(https://huggingface.co/papers?q=Kalman%20Delta%20Networks)(KDNs)。在 KDN 中,状态转移同时传播记忆状态及其不确定性,使得卡尔曼增益(https://huggingface.co/papers?q=Kalman%20gain)能够根据累积证据和观测可靠性对每个残差写入进行加权。在此表述下,Delta 风格的更新成为一种特例,它用逐 token 的各向同性替代模型代替预测协方差,并省略了协方差跟踪。然而,精确跟踪涉及密集的、状态相关的 Riccati 递推(https://huggingface.co/papers?q=Riccati%20recursion),这并不适合 GPU 并行的线性注意力扫描。为了解决这个问题,我们引入了两种兼容扫描机制的 KDN 近似方法。对角 KDN(https://huggingface.co/papers?q=Diagonal%20KDN)通过在线平均场变分推断,将每一步后验投影到对角高斯族上;而各向同性 KDN(https://huggingface.co/papers?q=Isotropic%20KDN)则使用各向同性近似,每个注意力头仅用一个不确定性标量表示。它们的不确定性递推是莫比乌斯映射(https://huggingface.co/papers?q=Mobius%20maps),从而支持了具有对数并行深度的关联扫描(https://huggingface.co/papers?q=associative%20scans)。在参数量为 7.5 亿和 13 亿的受控预训练中,KDN 的各种变体在困惑度和下游任务平均准确率上均持续优于最先进的线性注意力模型。
查看 arXiv 页面 (https://arxiv.org/abs/2609.07816) 查看 PDF (https://arxiv.org/pdf/2609.07816) GitHub1 (https://github.com/ngocbh/kalman-delta-networks) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.07816)
通过您的代理获取本文:
hf papers read 2609.07816
没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
没有链接到本文的模型
在模型的 README.md 中引用 arxiv.org/abs/2609.07816 以将其从本页面链接。
引用本文的数据集 0
没有链接到本文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2609.07816 以将其从本页面链接。
引用本文的 Spaces 0
没有链接到本文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2609.07816 以将其从本页面链接。
包含本文的收藏集 0
没有包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其从本页面链接。
相似文章
变分线性注意力:用于长上下文 Transformer 的稳定联想记忆
本文介绍了变分线性注意力(VLA),这是一种用于稳定长上下文 Transformer 中线性注意力机制记忆状态的方法。VLA 将记忆更新重构为在线正则化最小二乘问题,证明了状态范数的有界性,并展示了相较于标准线性注意力和 DeltaNet 显著的速度提升以及更高的检索准确性。
动态线性注意力
本文提出DLA,一种用于多状态线性注意力的动态内存建模框架,它能根据令牌信息变化自适应地合并状态,并维护固定大小的状态缓存,从而在无需标准注意力二次复杂度的前提下实现更好的长上下文表示。
Δ-Mem:大型语言模型的高效在线记忆
提出 delta-Mem,一种轻量级在线记忆机制,利用紧凑状态矩阵并通过增量规则学习进行更新,以提升冻结大型语言模型的长上下文性能,无需全量微调或上下文扩展。
DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.
Sparse Delta Memory:通过稀疏性扩展线性RNN的状态容量
Sparse Delta Memory 通过稀疏寻址扩展了门控线性RNN,显著增加了隐藏状态容量,从而在保持计算效率的同时改进了长上下文学习和检索。