通过卡尔曼滤波、克里金法和过程噪声的精确跟踪Transformer
摘要
本文介绍了贝叶斯滤波Transformer(BFT),它通过精度加权注意力和卡尔曼更新残差将不确定性引入Transformer,从而提升了序列推荐和有噪声大语言模型微调的性能。
arXiv:2605.18832v1 公告类型:新论文
摘要:Transformer是现代人工智能的基础构建模块,但并未提供处理现实应用中普遍存在的\emph{不确定性}的原则性方法:序列推荐中历史稀疏的冷启动token、语言模型中异质的信号质量,以及由无约束softmax引起的注意力沉没。每个token都被视为具有相同的置信度。我们证明这种均匀性是我们\emph{贝叶斯滤波Transformer}(BFT)的一个退化情况:注意力变为精度加权克里金法,残差连接变为具有自适应增益的卡尔曼更新,而前馈网络变为一个动力学模型,通过雅可比矩阵加过程噪声规则传播精度。观测精度来自一个无参数的限制最大似然(REML)估计器,该估计器带有共轭贝叶斯先验。BFT可以以极小的开销替换任何Transformer层。在序列推荐中,BFT应用于三种主要架构在六个基准测试上取得了显著提升,其中冷启动用户和稀有物品(不确定性最高)的提升最大。在带有噪声数据的大语言模型监督微调中,BFT在两种情境下提升了鲁棒性:噪声监督(问答中的token标签损坏)和噪声上下文(带有真实RAG干扰项的检索增强问答)。一个单一的原则性修改——恢复精度——在经典序列建模和现代LLM场景中都打开了巨大的提升空间。
相似文章
带有Embedded Latent Transfer Operators的序贯贝叶斯滤波的结构化噪声自适应
本文针对基于ELTO的卡尔曼滤波器的噪声模型引入了一种结构化参数化方法,使其能够动态适应非平稳过程,提升在噪声时变环境中的状态估计性能。
Transformer作为贝叶斯上下文实验者:平滑自适应的高效ATE估计
该论文提出贝叶斯上下文实验者(Bayesian in-context experimenters),通过训练Transformer模仿贝叶斯后验Neyman教师策略,实现自适应平均处理效应(ATE)估计,并采用混合专家Transformer处理未知平滑性,理论证明可通过监督预训练学习该策略。
基于贝叶斯滤波的噪声测量下拉格朗日动力学学习方法
本文提出了一种基于贝叶斯滤波的方法,通过使用神经网络参数化动能和势能,并通过最大似然估计联合估计状态和参数,从部分且含噪声的测量中学习拉格朗日动力学。
RT-Transformer:将 Transformer Block 视为球面状态估计器
本文提出了一种理论框架,解释 Transformer 组件(注意力机制、残差连接、归一化)如何源于使用径向-切线随机微分方程(Radial-Tangential SDEs)的球面状态估计问题。
在部分已知动力学下学习分布式估计:一种协方差无关的神经卡尔曼共识滤波器
本文提出CA-NKCF,一种结合部分领域知识与深度神经网络的新型分布式潜在状态估计器,无需噪声统计知识即可实现鲁棒性能,在线性、混沌及无线追踪环境中优于传统滤波器。