用于在线多目标跟踪的因果神经集合过滤
摘要
因果神经集合过滤 (CNSF) 是一种用于在线多目标跟踪的神经网络方法,与 Track-MT3 相比,通过将错误指标降低 19.3% 和 30.4%,提升了效率和性能,同时参数更少,推理更快。
arXiv:2609.16054v1 公告类型:新
摘要:基于 Transformer 的多目标跟踪 (MTT) 联合学习数据关联和状态估计,但 MT3/Track-MT3 风格的跟踪器重复编码测量窗口,导致冗余计算。我们提出因果神经集合过滤 (CNSF)\footnote{\href{https://github.com/daihuangyu/CNSF}{代码:https://github.com/daihuangyu/CNSF}},一种神经集合过滤器,仅编码当前测量,同时在结构化递归跟踪状态中携带过去证据。CNSF 结合了独占性 Sinkhorn 关联、条件关联的卡尔曼形状更新与矩匹配,以及循环伯努利生命周期建模与测量驱动的出生。这些机制施加软一对一约束,传播关联引起的状态不确定性,并支持在漏检和出生-死亡过渡下的存在估计。在保留的三区域模拟测试集上,CNSF 相对于 Track-MT3 将平均 GOSPA 和 T-GOSPA 降低 19.3\% 和 30.4\%,参数减少 55.9\%,单线程 CPU 推理速度提升 $3.76\times$。
查看缓存全文
缓存时间: 2026/09/16 08:34
# 基于因果神经集滤波的在线多目标跟踪
来源:https://arxiv.org/html/2609.16054
###### 摘要
基于Transformer的多目标跟踪(MTT)联合学习数据关联与状态估计,但MT3/Track-MT3类跟踪器会重复编码测量窗口,导致冗余计算。我们提出因果神经集滤波(CNSF)111代码:https://github.com/daihuangyu/CNSF (https://github.com/daihuangyu/CNSF),这是一种神经集滤波器,仅编码当前测量值,同时通过结构化的递归航迹状态携带历史证据。CNSF结合了排他性Sinkhorn关联、基于关联条件的卡尔曼式更新与矩匹配,以及带有测量驱动出生的循环伯努利生命周期建模。这些机制施加了软一对一约束,传播了由关联引入的状态不确定性,并支持在漏检和出生-死亡转换下的存在性估计。在一个包含三种体制的留出模拟测试集上,CNSF相比Track-MT3将平均GOSPA和T-GOSPA分别降低了19.3%和30.4%,参数量减少了55.9%,并在单线程CPU推理中实现了3.76倍加速。
###### 索引词:
多目标跟踪、神经滤波、数据关联、集合预测、Sinkhorn
††地址:1杭州应用声学研究所,杭州 310023,中国
2独立研究员,杭州,中国
*等同贡献。## 1引言
多目标跟踪(MTT)从受杂波、漏检、关联不确定性以及目标出生和死亡影响的测量中递归地估计一个时变目标集。经典贝叶斯跟踪器通过显式的递归状态、关联和存在性建模来处理这些不确定性[5 (https://arxiv.org/html/2609.16054#bib.bib2), 18 (https://arxiv.org/html/2609.16054#bib.bib3), 21 (https://arxiv.org/html/2609.16054#bib.bib4), 7 (https://arxiv.org/html/2609.16054#bib.bib5)],提供了有原则的概率语义,但随着关联不确定性增加,可能带来巨大的复杂性。
神经集跟踪器通过联合学习数据关联和状态估计提供了另一条路径。多目标跟踪Transformer(MT3)和Track-MT3将点测量跟踪制定为基于Transformer的集合预测,并从测量窗口中恢复时序上下文[16 (https://arxiv.org/html/2609.16054#bib.bib6), 2 (https://arxiv.org/html/2609.16054#bib.bib7)]。Track-MT3还跨帧传播学习的查询级信息,但重叠的历史测量仍然被重复编码。然而,其传播的查询并未在一个结构化的滤波器状态中明确携带运动学不确定性和目标存在性。
为解决这一差距,我们提出因果神经集滤波(CNSF),它用结构化的航迹状态递归替代窗口条件的集合预测:仅编码当前测量值,而历史证据通过递归航迹状态传播。CNSF使用排他性Sinkhorn关联、基于关联条件的卡尔曼式更新与矩匹配,以及带有测量驱动出生的循环伯努利生命周期建模。这些机制支持在测量竞争、关联模糊性、漏检和出生-死亡转换下的递归。在一个包含三种体制的留出模拟测试集上,CNSF相比Track-MT3将平均GOSPA和T-GOSPA分别降低了19.3%和30.4%,同时参数量减少了55.9%,并实现了3.76倍的单线程CPU加速。它在所有评估方法中也取得了最低的平均GOSPA和T-GOSPA。
## 2相关工作
经典MTT建立在递归贝叶斯估计的基础上。JPDA/MHT处理关联模糊性,而基于RFS的方法(如δ-GLMB和PMBM)则对目标存在性、出生和死亡进行建模[5 (https://arxiv.org/html/2609.16054#bib.bib2), 18 (https://arxiv.org/html/2609.16054#bib.bib3), 22 (https://arxiv.org/html/2609.16054#bib.bib17), 21 (https://arxiv.org/html/2609.16054#bib.bib4), 7 (https://arxiv.org/html/2609.16054#bib.bib5)]。随着模糊性增加,关联边缘化或假设管理可能变得代价高昂。相关进展处理关联与滤波[14 (https://arxiv.org/html/2609.16054#bib.bib8), 13 (https://arxiv.org/html/2609.16054#bib.bib18), 24 (https://arxiv.org/html/2609.16054#bib.bib10), 3 (https://arxiv.org/html/2609.16054#bib.bib11), 10 (https://arxiv.org/html/2609.16054#bib.bib13), 8 (https://arxiv.org/html/2609.16054#bib.bib14), 23 (https://arxiv.org/html/2609.16054#bib.bib16), 29 (https://arxiv.org/html/2609.16054#bib.bib12), 28 (https://arxiv.org/html/2609.16054#bib.bib15)],包括学习的Sinkhorn-卡尔曼耦合[12 (https://arxiv.org/html/2609.16054#bib.bib9)]。CNSF在一个结构化的递归航迹状态中集成了软排他关联、基于关联条件的矩匹配、循环存在性建模和测量驱动出生。
另一条并行路径将跟踪制定为学习的集合预测[20 (https://arxiv.org/html/2609.16054#bib.bib19), 11 (https://arxiv.org/html/2609.16054#bib.bib20), 1 (https://arxiv.org/html/2609.16054#bib.bib21)]。MT3/Track-MT3将这一范式扩展到点测量MTT[16 (https://arxiv.org/html/2609.16054#bib.bib6), 2 (https://arxiv.org/html/2609.16054#bib.bib7)],相关工作包括TrackFormer、MOTR、GTR、TransMOT和MOTRv2中的持久查询设计[15 (https://arxiv.org/html/2609.16054#bib.bib22), 26 (https://arxiv.org/html/2609.16054#bib.bib23), 30 (https://arxiv.org/html/2609.16054#bib.bib24), 19 (https://arxiv.org/html/2609.16054#bib.bib25), 27 (https://arxiv.org/html/2609.16054#bib.bib26)]。Track-MT3传播查询级信息同时重编码测量窗口;而CNSF则传播结构化的递归航迹状态并仅编码当前测量值。
参见图注图1:CNSF概览。顶部:通过预测、当前帧编码、排他关联、矩匹配更新以及生命周期/出生建模实现的因果单帧推理。底部:仅用于训练的监督、闭环课程以及通过递归路径的联合BPTT。
## 3因果神经集滤波器
CNSF的核心设计选择是让结构化的航迹状态(而非测量窗口)作为时序信息的载体。在每个时间步,当前测量集\(Z_t\)仅被编码一次,并与上一航迹状态\(\mathcal{T}_{t-1}\)融合;更新后的状态\(\mathcal{T}_t\)是传递至下一步的唯一持久状态。这给出了递归更新
\(\mathcal{F}_{\theta}:(\mathcal{T}_{t-1}, Z_t) \mapsto \mathcal{T}_t,\)(1)
其中预测、关联、状态更新和目标生命周期在单个神经集滤波器内耦合。
### 3.1递归状态与神经-物理预测
每个活跃航迹维护
\(T_i = (\mu_i, P_i, q_i, h_i, r_i, c_i),\)(2)
其中\(\mu_i = [x_i, y_i, v_{x,i}, v_{y,i}]^\top\)和\(P_i\)是运动学均值和协方差,\(q_i\)是学习的航迹查询,\(h_i\)存储生命周期记忆,\(r_i \in (0, 1)\)是伯努利存在概率,\(c_i\)包含离散记账信息(如年龄、确认和连续漏检次数)。预测从恒定速度模型开始,具有转移矩阵\(F(\Delta t)\)和位置观测矩阵\(H = [I_2 \; 0]\)[9 (https://arxiv.org/html/2609.16054#bib.bib1)]。一个傅里叶嵌入\(\phi(\Delta t)\)调节轻量级头以调整查询、运动、过程不确定性和生存概率。使用标准的加速度输入矩阵\(G(\Delta t) = [\frac{1}{2}\Delta t^2 I_2 \;\; \Delta t I_2]^\top\),预测为
\(\bar{q}_i = q_i + \Delta q_i,\)
\(\bar{\mu}_i = F \mu_i + G a_i,\)(3)
\(\bar{P}_i = F P_i F^\top + Q_i,\)
\(\bar{r}_i = r_i \, \sigma\!\bigl(\operatorname{logit}(p_{0}^S) + \Delta s_i\bigr).\)
这里\(\Delta q_i = f_{\theta}^q(q_i, \phi(\Delta t))\)且\(a_i = f_{\theta}^a(\bar{q}_i)\)。学习的过程协方差是\(Q_i = \operatorname{Diag}(\operatorname{softplus}(f_{\theta}^Q(\bar{q}_i)) + \epsilon) \Delta t\),生存修正有界为\(\Delta s_i = \kappa_S \tanh(f_{\theta}^S / \kappa_S)\),其中\(f_{\theta}^S\)表示仅以预测航迹和因果生命周期特征为条件的测量前生存头。并行地,一个排列等变Transformer编码当前测量集\(Z_t = \{z_t^j\}_{j=1}^{M_t}\)一次;历史测量不会被重新编码。
### 3.2排他关联与不确定性传播
对于航迹-测量对\((i, j)\),定义新息\(\nu_{ij} = z_t^j - H \bar{\mu}_i\)及其协方差\(S_{ij} = H \bar{P}_i H^\top + R_{ij}\),其中对头预测一个正对角观测协方差\(R_{ij}\)。令\(\psi_{ij} = f_{\theta}^{\rm pair}(i, j) + b_i^{\theta}\)表示学习的对证据,\(g_{ij} = \sigma(f_{\theta}^g(i, j)) \in (0, 1)\)表示物理兼容性分数上的学习门控:
\(\ell^{\rm phy}_{ij} = -\frac{1}{2}\!\left(\nu_{ij}^\top S_{ij}^{-1} \nu_{ij} + \log\|S_{ij}\|\right),\)(4)
\(s_{ij} = g_{ij} \ell^{\rm phy}_{ij} + \psi_{ij} + \lambda_{\rm prior} \operatorname{logit}\!\bigl(\max(\bar{r}_i, r_{\min})\bigr).\)
令\(N\)和\(M\)分别为活跃航迹和有效测量的数量。我们用学习的漏检对数几率\(s_{i\varnothing}\)、未关联对数几率\(s_{\varnothing j}\)和一个松弛项增强对分数,形成\(S^{\rm aug} \in \mathbb{R}^{(N+1) \times (M+1)}\)。关联质量通过
\(A = \operatorname{Sinkhorn}\!\left(S^{\rm aug}/\tau_{\rm sk};\, \mathbf{a}, \mathbf{b}\right),\)
使用\(N_{\rm sk}\)次对数空间迭代[4 (https://arxiv.org/html/2609.16054#bib.bib27)],其中边缘向量\(\mathbf{a} = [\mathbf{1}_{N}; M]\)和\(\mathbf{b} = [\mathbf{1}_{M}; N]\)。因此,对于活跃航迹和有效测量,\(\sum_{j=1}^{M} A_{ij} + A_{i\varnothing} = 1\)且\(\sum_{i=1}^{N} A_{ij} + A_{\varnothing j} = 1\),施加了软一对一关联约束;角项用作增强边缘化所需的松弛。
每个配对假设在边缘化之前都会更新。用于关联的相同学习的\(R_{ij}\)进入一个带增益残差有界学习的卡尔曼式更新:
\(K_{ij} = \bar{P}_i H^\top S_{ij}^{-1} + \kappa_K \tanh(\Delta K_{ij}^\theta),\)
\(\mu_{ij} = \bar{\mu}_i + K_{ij} \nu_{ij},\)(5)
\(P_{ij} = (I_4 - K_{ij} H) \bar{P}_i (I_4 - K_{ij} H)^\top + K_{ij} R_{ij} K_{ij}^\top.\)
对表示还通过一个门控循环单元(GRU)更新潜在查询,得到\(q_{ij}\)。对于每个活跃航迹,我们重新归一化其Sinkhorn行以获得\(w_{ij}\)和\(w_{i0}\),其中\((\mu_{i0}, P_{i0}, q_{i0}) = (\bar{\mu}_i, \bar{P}_i, \bar{q}_i)\)。然后,通过矩匹配将配对和漏检假设合并到一个递归状态中:
\(\mu_i^+ = \sum_{k=0}^{M} w_{ik} \mu_{ik}, \quad q_i^+ = \sum_{k=0}^{M} w_{ik} q_{ik},\)
\(P_i^+ = \sum_{k=0}^{M} w_{ik} \!\left[P_{ik} + (\mu_{ik} - \mu_i^+)(\mu_{ik} - \mu_i^+)^\top\right].\)(6)
公式(6)保留了混合分布的均值和协方差,包括由关联模糊性引入的组分间协方差,同时为每个航迹保留一个矩匹配状态,而不是传播多个关联假设。
### 3.3伯努利生命周期与网络架构
令\(u_j = \sigma(o_j)\)表示测量物体性,\(m_i = \sum_j w_{ij} u_j\)表示航迹\(i\)的物体性加权的配对支持。生命周期记忆从更新后的查询和因果证据更新,同时在存在性对数几率空间中有一个有界学习修正起作用:
\(h_i^+ = \operatorname{GRU}\!\left([q_i^+, \xi_i], h_i\right),\)
\(r_i^+ = \sigma\!\left(\operatorname{logit} \bar{r}_i + m_i - \delta_m + \Delta \ell_i^r\right),\)(7)
\(\pi_j^{\rm new} = A_{\varnothing j} u_j,\)
其中\(\Delta \ell_i^r = \kappa_r \tanh(f_{\theta}^r(h_i^+, \xi_i') / \kappa_r)\)。特征向量\(\xi_i\)包含先前和瞬时存在性、配对/漏检支持、物体性支持、关联熵与裕度、流逝时间、更新后的协方差和年龄;\(\xi_i'\)保留了由对数几率修正头使用的配对支持、模糊性、时间和协方差项。出生头初始化位置、速度、对角协方差、查询、生命周期记忆和存在性。更新后的存在性\(r_i^+\)然后控制确认、保留和终止。
测量/航迹查询特征宽度为\(d\),生命周期记忆宽度为\(d_h\)。测量编码器使用\(L_e\)层、\(H\)个注意力头和前馈宽度\(d_{\rm ff}\);\(L_d\)层关联解码器应用航迹自注意力,后接航迹到测量交叉注意力。轻量级头参数化公式(3)–(7)。
### 3.4训练目标
训练保留跨帧的递归身份。现有航迹通过跨帧目标对齐(CTA)继承其真实身份,而匈牙利分配仅用于在训练期间将不匹配的出生候选与不匹配目标匹配。离散分配被分离且从不在推理时使用。损失在每个监督帧上计算,并在所有有效的展开帧上平均。这里\(\operatorname{BCE}(\ell, y)\)表示带对数几率的二元交叉熵。
集合损失。令\(\mathcal{M}_t\)为匹配的预测-目标对,\(\mathcal{C}_t\)为所有有效的现有/出生候选。候选\(k\)预测位置\(\hat{p}_k\),对数几率\(\ell_k\),以及标签\(y_k \in \{0, 1\}\);真实位置\(p_n^*\)相似文章
基于对比对搜索的靶向神经元调控
对比神经元归因(CNA)识别出一组稀疏的MLP神经元,这些神经元能够区分有害提示和良性提示,从而在指令微调的大语言模型中实现有效的行为引导,同时不会降低输出质量。该方法在越狱基准测试上将拒绝率降低了50%以上,同时保持了流畅性。
CamoNAS:面向增强伪装目标检测的神经架构搜索
介绍了CamoNAS,一种用于伪装目标检测的频率感知多分辨率神经架构搜索框架,在四个基准测试上取得了最先进的结果。
@NousResearch: 为了检查CNA是否只隔离了预期行为,我们评估了MMLU上不同转向强度下的转向模型……
Nous Research 发布了对比神经元归因(CNA),这是一种通过识别和消融MLP神经元中稀疏电路来引导LLM行为的方法,无需训练稀疏自编码器或降低通用基准性能,已在多个大型语言模型上得到验证。
@NousResearch:今天我们发布对比神经元归因(CNA),一种通过识别和消融稀疏电路来引导LLM行为的方法…
NousResearch 发布了对比神经元归因(CNA),该方法通过消融稀疏的 MLP 电路来引导 LLM 行为,无需训练稀疏自编码器或降低基准测试性能,并在多达 70B 参数的模型的拒绝电路上验证了有效性。
有色噪声扩散采样
介绍了有色噪声采样(CNS),这是一种无需训练的扩散模型随机求解器,可根据频率依赖的时间表动态分配能量,在ImageNet-256上显著提高了FID等图像质量指标。