CauseCollab: 用于异构协同感知的因果统一和模态无关网络
摘要
CauseCollab 提出了一种因果统一和模态无关网络,通过将语义因素与模态特定混淆因子解耦,解决异构协同感知中的问题,并在基准数据集上实现了最先进的性能。
arXiv:2609.03818v1 公告类型:新
摘要:协同感知通过多智能体信息共享增强环境理解,但其在现实场景中的性能受限于异构传感器模态和模型架构。近期基于协议的两阶段方法通过将异构特征映射到共享协议空间来缓解这一问题;然而,独立训练的模态特定转换器常生成模态特定伪协议分布,导致语义不一致性和误差累积,这在模态差异较大的场景中尤为明显。为解决此问题,我们提出CauseCollab,一种因果统一和模态无关网络。CauseCollab从因果视角在协议空间中构建表示学习,通过因果度量学习明确将语义因素与模态特定统计混淆因子解耦。同时,CauseCollab采用上下文引导的统一转换器处理异构模态,以确保跨模态语义一致性。此外,集成新模态仅需训练最小参数量的适配器。在OPV2V和DAIR-V2X数据集上的大量实验表明,CauseCollab实现了最先进的性能,在模态差异较大的场景中收益更为显著。
查看缓存全文
缓存时间: 2026/09/04 06:12
# CauseCollab:异构协同感知的因果统一与模态无关网络 来源:https://arxiv.org/html/2609.03818 Weze Li 机构:网络与交换技术国家重点实验室,北京邮电大学,北京,中国 Yang Li 机构:网络与交换技术国家重点实验室,北京邮电大学,北京,中国 Quan Yuan 机构:网络与交换技术国家重点实验室,北京邮电大学,北京,中国 通讯作者:[yuanquan@bupt\.edu\.cn](mailto:[email protected]) Xiaoyuan Fu 机构:网络与交换技术国家重点实验室,北京邮电大学,北京,中国 Guiyang Luo 机构:网络与交换技术国家重点实验室,北京邮电大学,北京,中国 Jinglin Li 机构:网络与交换技术国家重点实验室,北京邮电大学,北京,中国 ###### 摘要 协同感知通过多智能体信息共享增强环境理解,但其在实际场景中的性能受限于异构传感器模态和模型架构。近期基于协议的两阶段方法通过将异构特征映射到共享协议空间来缓解此问题;然而,独立训练的模态特定转换器通常会生成模态特定的伪协议分布,导致语义不一致和误差累积,这在模态差异较大的场景中尤为突出。为解决此问题,我们提出了CauseCollab,一个因果统一且模态无关的网络。CauseCollab从因果视角构建协议空间中的表征学习,通过因果度量学习明确分离语义因子与模态特定的统计混淆因素。同时,CauseCollab采用上下文引导的统一转换器处理异构模态,以确保跨模态语义一致性。此外,集成新模态只需训练带有少量参数的适配器即可。在OPV2V和DAIR-V2X数据集上的大量实验表明,CauseCollab达到了最先进的性能,在模态差距较大的场景中提升更为显著。 ###### 关键词: 机器学习,异构协同感知,多智能体,因果推断 ††作者注:同等贡献 ## 1 引言 协同感知通过通信在多个智能体间共享中间特征,使它们能够互补各自的感知盲区,被广泛视为提高自动驾驶系统鲁棒性的关键技术(Arnold et al., 2022; Han et al., 2023; Liu et al., 2023)。近年来,大量研究集中于增强同构协作的性能(Liu et al., 2020; Hu et al., 2022; Xu et al., 2022b)。然而,在实际部署中,协同智能体往往来自不同的制造商和平台,在传感器类型、体素大小和网络架构方面存在显著差异,使得中间特征难以融合,限制了协同感知的实际效果。 为解决协同感知中的异构性问题,先前工作探索了特征转换模块,将相邻智能体的异构模态特征映射到自车的本地空间(Zhao et al., 2023; Yin et al., 2024)。现有方法大致可分为两类。第一类(Xu et al., 2023; Lu et al., 2024)为每一对异构模态学习专用映射以实现单阶段对齐,但随着模态数量增加,训练成本快速增长,可扩展性较差。第二类(Luo et al., 2024; Gao et al., 2025)引入统一的协议模态作为中间表示空间,并为每个模态训练一个转换器和一个重建器,将异构特征映射到该协议空间,在保持强大性能的同时实现了更好的可扩展性。 尽管基于协议空间的两阶段异构自适应方法具有良好的可扩展性,但其性能往往受到阶段间误差累积的限制。当转换器为每个模态独立训练时,每个模态倾向于学习其本地表示与协议表示之间局部自洽的映射。这种行为导致协议空间中出现不一致的伪协议分布。因此,即使所有特征都投影到统一的协议空间后,不同模态之间仍可能存在显著的语义响应和统计分布差异,这削弱了本地语义重建的有效性。 当模态差距较大时,此问题变得尤为明显,伪协议分布常在背景区域引入噪声响应和虚假激活。根本原因是现有方法通常仅将协议空间建模为分布对齐的中介,未能明确表征哪些语义因子应在跨模态间共享,以及哪些模态特定的统计混淆因素需要被分离。 为解决此问题,我们从因果视角提出了一个统一的两阶段框架。与先前方法将协议空间视为可逆中介并强调分布匹配不同,我们的框架在第一阶段关注语义提取和模态因子分离,第二阶段则专注于模态特定的本地语义重建。 具体而言,在第一阶段,我们采用由语义上下文提取器(SCE)和上下文引导的动态优化器(CGDR)组成的统一转换器进行多模态混合训练。通过以全局语义为锚点约束局部特征优化,减少背景引起的对齐偏差。同时,我们构建了一个结构因果模型(SCM)(Schölkopf, 2022),如图2所示,以语义组成部分为视角表征异构模态间的关系。通过基于因果度量学习的反事实干预策略,我们显式驱动每个模态的协议表示逼近弱观测的协议模态。这抑制了由残余模态偏差和背景噪声引起的伪协议偏移,从而实现跨模态统一的语义对齐。我们设计了基于SPD特征几何的掩码引导干预模块(MGI-SPD)来实施因果干预。在语义一致的协议空间基础上,第二阶段为每个模态独立训练一个本地语义重建器,将特征语义恢复至本地模态。当引入新模态时,我们冻结统一转换器的主干,仅训练轻量级适配器将新模态投影到语义一致的协议空间,从而以最小参数成本实现扩展。 - • 我们提出了CauseCollab,一个用于异构协同感知的因果统一且模态无关的网络。它在转换过程中分离了模态特定的统计混淆因素,并基于因果度量学习实现了语义一致协议空间的学习。针对中间特征,我们设计了名为基于SPD特征几何的掩码引导干预模块。 - • 我们设计了一个由语义上下文提取器和上下文引导的动态优化器组成的统一转换器,以确保跨模态语义一致性。同时集成了一个轻量级适配器,使得新模态的适应仅需最小参数成本。 - • 在OPV2V和DAIR-V2X数据集上的大量实验表明,CauseCollab在现有异构协同感知方法中达到了最先进水平,并在模态差距较大的场景中显著提升了感知精度。 ## 2 相关工作 ### 2.1 协同感知 协同感知允许多个智能体共享和融合多视图信息,缓解了单智能体感知固有的视角局限和遮挡问题。中间融合(Li et al., 2021; Xu et al., 2022a)已成为协同感知中的主流范式,因为它在保留丰富中间语义的同时,避免了早期融合的高带宽要求和严格同步约束。诸如Where2comm(Hu et al., 2022)和CodeFilling(Hu et al., 2024)等方法通过结构化特征压缩解决通信瓶颈问题,而CoAlign(Lu et al., 2023)、CoBEVFlow(Wei et al., 2023)和CoDiff(Huang et al., 2025)则侧重于缓解由定位误差和时间延迟引起的特征对齐偏差。 现有协同感知方法在同构多智能体设置中表现出色,但实际部署不可避免地需要异构智能体。近期,一些工作(Xiang et al., 2023; Shao et al., 2024)尝试解决协同感知中的异构性问题。MPDA(Xu et al., 2023)和PnPDA(Luo et al., 2024)采用单阶段和两阶段的邻居到自车转换器,将特征映射到自车的语义空间。HEAL(Lu et al., 2024)通过反向对齐执行一对一映射,而STAMP(Gao et al., 2025)引入了具有本地表示和协议表示之间可逆映射的协议空间。NegoCollab(Shao et al., 2025)通过知识蒸馏学习通用表示。与先前方法不同,我们的方法旨在消除协议空间中由异构模态引起的伪协议分布,并学习一个语义一致的统一协议表示。 ### 2.2 因果推断 因果推断旨在区分真实的因果因素与虚假相关性,表征变量间的因果关系,并估计不受混淆因素影响的干预效应。近年来,因果推断已被引入计算机视觉任务(Wang et al., 2024; Li et al., 2024)以提升模型鲁棒性。CIIM(Yan et al., 2024)探索因果不变交互以学习模态一致的嵌入。CWNet(Zhang et al., 2025)将因果推理应用于低光图像增强,在增强过程中强调语义信息。MSFT(Qiao et al., 2025)将因果干预纳入时间序列预测,以解决由不同时间尺度引起的混淆效应。我们将结构因果模型引入协同感知,并设计了一个作用于中间特征的新型干预模块,从而实现更稳健的跨模态语义对齐。 ## 3 方法 参见标题图1:CauseCollab的总体架构。CauseCollab包括一个通过因果建模实现模态无关协议语义转换的阶段(阶段一)和一个模态特定的本地语义重建阶段(阶段二)。统一转换器融合了SCE和CGDR模块以推导出语义一致的表示。 ### 3.1 总体流程 CauseCollab的总体架构如图1所示。我们关注异构协同感知设置,其中自车智能体$\varepsilon$在感知过程中接收来自多个协同智能体$V=\{1,...,N\}$的观测。由于协同智能体可能属于不同的传感器模态,模态集合记为$\mathcal{M}$,直接进行特征融合会面临显著的模态差异。 对于任意协同智能体$i \in \mathcal{V}$,其原始观测表示为$x_i^{m_i} \in \mathcal{X}^{m_i}$,其中$m_i \in \mathcal{M}$表示智能体$i$的传感器模态。自车智能体的观测表示为$x_{\varepsilon}^{m_{\varepsilon}}$。对于每个模态$m$,我们引入一个模态特定编码器$E^{m}(\cdot)$,将原始输入映射到特征表示: $f_i = E^{m_i}(x_i^{m_i}), \quad f_{\varepsilon} = E^{m_{\varepsilon}}(x_{\varepsilon}^{m_{\varepsilon}})$, (1) 其中$f_i, f_{\varepsilon} \in \mathbb{R}^{C \times H \times W}$分别表示协同智能体和自车智能体的模态特征。 在阶段一,我们引入一个共享的协议空间$\mathcal{P}$,并将协同智能体的特征投影到此空间以获得统一的语义表示,其中每个协同特征被转换为其协议表示$p_i \in \mathcal{P}$。 在阶段二,自车智能体使用一个重建器$R^{m_{\varepsilon}}(\cdot)$将协议特征映射回本地空间$\mathcal{L}$,得到重构的协同特征$\tilde{f}_i \in \mathcal{L}$。然后,自车特征$f_{\varepsilon}$和所有重构的协同特征$\{\tilde{f}_i\}_{i=1}^{N}$通过一个金字塔融合模块$\Phi_{\varepsilon}(\cdot)$融合,以获得多尺度融合特征: $F_{\text{pyramid}} = \Phi_{\varepsilon}(f_{\varepsilon}, \tilde{f}_1, \ldots, \tilde{f}_N)$. (2) 最后,融合特征被输入任务头$H_{\varepsilon}(\cdot)$以产生最终的检测输出: $z = H_{\varepsilon}(F_{\text{pyramid}})$. (3) ### 3.2 阶段一:通过因果建模的协议语义转换 ##### 结构因果建模。 为了区分模态不变的语义因子与需要被抑制的模态特定统计混淆因素,我们在阶段一引入结构因果建模(SCM)以明确表征表征的因果生成过程。
相似文章
通用多模态基础模型
本文介绍了一种通用多模态基础模型,能够处理任意模态组合与预测任务,通过在具有多样化因果结构的大规模合成数据集上训练,实现了具有竞争力的性能。
C3-UniMM: 基于超对齐与共享解码空间的因果循环一致性统一多模态建模
本文介绍了C3-UniMM,这是一个基于因果循环一致性和超对齐的统一多模态建模框架,旨在通过增强结构一致性来改善跨模态理解和生成。
CausaLab: 面向AI科学家的可扩展交互式因果发现环境
CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。
多模态属性图的上下文感知模态-拓扑协同对齐
提出CoMAG,一个用于多模态属性图的统一骨干网络,它学习任务自适应可靠上下文并执行模态保持对齐,在图级预测、模态匹配和图条件生成上达到最先进结果。
CUSP: 多智能体多模态推理的可分解集体不确定性
CUSP 是一个无需训练的框架,通过语义意见池化来量化多智能体多模态系统中的集体不确定性,相比基线方法提高了可靠性和准确性。