基于预训练Transformer的感知模型的对抗鲁棒溯因融合

arXiv cs.AI 论文

摘要

本文提出了一种无需领域知识的元认知层,用于融合多个基于预训练ViT的感知模型,利用标签向量池和基于一致性的溯因。在干净数据上,它可与多数投票基线持平,并且对协同标签翻转攻击尤其鲁棒。

arXiv:2608.04190v1 公告类型:新 摘要:在新型环境中部署预训练感知模型,会因分布偏移而降低其准确性,仅靠集成模型并不能恢复其性能:诸如多数投票之类的组合器以召回率换取精确率,并且对协同故障很脆弱。先前的元认知方法学习逻辑规则来标记模型错误,但依赖手工编写的领域知识线索(物体尺寸先验、分割掩码),这些线索无法迁移到真正新颖的场景中。我们证明,通过利用向量空间几何,可以在无需任何领域知识的情况下学习这一元认知层:基于每个模型自身训练嵌入构建的逐模型标签向量池(LVP),根据检测结果相对于训练确定原型的几何关系生成错误检测规则,在测试集上的每个F1指标上与领域知识规则的差距不超过$0.002$。由于该方法仍然是神经符号的,这些几何规则共享单一逻辑框架,并且在可用时仍可由领域知识补充。我们将多个不完美的基于ViT的检测器的融合表述为一个基于一致性的溯因问题,在测试时通过精确整数规划(IP)和多项式时间启发式算法求解。在一个包含15个天气偏移测试集和6个ViT检测器的航空影像基准上,我们无需领域知识的层在干净数据上与最强的多数投票变体相匹配(F1差距在$0.005$以内),并且与所有多数投票基线不同,它在协同标签翻转攻击下保持其性能:在$90\%$翻转率下,其平均F1为$0.42$,而MV-Plurality为$0.35$(相对提升$22\%$),且一旦翻转率超过$0.4$,它在\emph{每一个}测试集上都取得最高F1。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:41

# 预训练Transformer感知模型的对抗鲁棒溯因融合
来源:https://arxiv.org/html/2608.04190
###### 摘要

在新型环境中部署预训练感知模型会因分布偏移而降低其准确性,单独将它们组合在一起也无法恢复这种损失:诸如多数投票之类的组合器以召回率换取精确率,并且对协同故障很脆弱。先前的元认知方法学习逻辑规则来标记模型的错误,但依赖手工编写的领域知识线索(如目标尺寸先验、分割掩码),这些线索无法迁移到真正新颖的场景中。我们表明,这一元认知层可以*无需任何领域知识*地学习,通过利用向量空间的几何结构:由每个模型自身的训练嵌入构建的每模型*标签向量池*(LVP),可以根据检测结果相对于训练确定原型的几何结构产生错误检测规则,在测试集上的每个F1指标上达到与领域知识规则相差0.0020.002以内的性能。由于该方法仍然是神经符号的,这些几何规则共享单一的逻辑框架,并且在有领域知识时仍可对其进行补充。我们将多个不完美的基于ViT的检测器的融合视为一个*基于一致性的溯因*问题,在测试时通过精确整数规划(IP)和多项式时间启发式算法求解。在一个包含15个天气偏移测试集和六个ViT检测器的航空影像基准上,我们的无领域知识层在干净数据上匹配最强的多数投票变体(F1相差0.0050.005以内),并且与每个多数投票基线不同,在协同标签翻转攻击下仍能保持性能:在90%90\%的翻转率下,其平均F1为0.420.42,而MV-多重性为0.350.35(相对提高22%22\%),并且一旦翻转率超过0.40.4,其在*每个*测试集上均获得最高F1。

## 引言

预训练感知模型现在是图像和视频中分类与检测的默认选择(Han等人2021 (https://arxiv.org/html/2608.04190#bib.bib15);Radford等人2021 (https://arxiv.org/html/2608.04190#bib.bib16)),在实践中它们被部署在训练时所处的分布上。我们关注*在新型环境中部署*的设置:运行条件与训练时不同,且没有目标分布的标记数据。灾后应急响应,或对没有代表性影像的偏远地区进行援助任务,都是具体的例子——场景相对于模型所见过的任何事物都是*新颖*的。

最近的工作(Leiva等人2026 (https://arxiv.org/html/2608.04190#bib.bib1))将溯因学习(Dai等人2019 (https://arxiv.org/html/2608.04190#bib.bib20))和元认知错误检测规则(Kricheli等人2024 (https://arxiv.org/html/2608.04190#bib.bib6))的思想结合起来,用于在新型环境中对视觉模型进行测试时集成。然而,该方法需要建立学习者用来推导规则的候选元认知线索。这意味着系统设计者必须对错误的潜在原因具有一定的事前领域知识,这可能导致定制化的系统无法泛化。此外,尽管该工作显示出相对于基线的显著改进,但它没有检验某些感知模型可能遭受对抗扰动的情况。

在此,我们扩展了(Leiva等人2026 (https://arxiv.org/html/2608.04190#bib.bib1))的工作,消除了其两个关键限制。工作假设相同:部署*多个*模型并推理其联合(不)一致性,可以恢复单模型错误过滤所丢弃的召回率。我们以两种方式扩展这一思路,我们认为这两种方式对于新颖和对抗性部署是必要的。

贡献1:无领域知识的元认知层。我们用一种仅使用每个模型自身嵌入的学习信号取代手工编写的领域线索。借鉴持续学习中与CLIP一起使用的*标签向量池*思想(Ma等人2025 (https://arxiv.org/html/2608.04190#bib.bib2)),我们用模型训练检测结果中获得的少量原型向量表示每个(模型,类别),并在新检测到这些池的距离上训练一个轻量级错误检测器。由此产生的“LVP错误概率”是错误检测规则使用的唯一条件——无需掩码、大小先验或场景语义。这使得整个元认知栈可以迁移到任何新模型或场景。

贡献2:对多数投票攻击的鲁棒性。多数投票是组合模型的典型方法,但它很脆弱,因为能够协调少数模型的对手可以翻转投票。我们研究了一种*协同标签翻转*攻击,其设计目的正是击败多重投票,并表明我们的溯因公式在性能下降方面远比任何多数投票变体优雅,因为它基于跨模型的*一致性*而非原始计数来接受预测。

参见图注 图1:概述。(顶部)离线阶段,每个η\\eta预训练模型通过kk均值将其训练检测嵌入聚类为每类原型池Pi,c={μi,c1,μi,c2,μi,c3}\\mathcal{P}_{i,c}=\{\mu_{i,c}^{1},\mu_{i,c}^{2},\mu_{i,c}^{3}\}(⋆\\star=质心)来构建标签向量池。具有嵌入e的新检测被映射为φ(e)∈R3m\\phi(e)\\in\\mathbb{R}^{3m},每(模型,类别)随机森林产生错误概率s∈[0,1]s\\in[0,1];通过EDR规则学习器(严格度ε\\epsilon)对s≥τs\\geq\\tau进行阈值化,产生错误检测程序Πi\\Pi_{i}——不使用领域知识,也不使用目标分布数据。(底部)在测试时,η\\eta模型感知新颖场景;它们的预测与每模型程序Πi\\Pi_{i}一起构成逻辑程序Π\\Pi。基于一致性的溯因选择最大化覆盖Pred(H)\\mathit{Pred}(H)且满足Inc(H)≤δ\\mathit{Inc}(H)\\leq\\delta的接受集,通过精确整数规划(IP)或多项式时间启发式搜索(HS)求解,每者都有可选平局决胜器(TB)。规则仅从训练数据中为每个模型独立学习,因此没有测试时泄漏。与多数投票不同,组合器在协同标签翻转攻击下优雅地退化,因为接受是由一致性驱动的,而非计数驱动。如图1 (https://arxiv.org/html/2608.04190#Sx1.F1)所总结,η\\eta模型感知新颖场景;它们的预测以及独立为每个模型学习的LVP派生元认知规则被编码到逻辑程序中。然后我们溯因一个接受的预测子集,在将逻辑不一致性保持在预算内的同时最大化覆盖。我们推导出精确整数规划(IP)和可扩展的启发式搜索(HS),每者具有可选平局决胜器(TB)。规则仅从每个模型的训练数据中学习,因此没有测试时泄漏,也不假设模型如何协同工作。

## 相关工作

错误检测与修正规则。关于错误检测规则(EDR)的先前工作依赖于对错误潜在原因存在先验知识的假设——本文放宽了这一假设(Xi等人2024 (https://arxiv.org/html/2608.04190#bib.bib5);Kricheli等人2024 (https://arxiv.org/html/2608.04190#bib.bib6))。最近EDR的使用(Leiva等人2026 (https://arxiv.org/html/2608.04190#bib.bib1))在溯因框架中利用这一方法进行测试时集成,我们在本文中将其用作基线。我们在两个方面有所不同:我们针对*多个*模型进行操作,并且我们的规则*条件*来自学习的LVP错误检测器,而非领域特定的谓词。我们在此仅使用错误*检测*规则,不过修正规则也适用于同一框架。

溯因学习。ABL(Dai等人2019 (https://arxiv.org/html/2608.04190#bib.bib20))也使用带领域知识的溯因,但目的是在训练时改进模型,并假设测试环境并非完全新颖;关于新概念的后续工作(Cai等人2021 (https://arxiv.org/html/2608.04190#bib.bib21))以类似EDCR的方式扩展了标签方案。我们仅在*测试时*使用溯因,并改变数据分布而非概念方案。经典的基于一致性的诊断(Reiter 1987 (https://arxiv.org/html/2608.04190#bib.bib23);Poole 1989 (https://arxiv.org/html/2608.04190#bib.bib22))以及基于逻辑的溯因的复杂性(Eiter and Gottlob 1995 (https://arxiv.org/html/2608.04190#bib.bib4))启发我们的公式;据我们所知,这些机制尚未应用于模型集成的测试时感知。

标签向量池与原型。LVP-CLIP(Ma等人2025 (https://arxiv.org/html/2608.04190#bib.bib2))为每个类别/任务保留一个标签向量*池*,而不是单个文本嵌入,从而能够无遗忘地进行持续学习。这在概念上与原型网络相关(Snell等人2017 (https://arxiv.org/html/2608.04190#bib.bib24))。我们重新利用池思想不是用于分类,而是用于*错误检测*:到每类原型池的距离是元认知分类器的特征。

测试时训练与适应。TTT(Sun等人2020 (https://arxiv.org/html/2608.04190#bib.bib25))通过自监督在测试时调整网络本身。这是互补的:经过TTT适应的模型只是我们框架中的另一个预训练模型,并且可以通过我们的溯因层组合多个TTT变体。

集成的对抗鲁棒性。对抗样本和投毒已被广泛研究(Goodfellow等人2014 (https://arxiv.org/html/2608.04190#bib.bib26);Madry等人2017 (https://arxiv.org/html/2608.04190#bib.bib27);Biggio等人2012 (https://arxiv.org/html/2608.04190#bib.bib28);Biggio and Roli 2018 (https://arxiv.org/html/2608.04190#bib.bib29);Ming等人2024 (https://arxiv.org/html/2608.04190#bib.bib30)),并且集成并非自动鲁棒(Tramèr等人2017 (https://arxiv.org/html/2608.04190#bib.bib31))。我们研究一种专门针对*组合器*的威胁:使少数模型的协调子集在错误标签上达成一致,从而击败多重投票。我们的基于一致性的接受方法被证明对此类攻击更具抵抗力。

## 基于一致性的溯因

我们总结了所基于的框架;尽管公式遵循(Leiva等人2026 (https://arxiv.org/html/2608.04190#bib.bib1)),我们保持其自包含性。

预备知识。我们考虑对感知数据Ω\\Omega上的目标识别,其中有η\\eta个模型F={f1,...,fη}\\mathcal{F}=\{f_{1},\dots,f_{\eta}\},预测m个类别C={c1,...,cm}\\mathcal{C}=\{c_{1},\dots,c_{m}\}。在唯一名称假设1 1实现唯一名称假设的细节见补充材料(Sec. A)。下,每个被模型检测到的对象ω∈Ω\\omega\\in\\Omega产生一个事实fi(ω)=cjf_{i}(\omega)=c_{j};这些事实(“观测”)的集合为OO。由于模型会分歧并犯错,我们引入accept(i,c)\\mathit{accept}(i,c),当我们选择信任模型fif_{i}的类别cc输出时为真。所有接受原子的集合为H\\mathcal{H};子集H⊆HH\\subseteq\\mathcal{H}是一个*假设*。

每个模型fif_{i}携带一个逻辑程序Πi\\Pi_{i},其中包含以下形式的元认知规则:

error(i,c,ω)←(fi(ω)=c)∧cond(ω)。\\mathit{error}(i,c,\omega)\\leftarrow(f_{i}(\omega)=c)\\wedge\\mathit{cond}(\omega)。即,如果线索cond\\mathit{cond}对ω\\omega触发,并且fif_{i}将其标记为cc,则怀疑存在错误。这里的新颖之处在于cond\\mathit{cond}是单一的LVP派生谓词LVP\_Error\_Probability\_GEτ\\mathrm{LVP\\\_Error\\\_Probability\\\_GE}_{\tau},无需领域知识即可学习。辅助程序Πhelper\\Pi_{\\textit{helper}}包含

assign(c,ω)←¬error(i,c,ω)∧(fi(ω)=c)∧accept(i,c)\\mathit{assign}(c,\omega)\\leftarrow\\neg\\mathit{error}(i,c,\omega)\\wedge(f_{i}(\omega)=c)\\wedge\\mathit{accept}(i,c),而领域程序Πdom\\Pi_{\\textit{dom}}包含完整性约束¬assign(c′,ω)←assign(c,ω)\\neg\\mathit{assign}(c^{\prime},\omega)\\leftarrow\\mathit{assign}(c,\omega),禁止一个对象被赋予冲突标签。这一完整性约束是用于判断一致性的*唯一*领域知识,并且它是任务固有的(类别标签的互斥性),而非特定于环境的专业知识:它不需要分割掩码、大小先验或其他场景产物,并且在任何新颖领域中保持不变。所有判别性的、场景特定的知识反而存在于学习的错误检测规则Πi\\Pi_{i}中;保持一致性层最小化是刻意的,这使得相同的溯因机制能够跨领域迁移。我们写作Π=Πdom∪Πhelper∪(⋃iΠi)\\Pi=\\Pi_{\\textit{dom}}\\cup\\Pi_{\\textit{helper}}\\cup(\bigcup_{i}\Pi_{i});分层和受限否定,加上实例大小,使得推理易于处理且单调,并在PyReason中实现(Aditya等人2023 (https://arxiv.org/html/2608.04190#bib.bib14))。

溯因问题。遵循基于一致性的溯因(Eiter and Gottlob 1995 (https://arxiv.org/html/2608.04190#bib.bib4);Peng and Reggia 1990 (https://arxiv.org/html/2608.04190#bib.bib3)),我们寻找H⊆HH\\subseteq\\mathcal{H},使得H∪O∪ΠH\\cup O\\cup\\Pi是一致的。我们允许少量受控的不一致性:Inc(H)\\mathit{Inc}(H)是Πdom\\Pi_{\\textit{dom}}中未被(H∪O∪Π)∖Πdom(H\\cup O\\cup\\Pi)\\setminus\\Pi_{\\textit{dom}}蕴含的基础规则的归一化数量,δ∈[0,1]\\delta\\in[0,1]限制它。在一致假设中,我们更偏好信息量最大的一个:Pred(H)\\mathit{Pred}(H)统计由(H∪O∪Π)∖Πdom(H\\cup O\\cup\\Pi)\\setminus\\Pi_{\\textit{dom}}的最小模型蕴含的assign(c,ω)\\mathit{assign}(c,\omega)原子。我们*最大化*Pred(H)\\mathit{Pred}(H),因为(i)更多赋值意味着训练良好的模型上被怀疑的错误更少,(ii)我们希望高召回率,并且(iii)Πhelper\\Pi_{\\textit{helper}}已经防止过度赋值。问题为

maxH⊆H⁡Pred(H)s.t.Inc(H)≤δ,(H∪O∪Π)∖Πdom一致。\\max_{H\\subseteq\\mathcal{H}}\\mathit{Pred}(H)\,\\text{s.t.}\,\\mathit{Inc}(H)\\leq\\delta,\;(H\\cup O\\cup\\Pi)\\setminus\\Pi_{\\textit{dom}}\\text{ 一致}。规则学习器暴露了一个超参数ε\\epsilon,可解释为丢弃被标记预测后期望的召回率降低;我们会扫描它,并启发式设置它。

整数规划(IP)。使用二元变量Ac,ωA_{c,\omega}(对象ω\\omega被赋予类别cc),Conω,(c,c′)\\textit{Con}_{\\omega,(c,c^{\prime})}(冲突指示符),Elimf,c\\textit{Elim}_{f,c}(排除模型ff的类别cc输出;Elimf,c=0⇔accept(f,c)∈H\\textit{Elim}_{f,c}=0\\Leftrightarrow\\mathit{accept}(f,c)\\in H),Xω,f,cX_{\\omega,f,c}(考虑(ω,f,c)(\\omega,f,c)),以及常量predf,c,ω\\mathit{pred}_{f,c,\\omega},我们求解

max∑ω∑cAc,ω\\max\\sum_{\\omega}\\sum_{c}A_{c,\\omega},满足Xω,f,c≤1−Elimf,cX_{\\omega,f,c}\\leq 1-\\textit{Elim}_{f,c};Xω,f,c⋅predf,c,ω≤Ac,ωX_{\\omega,f,c}\\cdot\\mathit{pred}_{f,c,\\omega}\\leq A_{c,\\omega};Ac,ω≤∑fXω,f,c⋅predf,c,ωA_{c,\\omega}\\leq\\sum_{f}X_{\\omega,f,c}\\cdot\\mathit{pred}_{f,c,\\omega};对于(c,c′)∈IC(c,c^{\\prime})\\in IC,Ac,ω+Ac′,ω−1≤Conω,(c,c′)A_{c,\\omega}+A_{c^{\\prime},\\omega}-1\\leq\\textit{Con}_{\\omega,(c,c^{\\prime})};∑cAc,ω≥1\\sum_{c}A_{c,\\omega}\\geq 1;以及全局b

相似文章

面向密集空间感知的视觉预训练

Hugging Face Daily Papers

本文提出了一种名为掩码边界建模(masked boundary modeling)的自监督视觉预训练范式,该范式通过学习亚像素边界表示来提升密集空间感知能力。由此得到的模型LingBot-Vision在深度估计及其他下游任务中展现出显著改进,证明边界建模是一种可扩展的预训练原则,可用于学习空间结构化的视觉表示。

通过多层组合融合实现情境价值对齐

arXiv cs.AI

本文提出了MCF-CVA,一种用于大型语言模型情境价值对齐的多层组合融合框架,该框架利用多个道德智能体以及扩展-约简过程来更好地捕捉伦理多元主义,并优于单智能体基线方法。