CertBind:从多模态连接到可认证检索决策
摘要
CertBind 提出了一种多尺度理论,用于冻结多模态编码器连接器的可认证组合,通过回退(fallback)和弃权(abstain)机制实现可认证的检索决策。在共享路径上的评估表明,它能够恢复原生 CLIP 检索性能,同时在旁路分支上保持无损(no-harm)。
查看缓存全文
缓存时间: 2026/08/10 08:01
CertBind:从多模态连接到可认证的检索决策 来源:https://arxiv.org/html/2608.06516 Shuheng Cao1,∗, Zhenhao Zhang5,7,∗, Ruiqi Chen2,∗, Renjie Cao3,†, Weijia Zhang4,†, Siyu Zhang1,†, Jiaxin Liu5,†, Xiangyu Zeng6,†, Haotian Geng7,†, Fan Gu8,‡ ###### 摘要 轻量级连接器使冻结的多模态编码器在表示层面可组合。部署阶段在任务决策层面暴露了第二个问题。一条连接路径可以在扩展跨模态覆盖范围的同时,改变已有的原生检索能力。我们提出 CertBind,一种面向冻结多模态连接器图的可认证组合的多尺度理论。在节点尺度上,原生锚点在给定的图表模型下建立精确的任务识别边界。在边尺度上,感知契约的保形秩提供全图范围的族系误差控制。在路径尺度上,感知重叠的预算与干净校准在声明条件下产生有限样本恢复半径。在查询尺度上,该半径产生一个覆盖的 top-k 候选集;当其大小等于 k 时,该集合成为点证书。因此,CertBind 将受支持的路径保留为 Direct,仅将有标记的路径送入恢复流程,对决定性的恢复返回 Certified,对未解决的查询返回 Abstain。被评估的 C-MCR 共享路径将原生 CLIP R@1 从 0.524 降至 0.290。生产环境回退恢复了干净检索的 0.963±0.002,而通过分支记录的无害值为 1.000。CertBind 将多模态可组合性从连接的表示扩展到可认证的任务决策。 ## 引言 冻结的多模态编码器在图像、文本、音频和视频上提供强大但碎片化的表示。轻量级连接器映射使这些编码器无需重建通用模型即可组合。现有系统要么综合一个公共空间,要么将新模态附加到保留的基础空间中(Wang et al. 2023(https://arxiv.org/html/2608.06516#bib.bib1);Zhang et al. 2024(https://arxiv.org/html/2608.06516#bib.bib2);Wang et al. 2024(https://arxiv.org/html/2608.06516#bib.bib6),2025(https://arxiv.org/html/2608.06516#bib.bib7))。这一进展在冻结空间之间建立了表示层面的可组合性,并为下游任务创造了多条路径。更广泛地说,多模态模型越来越多地通过决策级能力来评估,例如显式功能推理和动作区域定位(Wang et al. 2026(https://arxiv.org/html/2608.06516#bib.bib31))。一个发布的连接器检查点使决策级部署问题变得可见。在相同的原生 CLIP 图像到文本任务上,被评估的 C-MCR 共享路径将 R@1 从 0.524 降至 0.290。一条路径可以扩展多模态覆盖范围,却不一定成为既有原生路径的正确替代。因此,连接器组合必须将扩展和保留视为不同的部署决策来支持。 决策级可认证性是多尺度的,因为检索输出继承了产生它的图的歧义性。在节点尺度上,图一致性相对于固定的原生库留下了一个残余目标规范。在边尺度上,异构的连接器契约需要全图校准。在路径尺度上,共享故障发生率决定了重叠路径的价值。在查询尺度上,观测到的边界裕度决定了恢复的分数是否支持点 top-k 输出。每个尺度解决一种不同的歧义,并为下一个尺度提供所需证据。 CertBind 发展了一种从图结构到检索决策的可认证组合的多尺度理论。在节点尺度上,原生锚点识别与任务相关的目标坐标。感知契约的筛选确定注册的直接边是否仍然受支持。多数路径横断预算和干净校准通过失效多样性路径恢复被标记的查询。一个覆盖的 top-k 候选集随后认证决定性的输出,否则保留集合值不确定性。由此产生的保留优先策略将到达的证书级别映射为一种部署动作。受支持的路径返回 Direct,被标记的路径进入恢复,决定性的恢复返回 Certified,未解决的查询返回 Abstain。图 1(https://arxiv.org/html/2608.06516#Sx1.F1)展示了从图结构到最终检索决策的这一过程。 本工作为冻结连接器图上的可认证多模态组合做出了三项贡献。 1. 从图一致性到原生任务分数的可认证组合。我们通过暴露残余目标规范,将表示连通性与原生任务识别分开。我们刻画了任务分数识别,建立了精确的通用锚点秩,并在噪声锚点下界定了注册误差。 2. 从边到查询的多尺度证书链。契约分层保形秩和 Holm 控制在全图范围内控制干净边的误标记。多数路径横断预算量化了重叠路径之间共享故障下的鲁棒性。这些结果共同产生一个覆盖的 top-k 候选集和端到端误差分解。 3. 保留优先的动作与图设计。一个三态规则将受支持路径、决定性恢复和未解决查询分别映射到 Direct、Certified 和 Abstain。精确路径预算是一个配额覆盖整数规划,而边不相交路径产生多项式 Menger 证书。已发布系统的案例量化了保留、扩展和恢复的操作风险。 完整证明、计算细节和额外部署记录见补充材料。 图 1 说明:CertBind 在节点、边、路径和查询尺度上认证多模态组合。(A)在节点尺度上,当原生锚点张成声明的任务子空间时,它们固定了目标规范。(B)在边尺度上,保形秩校准感知契约的证据,Holm 控制全图决策,受支持的边将注册的直接路径保留为 Direct。(C)在路径和查询尺度上,被标记的边进入感知重叠的恢复。当覆盖的 top-k 候选集包含 k 个条目时,CertBind 返回 Certified,否则返回 Abstain。 ## 相关工作 ### 统一空间与连接器图。 ImageBind、LanguageBind 和 UniBind 构建广泛的共享表示(Girdhar et al. 2023(https://arxiv.org/html/2608.06516#bib.bib3);Zhu et al. 2024(https://arxiv.org/html/2608.06516#bib.bib4);Lyu et al. 2024(https://arxiv.org/html/2608.06516#bib.bib5))。C-MCR 和 Ex-MCR 连接冻结的对比空间,而 FreeBind 和 OmniBind 在多个空间之间进行融合或路由(Wang et al. 2023(https://arxiv.org/html/2608.06516#bib.bib1);Zhang et al. 2024(https://arxiv.org/html/2608.06516#bib.bib2);Wang et al. 2024(https://arxiv.org/html/2608.06516#bib.bib6),2025(https://arxiv.org/html/2608.06516#bib.bib7))。Multi-Way Alignment 从匹配样本构建联合一致的宇宙(Achara et al. 2026(https://arxiv.org/html/2608.06516#bib.bib8))。这些系统建立了表示层面的可组合性,并支持广泛的下游效用。CertBind 从由此产生的冻结图出发,研究部署后支持的任务决策。 ### 表示可识别性与拼接。 线性可识别性、CKA、模型拼接、相对表示和模态间隙分析研究了学习到的空间何时共享几何或进行通信(Roeder et al. 2021(https://arxiv.org/html/2608.06516#bib.bib13);Kornblith et al. 2019(https://arxiv.org/html/2608.06516#bib.bib14);Bansal et al. 2021(https://arxiv.org/html/2608.06516#bib.bib15);Moschella et al. 2023(https://arxiv.org/html/2608.06516#bib.bib16);Liang et al. 2022(https://arxiv.org/html/2608.06516#bib.bib17);Huh et al. 2024(https://arxiv.org/html/2608.06516#bib.bib18))。这些分析共同建立了学习到的表示空间之间的几何可比性。CertBind 将剩余的图表歧义专门化为原生库检索,其中原生锚点决定声明的任务分数是否可识别。 ### 鲁棒恢复与保形推断。 循环边消息传递恢复损坏的群值相对测量(Lerman and Shi 2022(https://arxiv.org/html/2608.06516#bib.bib9))。噪声对应方法在训练期间修复样本对(Huang et al. 2021(https://arxiv.org/html/2608.06516#bib.bib10))。坐标中位数提供经典的干净多数鲁棒性(Huber and Ronchetti 2009(https://arxiv.org/html/2608.06516#bib.bib20))。保形秩提供有限样本校准(Vovk et al. 2005(https://arxiv.org/html/2608.06516#bib.bib19))。Holm 逐步下降程序在有效边际检验之间的任意依赖性下控制族系误差(Holm 1979(https://arxiv.org/html/2608.06516#bib.bib28))。CertBind 将鲁棒恢复和校准不确定性通过共享路径故障和观测到的任务边际传递到检索决策。 先前的工作已经建立了多模态连接、表示比较、鲁棒恢复和校准推断。CertBind 将这一决策层发展为一种多尺度理论,将原生任务识别
相似文章
嵌入模型如何绑定概念?
本文探讨了CLIP为何在概念绑定上表现不佳,表明虽然CLIP的绑定函数复杂度高,但受控的Transformer模型可以通过乘法交互学习复杂度较低的绑定函数,从而更好地泛化。
高風險醫療檢索增強生成的聲明選擇性認證
本文針對高風險醫療檢索增強生成(RAG)提出聲明選擇性認證,將響應分解為可驗證的聲明,並根據證據進行評分,通過意圖感知選擇器產生操作(完整、部分、衝突、棄權),實現了低無支持聲明風險和高操作準確性。
证书失效时:嵌入式神经接口模型的统一安全框架
本文表明,嵌入式神经接口模型的正式鲁棒性证书可能在任务准确率因对抗攻击而崩溃时仍能通过,并提出一个统一的实证审计框架,以解决训练目标与操作用户福利之间的对齐失败问题。
DMV-Bench: 通过偶然线索注入诊断长周期多模态智能体的视觉记忆
介绍DMV-Bench,一个用于评估多模态智能体视觉记忆的交互式基准测试,该测试利用产品图像中的偶然视觉线索,并提出了DualMem,一种双编码记忆架构,在各种链长度上优于纯文本和其他多模态基线。
TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification
This paper introduces TIER-MoE, a risk-guided subspace mixture-of-experts model for multimodal biomedical classification that estimates sample-specific modality reliability from out-of-fold predictions and routes modalities to experts, improving performance and calibration on four public datasets.