CARGO-VL:面向视觉-语言模型的反事实仲裁与风险约束组优化

arXiv cs.AI 论文

摘要

介绍了CARGO-VL,一种面向视觉-语言模型的组相对优化框架,通过反事实一致性和风险约束控制,改进对冲突图像-文本证据的处理以及不支持答案的回避,并提供了XMC冲突训练资源。

arXiv:2608.04509v1 公告类型:新 摘要:视觉-语言系统将图像与检索到的文本相结合,但这些来源可能相互矛盾,或共同无法支持某个答案。可靠的模型必须识别可信来源,并在两者都不充分时放弃回答。现有的后训练目标对实例独立评分,因此无法在反事实证据变化下强制执行连贯行为。我们提出了CARGO-VL,一种组相对框架,将覆盖对齐、图像正确、文本正确和两者均错(A/V/T/N)证据状态的匹配变体作为一个整体进行优化。其目标将条件正确性与答案不变性、来源等变性以及从答案到弃权的切换的转移奖励相结合,同时采用原始-对偶控制器在不安全答案与过度延迟之间取得平衡。我们还贡献了XMC(扩展模态冲突),一个四条件冲突训练资源,并在CMC-Bench和Modality-Bias上评估迁移效果。在多种随机种子下,CARGO-VL在冲突处理、不支持答案回避和模态平衡方面优于逐点基线。消融实验识别了关系转移信号和自适应风险控制的互补优势,支持反事实一致性作为可靠多模态证据仲裁的实用目标。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:42

# CARGO-VL:面向视觉-语言模型的反事实仲裁与风险约束组优化

Source: https://arxiv.org/html/2608.04509

###### 摘要

视觉-语言系统将图像与检索到的文本结合起来,但这些来源可能相互矛盾,或者共同无法支撑某个答案。可靠的模型必须识别可信的来源,并在两者都不充分时放弃回答。现有的训练后目标对每个样本独立评分,因此无法在反事实证据变化下强制实现连贯的行为。我们提出 CARGO-VL,一个组相对框架,将匹配的变体作为一个整体进行优化,这些变体覆盖对齐、图像正确、文本正确和双错误(A/V/T/N)证据状态。其目标将条件级正确性与转换奖励耦合,涵盖答案不变性、来源等变性以及从作答到弃权的切换,同时通过原始-对偶控制器在不安全答案与过度弃权之间取得平衡。我们还贡献了 XMC(扩展模态冲突),一个四条件冲突训练资源,并在 CMC-Bench 和 Modality-Bias 上评估迁移效果。在多个随机种子下,CARGO-VL 在冲突处理、不支持答案的避免和模态平衡方面优于逐点基线。消融实验表明,关系转换信号与自适应风险控制具有互补收益,支持将反事实一致性作为可靠多模态证据仲裁的实用目标。

## 引言

多模态系统越来越频繁地遇到图像与文本证据相互冲突的情况。在产品照片、图表、文档或检索到的上下文中,一个模态可能是正确的,而另一个模态可能是过时的、对抗性的或不相关的。同样的张力也出现在多模态检索增强生成中,其中图像和检索到的段落看起来都可能合理,但在日期、实体或数字声明上存在分歧(Lewis et al.2020 (https://arxiv.org/html/2608.04509#bib.bib6); Asai et al.2024 (https://arxiv.org/html/2608.04509#bib.bib1); Catapang2026 (https://arxiv.org/html/2608.04509#bib.bib2))。一个可信赖的模型不应仅仅最大化答案准确率:当某一来源胜出时,它应使用正确的模态;当两者都不支持答案时,它应放弃回答。经验上,即使两个通道都可用,强大的视觉-语言模型仍然表现出模态偏好——偏好文本而非图像,或反之(Pezeshkpour, Aminnaseri, and Hruschka2025 (https://arxiv.org/html/2608.04509#bib.bib10)),这使得冲突处理成为一个首要的可靠性问题,而非罕见边缘情况。

CMC-Bench 通过匹配的跨模态证据冲突使这一评估场景具体化(Catapang2026 (https://arxiv.org/html/2608.04509#bib.bib2))。

参见图注Figure 1:图像-文本冲突。一个真实的 CMC 示例支持 2019,而检索到的文本声称 2020。它构建了对齐、图像正确、文本正确和双错误(A/V/T/N)条件,并相对于图像和文本来源对回答进行评分。图1 (https://arxiv.org/html/2608.04509#Sx1.F1) 展示了这种形式的时间冲突。然而,大多数多模态基准仍然只在单一固定上下文下奖励正确回答。这就留下了一个问题:当受控干预使某个模态变得不可靠时,模型是否会改变其证据归属和最终动作。其困难在于关系性:在孤立样本上评分的模型可以获得很高的平均准确率,却在所有 A/V/T/N 条件下对相同内容作答,在图像和文本不一致时引用错误的模态,或者在两个支持均无效时仍然保留答案。逐样本监督微调和标准 RL 训练后优化都基于各自的提示独立优化每次展开(Ouyang et al.2022 (https://arxiv.org/html/2608.04509#bib.bib9); Schulman et al.2017 (https://arxiv.org/html/2608.04509#bib.bib13); Rafailov et al.2023 (https://arxiv.org/html/2608.04509#bib.bib12));它们并不要求在相同问题的匹配干预之间实现连贯转换。同样,弃权也不是单调的——笼统拒答可能看起来安全却未能完成任务,而纯准确率训练可能鼓励不支持的回答——因此安全性和效用必须被视为相互竞争的操作成本,而非单一标量(Geifman and El-Yaniv2017 (https://arxiv.org/html/2608.04509#bib.bib3))。

这些观察结果促使我们设定更严格的训练目标。翻转哪个模态可信,应翻转所遵循的来源;移除两个支持,应将作答翻转为弃权;而容易的对齐收益不能掩盖视觉胜出或双错误失败。这需要一个联合的 A/V/T/N 优化单元、针对局部和关系正确性的奖励,以及对不安全答案和过度弃权的显式预算。

我们提出用于视觉-语言模型的反事实仲裁与风险约束组优化(CARGO-VL)。CARGO-VL 将匹配的 A/V/T/N 组作为优化单元,并联合评分完整组,包含 (i) 严格的逐点证据奖励;(ii) 编码答案不变性、来源等变性和作答到弃权切换的转换奖励;(iii) 保护最弱条件的软最小值;(iv) 在组相对优势归一化之前惩罚不安全答案、过度弃权和答案准确率下降的原始-对偶约束。我们基于 GRPO(Shao et al.2024 (https://arxiv.org/html/2608.04509#bib.bib14)),将组从独立完成改为反事实证据束。

为避免在测试模板上训练,我们通过将 A/V/T/N 方法应用于新的 TextVQA(Singh et al.2019 (https://arxiv.org/html/2608.04509#bib.bib15)) 和带图像 ScienceQA(Lu et al.2022 (https://arxiv.org/html/2608.04509#bib.bib8)) 样本来构建 XMC(扩展模态冲突),使用新标识符、冲突类型分层,以及经过泄漏检查的 CMC-Bench 保留集 / Modality-Bias(Pezeshkpour, Aminnaseri, and Hruschka2025 (https://arxiv.org/html/2608.04509#bib.bib10)) 评估。策略生成自由文本;一个冻结的语义裁判将模糊输出映射到证据标签。我们使用原生 CMC-Bench Table 3 指标(Catapang2026 (https://arxiv.org/html/2608.04509#bib.bib2)) 和 Mixed Signals B=(%Img−%Txt)B=(%Img−%Txt)(Pezeshkpour, Aminnaseri, and Hruschka2025 (https://arxiv.org/html/2608.04509#bib.bib10)) 进行评估,报告种子 {42,43,44}\{42,43,44\} 上的均值。CARGO-VL 在 Table3 (https://arxiv.org/html/2608.04509#Sx4.T3) 中领先,包括最接近零的 BB;消融实验在 Table4 (https://arxiv.org/html/2608.04509#Sx4.T4) 和 Figure4 (https://arxiv.org/html/2608.04509#Sx4.F4) 中复用相同列。

我们的贡献是:

- • 一个用于证据仲裁的束级目标,同时评分逐条件正确性和反事实转换;
- • 一种风险约束 GRPO 过程,在不将可回答案例坍缩为弃权的情况下保持弃权安全性;
- • XMC,一个基于新的 TextVQA 和 ScienceQA 示例的四条件冲突训练集,具有冲突类型分层和经过泄漏检查的 CMC-Bench 保留集 / Modality-Bias 评估;
- • 一个共享的自由文本评估协议,包含分离的冻结语义裁判,并使用原生指标在 CMC-Bench 保留集和 Modality-Bias 上进行多种子迁移评估。

## 相关工作

跨模态冲突与检索条件生成。视觉-语言预训练和指令微调产生了强大的单上下文作答器(Radford et al.2021 (https://arxiv.org/html/2608.04509#bib.bib11); Liu et al.2023 (https://arxiv.org/html/2608.04509#bib.bib7)),而检索增强生成将外部证据注入提示(Lewis et al.2020 (https://arxiv.org/html/2608.04509#bib.bib6); Asai et al.2024 (https://arxiv.org/html/2608.04509#bib.bib1))。当检索到的图像和文本不一致时,仅凭准确率是不够的:模型可能锁定先验模态或编造不支持的答案。CMC-Bench 为多模态 RAG 评估构建了匹配的 A/V/T/N 冲突(Catapang2026 (https://arxiv.org/html/2608.04509#bib.bib2)),Mixed Signals 则度量视觉-语言冲突下独占图像偏向与独占文本偏向(Pezeshkpour, Aminnaseri, and Hruschka2025 (https://arxiv.org/html/2608.04509#bib.bib10))。CARGO-VL 针对互补的学习问题:优化策略,使决策在这些受控干预下连贯变化,然后迁移到相同的原生评估指标。

训练后与反事实监督。RLHF 和偏好优化通过逐实例奖励或成对偏好改进指令跟随(Ouyang et al.2022 (https://arxiv.org/html/2608.04509#bib.bib9); Rafailov et al.2023 (https://arxiv.org/html/2608.04509#bib.bib12); Schulman et al.2017 (https://arxiv.org/html/2608.04509#bib.bib13))。GRPO 用组内相对优势取代了学习的评论家(Shao et al.2024 (https://arxiv.org/html/2608.04509#bib.bib14))。反事实增强数据教会模型在干预下应改变哪些特征(Kaushik, Hovy, and Lipton2020 (https://arxiv.org/html/2608.04509#bib.bib5))。CARGO-VL 保留 GRPO 式更新,但将组重新定义为匹配的证据束,对答案不变性、来源等变性和作答到弃权切换进行评分,而非将 A/V/T/N 变体视为独立提示。该过程与参数高效微调(包括 LoRA 式适配器)兼容(Hu et al.2022 (https://arxiv.org/html/2608.04509#bib.bib4))。

弃权与校准拒答。选择性预测形式化了模型应何时推迟而非冒险出错(Geifman and El-Yaniv2017 (https://arxiv.org/html/2608.04509#bib.bib3))。在多模态冲突中,弃权必须在双错误样本上上升,同时不能把可回答案例坍缩为拒答。因此,CARGO-VL 将 N 转换与原始-对偶惩罚相结合,惩罚不安全答案、过度弃权和支持性精确匹配损失,而非使用单一的准确率-拒答标量。

## CARGO-VL 训练策略

参见图注Figure 2:CARGO-VL 概览。一个真实的 CMC-Bench ChartQA 输入说明了相同问题如何被实例化为对齐(A)、图像正确(V)、文本正确(T)或双错误(N)证据束。CARGO-VL 使用逐点和转换奖励、最弱条件保护和风险约束对全部四个条件联合评分,然后通过 SFT 热启动后接约束 GRPO 来优化策略。协议面板记录了训练配置;它不报告性能值。XMC 训练集将四条件方法扩展到仅用于训练的新 TextVQA 和 ScienceQA 示例。

### 问题设置

对于基问题 qq 和图像 xx,令 B={sA,sV,sT,sN}B={s_A,s_V,s_T,s_N} 为匹配的证据束。条件 A、V、T 和 N 分别表示对齐证据、图像正确证据、文本正确证据和双错误证据。每个样本为可回答条件提供黄金答案 yy,并提供一个目标动作:A/V/T 作答,N 弃权。策略 πθ\pi_\theta 为每个条件 c∈Bc∈B 生成自由文本 oc o_c。一个冻结的语义映射器将 oc o_c 映射到决策 dc∈{answer,deflect}d_c∈{answer,deflect} 和来源 zc∈{image,text,both,none}z_c∈{image,text,both,none}。

期望的束行为简单但要求严格:A、V 和 T 应回答 yy;其来源应分别是 both、image 和 text;N 应弃权且来源为 none。匹配构造消除了随机分组不相关问题中的混淆:每个转换都相对于相同的底层问题和答案定义。表1 (https://arxiv.org/html/2608.04509#Sx3.T1) 明确了行为契约。如果模型将答案归因于文本,那么 V 中的回答就不充分;如果模型拒绝弃权,那么 N 中看似正确的字符串也不充分。在训练期间,每个条件使用相同的自由文本接口;来源和决策字段来自语义映射层,而非脆弱的策略结构化输出。

Table 1:完整反事实证据束的目标行为。

### 条件级奖励

对于条件 cc,自由文本 oc o_c 被映射到 lc∈{image,text,both,neither,abstain}\ell_c∈{image,text,both,neither,abstain},由冻结映射器(精确/数值/拒答规则,否则由冻结 LLM 裁判)完成,该映射器永远不会看到黄金答案 yy。从 lc\ell_c 我们设置决策 dcd_c 和来源 zc z_c(abstain→\to deflect/none;neither→\to answer/none)。以 A/V/T/N 的目标标签 lc⋆\ell_c^\star 和权重 (wact,wsrc,wans)=(1.0,0.8,1.0)(w_act,w_src,w_ans)=(1.0,0.8,1.0),

ract\displaystyle r_act= I[dc=dc⋆]\displaystyle =\mathrm{I}[d_c{=}d_c^\star], rsrc=I[lc=lc⋆]\displaystyle r_src=\mathrm{I}[\ell_c{=}\ell_c^\star], rans\displaystyle r_ans=I[ans.(c)∧match(oc,y)]\displaystyle =\mathrm{I}[\mathrm{ans.}(c)\land\mathrm{match}(o_c,y)],(1)

其中 ans.(c)\mathrm{ans.}(c) 表示 c∈{A,V,T}c{\in}\{\mathrm{A},\mathrm{V},\mathrm{T}\} 且 dc=answerd_c{=}\textsc{answer},d⋆d^\star 在 A/V/T 上为 answer,在 N 上为 deflect。所以 ractr_act / rsrcr_src 仅使用映射器输出;ransr_ans 仅通过映射后字符串匹配使用黄金答案。然后

rabs={wactract,N,wactract+wsrcrsrc+wansrans,A/V/T。r_abs=\begin{cases}w_act r_act,& \mathrm{N},\\ w_act r_act + w_src r_src + w_ans r_ans,& \mathrm{A/V/T}.\end{cases}(2)

在 N 上仅弃权得分;在 A/V/T 上,错误来源损失 rsrc r_src,错误字符串损失 rans r_ans。

### 束转换奖励

逐点正确性使变体之间的关系不受约束。令 pA,pV,pT,pN p_A,p_V,p_T,p_N 为一次联合展开中映射后的自由文本答案,d=(dA,dV,dT,dN)\mathbf{d}=(d_A,d_V,d_T,d_N) 为其决策向量,(sA⋆,sV⋆,sT⋆)=(both,image,text)(s_A^\star,s_V^\star,s_T^\star)=(\textsc{both},\textsc{image},\textsc{text}) 为支持条件的来源目标。令 d⋆=(answer,answer,answer,deflect)\mathbf{d}^\star=(\textsc{answer},\textsc{answer},\textsc{answer},\textsc{deflect})。我们定义三个转换组件:

rAI\displaystyle r_AI= I[⋀c∈{A,V,T}(dc=answer∧match(pc,y))]\displaystyle =\mathrm{I}\!\Big[\textstyle\bigwedge_{c\in\{A,V,T\}}\bigl(d_c{=}\textsc{answer}\land\mathrm{match}(p_c,y)\bigr)\Big],rSE\displaystyle r_SE= 13∑c∈{A,V,T}I[zc=sc⋆]\displaystyle =\tfrac13\textstyle\sum_{c\in\{A,V,T\}}\mathrm{I}[z_c=s_c^\star],rDS\displaystyle r_DS= I[d=d⋆∧zN=none]\displaystyle =\mathrm{I}\big[\mathbf{d}=\mathbf{d}^\star\ \land\ z_N=\textsc{none}\big],(3)

并且 rtrans=0.4rAI+0.3rSE+0.3rDSr_trans=0.4r_AI+0.3r_SE+0.3r_DS。因此,在模态扰动下正确是不够的:模型必须识别获胜模态,并且一旦两个支持都无效,必须从作答切换到弃权。

因为对于

相似文章

CaVe-VLM-CoT:一个可解释的视觉-语言模型框架

arXiv cs.AI

CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。

# 超越目标等价性:基于LLM的车辆路径问题优化建模中的约束注入

arXiv cs.AI

北京航空航天大学与百度的研究人员提出"约束注入"方法——一种用于基于 LLM 的优化建模的双重验证机制,能够检测超出目标等价性范围的虚假约束或遗漏约束。他们开发了 VRPCoder,这是一个 80 亿参数的模型,专门用于将自然语言描述的车辆路径问题转化为 Gurobi 脚本,平均 Pass@1 达到 93%,大幅超越 Claude Sonnet 及此前的运筹学 LLM。