超越表面模仿:多模态上下文学习中推理路径对齐的对比建模
摘要
本文介绍了一种用于多模态上下文学习的对比建模框架,旨在改进推理路径对齐,提升视觉问答等任务的性能。
arXiv:2609.10177v1 Announce Type: new
摘要:上下文学习(ICL)在多模态大语言模型(MLLMs)中被广泛使用,并在众多多模态任务中表现出色。然而,现有的多模态ICL方法往往依赖于上下文示例的表面模仿,使得MLLMs难以将其响应与给定多模态输入所需的推理路径对齐。这一局限性在复杂多模态任务中变得更加明显,从而限制了MLLM性能的进一步提升。为解决这一问题,我们提出了一种新的多模态ICL框架,该框架将对比示例建模与MLLMs的自我改进能力相结合。具体而言,我们的框架通过明确对比相同输入下的次优响应和更优响应,以及揭示如何改进响应的推理路径,来重新表述每个示例。这种对比表述使得通向期望响应的推理路径更加明确,并引导MLLM超越表面模仿。此外,由于有效的改进取决于当前响应,我们引入了一种响应条件检索机制,以选择推理路径与当前响应更相关的示例。同时,我们使用一个轻量级的对齐控制器来预测响应质量,并确定是否需要进一步改进。在三种多模态任务上的实验表明,所提框架持续提升MLLM性能,在视觉问答(VQA)上尤为显著。
查看缓存全文
缓存时间: 2026/09/11 08:44
# 超越表面模仿:多模态上下文学习中推理路径对齐的对比建模 来源:https://arxiv.org/html/2609.10177 会议:第34届ACM国际多媒体会议论文集;2026年11月10日–14日;巴西里约热内卢 第34届ACM国际多媒体会议论文集(MM '26),2026年11月10-14日,巴西里约热内卢 ISBN:979-8-4007-2213-4/2026/11 DOI:10.1145/3767308.3836595 (https://doi.org/10.1145/3767308.3836595) CCS:计算方法学 人工智能 Mingbo Yang https://orcid.org/0009-0000-2952-5044 注:Mingbo Yang 和 Wenqiang Wang 对本工作贡献均等。 单位:中国广东省深圳市中山大学 邮箱:[[email protected]](mailto:[email protected]) Wenqiang Wang https://orcid.org/0009-0008-5034-1379 单位:中国广东省深圳市中山大学 邮箱:[[email protected]](mailto:[email protected]), Zhaolu Kang https://orcid.org/0009-0000-1163-1615 单位:中国北京市北京大学 邮箱:[[email protected]](mailto:[email protected]), Peng Chen https://orcid.org/0009-0001-0327-4053 单位:中国广东省深圳市中山大学 邮箱:[[email protected]](mailto:[email protected]), Yannan Chen https://orcid.org/0009-0007-1896-3568 单位:中国广东省深圳市中山大学 单位:中国广东省深圳市鹏城实验室 邮箱:[[email protected]](mailto:[email protected]), Sunshang Wang https://orcid.org/0009-0004-9237-2887 单位:中国天津市天津科技大学 邮箱:[[email protected]](mailto:[email protected]) 和 Yan Xiao https://orcid.org/0000-0002-2563-083X 注:通讯作者。 单位:中国广东省深圳市中山大学 邮箱:[[email protected]](mailto:[email protected]) © cc ###### 摘要 上下文学习在多模态大语言模型中被广泛应用,并在广泛的多模态任务中取得了强大性能。然而,现有的多模态上下文学习方法往往依赖于对上下文示例的表面模仿,使得多模态大语言模型难以将其响应与给定多模态输入所需的推理路径对齐。这一局限性在复杂多模态任务中更为明显,从而限制了多模态大语言模型性能的进一步提升。为了解决这个问题,我们提出了一个新的多模态上下文学习框架,该框架结合了对比性示例建模与多模态大语言模型的自我精炼能力。具体来说,我们的框架通过显式地将次优响应与同一输入下的更优响应进行对比,并附带一个揭示响应应如何精炼的推理路径,从而重构每个示例。这种对比性表述使得朝向期望响应的推理路径更加明确,并引导多模态大语言模型超越表面模仿。此外,由于有效的精炼依赖于当前响应,我们引入了一种响应条件检索机制,以选择其推理路径与当前响应更相关的示例。此外,我们使用了一个轻量级的对齐控制器来预测响应质量,并确定是否需要进一步精炼。在三种类型的多模态任务上的实验表明,所提出的框架持续提升了多模态大语言模型的性能,其中在视觉问答任务上的提升尤为显著。 ###### 关键词: 多模态大语言模型;多模态上下文学习 ††cc-许可:by## 1.引言 标准多模态上下文学习与COMIL的对比,展示了对比性示例和精炼指导如何将模型从表面模仿推向基于证据的推理路径对齐。 图1.从表面模仿到推理路径对齐。标准多模态上下文学习主要对齐最终输出,并可能从视觉相似的示例中模仿表面模式。相比之下,COMIL使用对比性示例来明确哪些视觉证据是相关的,以及当前响应应如何修订,从而引导多模态大语言模型走向期望的推理路径。 标准多模态上下文学习与COMIL的对比,展示了对比性示例和精炼指导如何将模型从表面模仿推向基于证据的推理路径对齐。 多模态上下文学习展示了使多模态大语言模型适应新任务的卓越能力。通过将多模态大语言模型与示例条件化,多模态上下文学习可以在推理时进行任务适应,而无需参数更新。这使得多模态上下文学习成为多模态任务的一个有吸引力的范式,因为它可以灵活地利用多模态大语言模型的预训练知识。 尽管有这些优势,当前的多模态上下文学习范式往往鼓励表面模仿,而非基于多模态证据的推理。这里,表面模仿指的是依赖表面的示例模式,而没有充分地将响应基于与查询相关的多模态证据。在标准多模态上下文学习中,多模态大语言模型以一系列输入-输出示例为条件。然而,当面临需要细粒度视觉区分的复杂场景时,多模态大语言模型倾向于依赖不正确的关联。例如,如图1所示,如果检索到的示例共享视觉相似的全局特征,多模态大语言模型容易复制上下文中出现频率最高的文本标签。通过这样做,多模态大语言模型绕过了任务所需的更深层次的视觉分析,仅匹配输出格式,而未能将其响应基于细粒度的视觉证据。 这个问题反映了标准示例的一个根本局限:它们主要对齐最终输出,而忽略了通向期望响应的推理路径。当多模态大语言模型产生受表面相似性影响的响应时,关键的挑战不仅仅是指定目标输出,而是通过将生成的推理路径与多模态输入下基于证据的潜在精炼关系对齐,来实现推理路径对齐。在复杂的多模态任务中,这需要关于哪些视觉证据真正相关以及它应如何支持修订当前响应的明确指导。标准示例很少提供此类指导,因为它们仅呈现目标输出,而非从次优响应到更优响应的推理路径。因此,实现推理路径对齐需要使这种精炼路径明确的示例,使多模态大语言模型能够以更好地基于底层多模态证据的方式精炼其响应。 为了超越表面模仿,我们提出了COMIL,一个通过示例的对比建模和多模态大语言模型的自我精炼能力来促进多模态大语言模型中推理路径对齐的新框架。COMIL并非仅提供单一目标输出,而是在同一多模态输入下,将每个标准上下文学习示例重构为一个结构化的示例元组,该元组包含一个次优响应、一个更优响应以及一个生成的推理路径,该路径描述了响应应如何精炼以及哪些细粒度的视觉证据支持该精炼。通过在相同的输入条件下呈现两个响应,这种表述不仅明确了哪个响应更好,还明确了当前响应应如何改进以及为什么该改进得到了底层多模态证据的支持,从而将示例转化为推理路径对齐的明确指导。 此外,由于推理路径对齐依赖于多模态大语言模型的当前响应,我们将这些对比示例与一个由当前响应引导的检索机制相耦合。COMIL在检索示例时,不仅考虑输入相似性,还额外考虑其子优响应与多模态大语言模型当前响应的相似性。通过这种方式,检索到的推理路径为精炼当前响应提供了更相关的指导。结合一个预测响应质量并确定是否需要进一步精炼的轻量级对齐控制器,COMIL超越了被动的输出匹配,转而引导生成走向更具证据基础的精炼。 在多种代表性的多模态大语言模型上进行的广泛实验验证了我们框架的有效性。在三个推理密集型任务上,COMIL显示出明显的改进。例如,在VQAv2上,COMIL将Qwen3.5-9B的准确率提高到81.9%,在比较方法中取得了最佳结果。在Flickr30k上,它将Gemma-3-27B的CIDEr分数提高到0.587。COMIL还保持了样本效率,即使在检索示例数量有限的情况下也能保持良好的性能。此外,该框架推广到开源设置之外,并在闭源多模态大语言模型上取得了强劲结果。总体而言,这些结果表明,COMIL通过减少表面模仿和促进推理路径对齐,有效地改进了多模态上下文学习。 总之,我们的主要贡献如下: - 一种用于多模态上下文学习中推理路径对齐的新框架:我们提出了COMIL,这是一个新的多模态上下文学习框架,通过提供关于哪些视觉证据真正相关以及它应如何支持修订当前响应的明确指导,来促进推理路径对齐。 - 带有响应条件检索和对齐控制的对比性示例建模:COMIL将每个标准上下文学习示例重构为一个结构化的对比性示例元组,该元组包含次优响应、更优响应和相应的推理路径。它进一步将此表述与响应条件检索和轻量级对齐控制器相结合,在推理期间引导多模态大语言模型走向期望的推理路径。 - 在推理密集型多模态任务上的有效结果:在多个多模态大语言模型和数据集上的广泛实验表明,COMIL持续提升性能,在推理密集型任务上改进尤为明显。额外的推理路径评估以及在闭源多模态大语言模型上的结果进一步证明了所提框架的有效性和通用性。 ## 2.相关工作 ### 2.1.多模态大语言模型 多模态大语言模型最近在包括视觉问答、图像描述、视觉推理和多模态生成在内的广泛任务中取得了显著进展。通过将视觉编码器与大型语言模型集成,以及大规模视觉-语言预训练、指令微调和对齐,多模态大语言模型发展出了强大的跨模态理解和生成能力,成为多模态智能的关键基础。它们在统一的生成框架内处理视觉和文本信息的能力,使得单一模型可以执行多样化的任务,并显著拓宽了视觉-语言应用的范围。尽管取得了这些进展,有效的推理时适应对于提升多模态大语言模型在复杂多模态任务上的性能仍然至关重要。特别是,如何在不更新参数的情况下,更好地利用多模态大语言模型的多模态理解和生成能力来处理复杂任务,仍然是一个重要挑战。这激发了人们对推理时适应范式的日益增长的兴趣,例如多模态上下文学习。 ### 2.2.多模态上下文学习 多模态上下文学习已成为使多模态大语言模型适应下游任务的重要范式。通过利用由图像、文本和相应响应组成的多模态示例,多模态上下文学习可以在推理时进行任务适应,而无需参数更新。这一特性使得多模态上下文学习在实践中尤其具有吸引力,因为它可以灵活地将预训练的多模态大语言模型适应到各种任务,同时避免额外训练的成本。更重要的是,通过在上下文中呈现少量特定任务的示例,多模态大语言模型可以以任务感知的方式利用其预训练的多模态知识,使其成为多模态分类、生成和推理任务的一个简单而有效的范式。现有研究主要从输入端改进多模态上下文学习,例如示例检索、示例组织、提示设计和指令构建,表明更好的示例可以显著影响下游性能。尽管取得了这些进展,大多数研究仍然将示例视为固定的输入-输出对,忽略了响应本身的潜在局限性以及引导模型超越这些局限性所需的精炼过程。
相似文章
多样本思维链上下文学习:让上下文学习真正学会
本文研究了推理任务的多样本思维链上下文学习,揭示了标准扩展规则并不适用,并提出了Curvilinear Demonstration Selection (CDS)方法以改进示例排序,最高可获得5.42个百分点的性能提升。
多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象
本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。
通过非对称互变分学习的多模态连续推理
提出非对称互变分学习(AMVL),通过双向校准防止答案泄露并提升潜在空间稳定性,解决多模态连续推理中的训练-推理不匹配问题,在BLINK基准测试上取得了显著的性能提升。
InternVideo3: 使用多模态上下文推理将基础模型智能体化
InternVideo3 引入了多模态上下文推理(MCR)和高效注意力机制,以增强长时域多模态任务,在视频理解基准上取得了强劲的结果,并展示了视频智能体能力。
学习结果变化之处:多模态几何的信用可寻址推理
本文提出了一种信用可寻址推理方法,通过可执行代码轨迹和局部强化学习来增强多模态几何推理,在Qwen3-VL-8B等基线模型上实现了显著的准确性提升。