FPCO-Dialog:视觉语言模型中用于纠正与合作的多轮虚假前提基准
摘要
本文介绍了FPCO-Dialog,一个用于评估视觉语言模型在多轮对话中重复虚假前提下的纠正与合作行为的基准。
arXiv:2609.03331v1 公告类型:新
摘要:视觉语言模型(VLMs)越来越多地部署在多轮对话环境中,用户可能以错误的假设描述视觉内容。然而,现有评估很少单独考察当相同的基于视觉的虚假前提在对话轮次中持续存在时,模型如何响应。我们引入了FPCO-Dialog,一个用于评估VLMs在重复虚假前提下纠正与合作行为的基准。FPCO-Dialog包含1,080张图片和10,800个问题轮次,按视觉复杂度、物体类别和虚假前提类别分层,并采用10轮协议,其中正确的对话前缀后跟重复的虚假前提指代表达式。我们使用模型无关协议和CorrTP@K(一个针对虚假前提轮次的纠正率指标)评估了20个商业和开源VLMs,该指标由两个独立检测器评分。FPCO-Dialog揭示了在基准的替代分布下,跨模型在总体纠正趋势、模型特定的轮次动态以及虚假前提类型系统性变异方面的显著且持久的差异。数据集、评估协议、模型输出、检测器标签和代码均可获取。
查看缓存全文
缓存时间: 2026/09/04 05:58
# FPCO-Dialog:用于视觉语言模型纠正与合作的多轮错误前提基准 来源:https://arxiv.org/html/2609.03331 **作者**:贾缘马、卢雨琦 **单位**:哈尔滨工业大学(深圳) **邮箱**:[[email protected]](mailto:) **合作者**: 郭伟阳、王晨锐、舒俊毅、刘学博、张敏、李静 **单位**:哈尔滨工业大学(深圳) --- ### 摘要 视觉语言模型(VLMs)越来越多地应用于多轮对话场景,用户可能对视觉内容做出错误假设。然而,现有评估很少隔离当同一基于视觉的错误前提在对话轮次中持续存在时模型的响应方式。我们提出FPCO-Dialog——一个用于评估VLMs在重复错误前提下纠正与合作行为的基准。该基准包含1,080张图像和10,800个问题轮次,按视觉复杂度、物体类别和错误前提类别分层,并采用10轮对话协议:前3轮为正确前提的对话前缀,后7轮重复使用相同的错误前提指称表达。我们使用与模型无关的协议评估了20个商用和开源VLMs,并引入CorrTP@K指标——一个针对错误前提轮次的纠正率度量,由两个独立检测器评分。FPCO-Dialog揭示了模型在总体纠正倾向、逐轮动态响应以及在基准替换分布下不同错误前提类型间的系统性差异。数据集、评估协议、模型输出、检测器标签及代码已开源:https://github.com/lab-klc/FPCO-Dialog。 ††脚注:通讯作者  **图1:纠正与合作**。在相同的基于视觉的错误前提下,VLMs可能选择回应用户的主要问题,或在回答前/回答时显式纠正该前提。 --- ## 1 引言 视觉语言模型(VLMs)的评估已超越标签预测或短答案视觉问答,扩展到基于视觉的交互对话(Das et al., 2017; Cao et al., 2024; Lee et al., 2025)。近期VLM基准测试了广泛的多模态能力,包括整合感知与推理、特定领域问题求解、幻觉鲁棒性以及基于偏好的开放式响应质量(Yu et al., 2024; Yue et al., 2024; Guan et al., 2024; Lu et al., 2024)。然而,大多数评估要么提出独立问题,要么使用自然收集的对话历史,这使得难以隔离当用户反复使用与图像冲突的前提描述可见内容时模型的响应方式(Das et al., 2017; Cao et al., 2024; Lee et al., 2025)。图1说明了这种模糊性:当用户将“火车”称为“公交车”时,VLMs可能合作回应用户的主要问题,或先纠正错误前提。FPCO-Dialog旨在通过控制重复错误前提协议来衡量这种纠正–合作行为。单轮响应可能揭示模型是否注意到一次不一致,但需要多轮测试来验证纠正或合作是否反映了稳定的交互策略。 此场景之所以重要,是因为指称表达不仅标识物体,还引入关于共享视觉上下文的预设,如目标的身份、属性或位置(Lewis, 1979; Stalnaker, 2002; Simons, 2003)。在对话中,这些预设可能被配合以维持合作,或在与现有证据不兼容时被显式修正。现有的问答和VQA研究已考察了无法回答的问题、弃答、物体幻觉和错误前提问题,但这些工作通常将问题框定为检测无支持答案,而非衡量视觉基础对话中纠正与合作的平衡(Rajpurkar et al., 2018; Gurari et al., 2018; Whitehead et al., 2022; Li et al., 2023; Hu et al., 2023)。 近期视觉对话和幻觉基准进一步表明对话历史会影响VLM可靠性,但未施加控制重复同一错误前提的协议,从而无法分离前提类型与图像复杂度和物体类别(Cao et al., 2024; Guan et al., 2024; Lee et al., 2025)。我们引入FPCO-Dialog——一个用于研究VLMs中纠正与合作行为的多轮错误前提基准。每个实例基于MS COCO和Open Images中的图像构建(Lin et al., 2014; Kuznetsova et al., 2020),并配对一个10轮视觉对话:以正确的对话前缀开始,随后重复使用相同的错误前提指称表达。该基准包含1,080张图像,按视觉复杂度、物体类别和错误前提类别分层,涵盖身份、属性和位置错误。此设计隔离了VLMs对持续存在的基于视觉的错误前提的响应方式,同时保持对话协议固定且与模型无关。 **主要贡献如下**: - • 我们提出FPCO-Dialog——一个针对重复基于视觉错误前提的受控且分层的多轮基准,覆盖1,080张图像,按视觉复杂度、物体类别和错误前提类别分层。 - • 我们设计了一个与模型无关的评估框架,用于衡量纠正与合作行为,包括固定对话协议、双检测器评分、新指标CorrTP@K、模型输出、检测器标签和评估代码。 - • 我们对20个模型进行了实证研究,通过定量和定性分析揭示了模型家族间的显著差异及错误前提类型间的系统性变化。  **图2:数据集构建与结构**。a) FPCO-Dialog基于COCO和Open Images构建,通过手动选择、标注、分类、问题生成和错误前提重写完成。b) 数据集包含1,080张图像,按视觉复杂度、物体类别和错误前提类别分层。c) 每段对话包含三轮正确前提对话,随后重复错误前提轮次;示例展示了三种错误前提类别的紧凑可视化。 --- ## 2 相关工作 ### 视觉语言评估与视觉对话 早期视觉问答和视觉对话基准确立了图像条件问题回答和对话基础作为核心评估场景(Antol et al., 2015; Das et al., 2017)。近期VLM基准将这条路径扩展到整合感知与推理、专家级多模态问题求解、幻觉诊断和基于偏好的开放式评估(Liu et al., 2024; Yu et al., 2024; Yue et al., 2024; Guan et al., 2024; Lu et al., 2024)。评估工具包进一步提供了可复现的流水线,用于在基准间比较大型多模态模型(Duan et al., 2024)。近期多轮基准研究了视觉基础交互中的对话历史、幻觉和复杂对话目标(Cao et al., 2024; Lee et al., 2025)。FPCO-Dialog与这些工作互补:它并非最大化任务多样性,而是固定对话协议,系统性地变化错误前提类型、视觉复杂度和物体类别,以隔离纠正行为。 ### 错误前提、预设与视觉基础不一致性 我们的任务与预设和共同基础研究相关,其中指称表达可能引入假设,对话者可能根据会话状态配合或修正(Lewis, 1979; Stalnaker, 2002; Simons, 2003)。在NLP和VQA中,相关现象通过无法回答的问题、弃答导向回答、自然无法回答的视觉问题和错误前提问答得以研究(Rajpurkar et al., 2018; Gurari et al., 2018; Whitehead et al., 2022; Hu et al., 2023)。VLM幻觉基准检查生成响应是否保持与图像一致,尤其当物体或视觉事实无支持时(Li et al., 2023; Guan et al., 2024)。FPCO-Dialog的不同之处在于不一致性的方向与动态:错误内容由用户提供,在对话轮次中重复,并通过模型是否纠正前提或合作回应用户主要问题来评估。FPCO-Dialog也与谄媚性研究相关,但我们不将合作等同于谄媚,因为非纠正可能反映语用配合或未能检测不一致,而非屈从用户(Sharma et al., 2024; Hong et al., 2025; Pi et al., 2025)。  **图3:数据集分层与错误前提修改示例**。a) 代表FPCO-Dialog图像,涵盖不同视觉复杂度和物体类别。行对应单目标整洁、多目标分离和多目标重叠设置;列对应人物、车辆、动物和食物类别。b) 三类错误前提的指称表达修改示例:身份、属性和位置。 --- ## 3 FPCO-Dialog数据集 FPCO-Dialog衡量VLMs对重复基于视觉错误前提的响应方式。每段对话围绕图像中的一个目标实体展开。正确前提轮次使用正确描述指称目标,而错误前提轮次使用修改后的指称表达。图2总结了构建过程、分层方式和代表性对话示例。 ### 3.1 任务与对话协议 每个实例包含一张图像、一个目标实体、一个正确目标描述、一个修改后的错误前提目标描述,以及一个10轮问题序列。每轮中,VLMs接收图像、当前问题和先前对话上下文,然后生成自由形式响应。前三轮使用正确目标描述,形成正确前提对话前缀。第4–10轮重复使用相同的修改后错误前提指称表达。此安排隔离了当同一视觉不一致持续存在时,模型是否维持、改变或抑制纠正行为。在错误前提轮次中,模型可能显式纠正前提,例如陈述所指物体不存在或视觉描述错误;也可能合作回应用户主要问题而不解决不一致。FPCO-Dialog在控制重复错误前提协议下衡量这种纠正–合作区别。 ### 3.2 构建与分层 FPCO-Dialog基于从MS COCO和Open Images中选择的图像构建(Lin et al., 2014; Kuznetsova et al., 2020)。图像经过手动选择和组织,以支持跨视觉复杂度、物体类别和错误前提类别的受控比较。作者定义基准设计、分层方案和构建约束,而LLMs协助问题生成和错误前提重写。所有生成实例均由作者手动审查,确保视觉基础、目标一致性、自然性和符合单错误约束。我们不依赖原始数据集标注进行基准标签或评估;目标描述、问题序列、错误前提修改、元数据、模型输出和检测器标签均为FPCO-Dialog生成或策划的一部分。 数据集包含1,080张图像,沿三个轴分层。**视觉复杂度**(图3a)分为三个等级:单目标整洁、多目标分离和多目标重叠。**物体类别**分为四个等级:人物、车辆、动物和食物。**错误前提类别**分为三个等级:身份、属性和位置。对于每个视觉复杂度–类别组合,我们包含90张图像,平均分配于三个错误前提类别,因此总计3×4×3×30=1,080张图像。 错误前提类别由指称表达与图像冲突的方式定义。如图3b所示: - **身份错误前提**用不兼容的替代项替换目标身份,例如将“火车”称为“公交车”。 - **属性错误前提**修改目标的可见属性,如颜色、材质或表情。 - **位置错误前提**修改目标的空间描述或关系,例如将“右侧”替换为“左侧”。 这些示例是说明性的而非固定替换映射。对于每个实例,替换在受控最小编辑策略下独立生成:尽可能仅更改一个词,否则更改一个短局部短语,保留其余描述,并仅引入一个指定错误前提类别的错误。对于每张图像,我们首先定义一个正确目标描述,并生成十个包含此描述的正确前提问题。然后根据图像分配的错误前提类别创建一个修改后的目标描述,并通过替换正确指称表达为修改后的表达来重写第4–10轮。身份替换使用明显不兼容的标签,属性替换
相似文章
DiagFlowBench: 评估语言模型在基于流程的诊断对话中如何处理非程序输入
本文介绍了DiagFlowBench,这是一个包含1,676个多轮诊断对话的基准数据集,这些对话源自工业流程图,旨在评估语言模型处理非程序输入及避免给出不恰当建议的能力。
Enjoy Your Talk: 一个以人为中心的多轮对话基准,采用解耦的用户模拟、目标建模与评判
本文介绍了EYT-Bench,一个以人为中心的基准,用于评估多轮对话中的LLM,采用了解耦的用户模拟、目标建模和评判设计。它揭示了闭源和开源模型在客观意图追踪上差异显著,但在主观维度上相似;推理能力提升了客观追踪,而人物角色格式强烈影响轨迹分布。
Conv-to-Bench: 通过用户-助手对话评估语言模型在代码任务中的表现
Conv-to-Bench 是一个多阶段框架,能够自动将多轮用户-助手对话转化为结构化的、可验证的需求清单,用于评估大型语言模型在代码任务上的表现,以较低的计算成本实现了与人工编写的基准近乎完美的对齐。
从命题性不对称到感知性不对称:将摩擦策略优化扩展到非对称部分信息对话
本文扩展了摩擦策略优化(FPO)以处理对话中的感知性不对称,即参与者持有不对称的部分信息。研究表明,从每个参与者的视角评估摩擦比全知访问更有效,并提出了针对共同基础状态的标注改进。
Found in Conversation: LLMs 自我学习以缩小多轮对话差距
本文介绍了 Found in Conversation (FiC),一个使用视图非对称自蒸馏(View-Asymmetric Self-Distillation)的训练框架,旨在缩小 LLMs 中的多轮对话性能差距。该方法教会模型从欠详细的多轮提示中恢复单轮能力,在多种模型系列和规模上实现了 92-100% 的恢复率。