图表支撑还是模型供给?检验MLLM生成的可访问化图表断言
摘要
本文探讨了多模态大型语言模型(MLLMs)在生成关于图表的断言方面的能力,区分了图表支撑的证据与模型供给的解释。通过四个输入条件和三个MLLMs的实验,研究发现可访问的图表上下文促使模型生成更直接的断言,但现实意义部分仍主要停留在推测层面。
arXiv:2607.25021v1 Announce Type: new
摘要:多模态大型语言模型(MLLMs)能够将可视化模式与外部原因、后果和领域知识联系起来,但这些解释的证据基础往往不明确。我们进行了一项探索性研究,涉及来自四个源、三个MLLM和四个输入条件的102个可视化图表,这些条件分别控制图像访问、源特定的可访问图表上下文以及隐藏上下文框架。在1,224条描述中,我们分析了模型赋予的DIRECT、DERIVED和SPECULATIVE标签,并对数值一致性进行了自动化审计。可访问图表上下文使Gemini和GPT转向更多DIRECT断言,并提高了部分模型的数值一致性。将图像加入完整上下文并未带来一致的数值提升,隐藏上下文提示也未可靠地增加谨慎措辞。提示定义的现实意义部分仍然以SPECULATIVE为主。这些结果为可访问描述系统提供了依据,使其能够区分由提供证据支持的断言和由模型供给的解释。
查看缓存全文
缓存时间: 2026/07/29 09:53
# 图表支撑还是模型臆测?——探究MLLM生成的可访问可视化声明质量 来源:https://arxiv.org/abs/2607.25021 查看PDF (https://arxiv.org/pdf/2607.25021) > 摘要:多模态大语言模型(MLLMs)能够将可视化模式与外部原因、后果及领域知识相关联,但这些解读的证据基础往往不明确。我们开展了一项探索性研究,涉及来自四个数据源、三个MLLM以及四种输入条件(分别不同程度上提供图像、来源特定的可访问图表上下文、以及隐藏上下文的提示框架)的102张可视化图表。在1,224段描述中,我们分析了模型标注的DIRECT(直接)、DERIVED(推导)和SPECULATIVE(推测)标签,并对数值一致性进行了自动化审核。可访问图表上下文促使Gemini和GPT转向更多的DIRECT声明,并提升了部分模型的数值一致性。在完整上下文中添加图像并未带来一致的数值提升,隐藏上下文的提示也未能可靠地增加谨慎性措辞。提示所定义的“现实世界意义”部分仍以SPECULATIVE为主。这些结果激励我们设计可访问描述系统,以区分由所提供的证据支持的声明与由模型提供的解释。 ## 提交历史 来自:Ishrat Jahan Eliza \[查看邮箱 (https://arxiv.org/show-email/5a5b1dcf/2607.25021)\] **\[v1\]** 2026年7月27日星期一 19:30:56 UTC (1,283 KB)
相似文章
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
视觉-语言模型中的图表欺骗:从脆弱性到缓解
本文介绍了VisDeception,一个用于评估视觉-语言模型对欺骗性图表设计鲁棒性的基准,并提出了一种多智能体缓解框架,通过将推理基于结构化图表元数据来减少由欺骗引起的错误。
多模态大语言模型内部视觉表征的因果探针
本文提出了一种用于探测多模态大语言模型内部视觉表征的因果框架,揭示了实体与抽象概念在编码方式上的差异。研究强调增加模型深度对于编码抽象概念至关重要,并揭示了当前多模态大语言模型在感知与推理之间的脱节。
这个图表在骗我吗?误导性可视化的自动检测
本文介绍了Misviz,一个包含2,604个真实可视化和57,665个合成可视化的基准数据集,标注了12种误导性设计违规,能够自动检测欺骗性图表。该工作评估了最先进的多模态大语言模型和基于规则的系统在这一具有挑战性的任务上的表现,填补了用于训练AI模型以对抗数据可视化虚假信息的资源空白。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。