穿越幻境:一种用于鲁棒性误导图表问答的双路径智能体框架

Hugging Face Daily Papers 论文

摘要

本文介绍了ChartCynics,一种将感知与验证解耦的智能体双路径框架,用于鲁棒地回答关于误导性图表的问题。它通过使用诊断视觉路径和OCR驱动的数据路径,以及用于推理蒸馏和对抗对齐的两阶段协议,实现了最先进的准确率。

尽管视觉语言模型(VLMs)取得了成功,但由于其欺骗性的视觉结构和扭曲的数据表示,误导性图表仍然是一个重大挑战。我们提出了ChartCynics,一种通过“怀疑”推理范式来揭示视觉欺骗的智能体双路径框架。与整体模型不同,ChartCynics将感知与验证解耦:诊断视觉路径通过策略性ROI裁剪捕获结构异常(例如,倒置的坐标轴),而OCR驱动的数据路径确保数值基础。为了解决跨模态冲突,我们引入了一个通过两阶段协议优化的智能体摘要器:Oracle引导的SFT用于推理蒸馏,以及欺骗感知的GRPO用于对抗对齐。该流程有效地惩罚视觉陷阱并强制逻辑一致性。在两个基准上的评估表明,ChartCynics实现了74.43%和64.55%的准确率,相比Qwen3-VL-8B骨干网络提供了约29%的绝对性能提升,超越了最先进的专有模型。我们的结果表明,专门的智能体工作流可以使较小的开源模型获得卓越的鲁棒性,为可信赖的图表解读奠定了新基础。
查看原文
查看缓存全文

缓存时间: 2026/07/16 01:40

论文页面 - 穿越幻象:面向鲁棒误导性图表问答的双路径智能框架

来源:https://huggingface.co/papers/2603.28583

摘要

尽管视觉语言模型(VLM)取得了成功,但由于其欺骗性的视觉结构和扭曲的数据表示,误导性图表仍然是一个重大挑战。我们提出了ChartCynics,一个基于智能体的双路径框架,旨在通过“怀疑”推理范式揭示视觉欺骗。与整体模型不同,ChartCynics将感知与验证解耦:诊断视觉路径通过战略性ROI裁剪捕获结构异常(例如,颠倒的坐标轴),而OCR驱动的数据路径确保数字基准。为了解决跨模态冲突,我们引入了一个Agentic Summarizer,通过两阶段协议进行优化:先知引导的SFT用于推理蒸馏,以及欺骗感知的GRPO用于对抗性对齐。该流水线有效惩罚视觉陷阱并强制逻辑一致性。在两个基准上的评估显示,ChartCynics达到了74.43%和64.55%的准确率,相比Qwen3-VL-8B骨干网络提供了约29%的绝对性能提升,超越了最先进的专有模型。我们的结果表明,专门的智能体工作流可以使较小的开源模型获得更强的鲁棒性,为可信的图表解释奠定了新的基础。

查看arXiv页面 (https://arxiv.org/abs/2603.28583)
查看PDF (https://arxiv.org/pdf/2603.28583)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2603.28583)

在你的智能代理中获取本文:

hf papers read 2603.28583

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

没有模型链接该论文

在模型README.md中引用arxiv.org/abs/2603.28583以从该页面链接。

引用该论文的数据集 0

没有数据集链接该论文

在数据集README.md中引用arxiv.org/abs/2603.28583以从该页面链接。

引用该论文的Spaces 0

没有Space链接该论文

在Space README.md中引用arxiv.org/abs/2603.28583以从该页面链接。

包含该论文的收藏集 0

没有收藏集包含该论文

将该论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从该页面链接。

相似文章

视觉-语言模型中的图表欺骗:从脆弱性到缓解

arXiv cs.AI

本文介绍了VisDeception,一个用于评估视觉-语言模型对欺骗性图表设计鲁棒性的基准,并提出了一种多智能体缓解框架,通过将推理基于结构化图表元数据来减少由欺骗引起的错误。

这个图表在骗我吗?误导性可视化的自动检测

arXiv cs.CL

本文介绍了Misviz,一个包含2,604个真实可视化和57,665个合成可视化的基准数据集,标注了12种误导性设计违规,能够自动检测欺骗性图表。该工作评估了最先进的多模态大语言模型和基于规则的系统在这一具有挑战性的任务上的表现,填补了用于训练AI模型以对抗数据可视化虚假信息的资源空白。

MIRAGE:具备隐式推理与生成式世界模型的移动智能体

arXiv cs.AI

MIRAGE 是一个面向移动端 GUI 智能体的框架,它以紧凑的连续潜在表示取代冗长的思维链推理,并融入生成式世界模型视角,在执行操作前预测未来的屏幕状态。在 AndroidWorld 和 AndroidControl 基准测试中,该框架在减少超过 75% 生成 token 的同时,实现了具有竞争力或更优的性能表现。