AgentFinVQA: 一种可部署的多代理管道,用于可审计的金融图表问答
摘要
AgentFinVQA是一个多代理管道,用于金融图表问答,它将查询分解为规划、OCR、图例确认、视觉检查和验证步骤,并将每一步记录在可追溯的模型评估包中。与零样本基线相比,它实现了显著的准确性提升,同时支持本地部署和可审计性。
arXiv:2606.19782v1 公告类型:新
摘要:在受监管的环境中,金融图表问答不仅需要准确性:从业者在采取行动之前必须知道哪些答案值得信赖,而且许多机构无法将客户数据发送给外部模型提供商。然而,现有的图表问答代理注重准确性却缺乏透明度,并且大多数假设使用专有API;据我们所知,没有一个能在不显著牺牲准确性的情况下同时具备可审计性和本地部署能力。我们提出了AgentFinVQA,这是一个多代理管道,将每个查询分解为规划、OCR、图例确认、视觉检查和验证,并在每个样本中将所有步骤记录在可追溯的模型评估包(MEP)中。在FinMME上,AgentFinVQA比使用专有主干(Gemini-3 Flash;71.24%对63.56%,McNemar p ≈ 1.1×10^{-16})的零样本基线提高了+7.68个百分点,比本地服务的开放权重Qwen3.6-27B-FP8提高了+4.84个百分点。验证器的判定还作为有用的置信度信号(确认答案与修正答案的精确准确率分别为68.2%和55.6%),支持人在循环中的审核路由。错误分析显示,问题误解、图例混淆和提取错误占失败原因的近三分之二,并且是验证器检测最少的类别,为未来工作指明了明确方向。这些结果共同表明,可审计的本地金融图表问答是可行的,开放权重系统在保持大部分准确性提升的同时实现了完全的数据驻留。我们公开代码以支持可重复评估。
查看缓存全文
缓存时间: 2026/06/20 14:33
# AgentFinVQA:一个可部署的多智能体流水线,用于可审计的金融图表问答
来源: https://arxiv.org/html/2606.19782
Aravind Narayanan Shaina Raza Vector Institute \{aravind\.narayanan,shaina\.raza\}@vectorinstitute\.ai
###### 摘要
在受监管环境中进行金融图表问答(chart QA)需要的不仅仅是准确率:实践者必须知道哪些答案在采取行动前值得信任,而且许多机构无法将客户数据发送给外部模型提供商。然而,现有的图表问答智能体(agent)只注重准确率且不透明,大多数假设使用专有API访问;据我们所知,没有任何系统能在不显著牺牲准确率的情况下,同时具备可审计性和本地部署能力。我们提出了AgentFinVQA,这是一个多智能体流水线,它将每个查询分解为规划、OCR、图例关联、视觉检查和验证,并在每个样本中记录每一步到一个可追溯的模型评估包(MEP)中。在FinMME上,AgentFinVQA相比使用专有骨干模型(Gemini-3 Flash;71.24% vs. 63.56%,McNemar p≈1.1×10^{-16})的主干匹配零样本基线提升了+7.68个百分点,相比使用本地服务的开源权重模型Qwen3.6-27B-FP8提升了+4.84个百分点(p≈3.0×10^{-6})。验证器的判定结果也作为一个有用的置信度信号(在确认答案与修正答案上的精确准确率分别为68.2% vs. 55.6%),从而支持人在回路中的审查路由。错误分析表明,问题理解、图例混淆和提取错误几乎占了失败案例的三分之二,并且是验证器检测最少的类别,这为未来工作指明了明确的方向。这些结果共同表明,可审计的本地金融图表问答是可行的,并且开源权重系统在实现完全数据驻留的同时,保留了大部分准确率提升。我们发布了代码以支持可重复评估。项目代码 (https://github.com/VectorInstitute/AgentFinVQA/)
AgentFinVQA:一个可部署的多智能体流水线,用于可审计的金融图表问答
Aravind Narayanan Shaina Raza Vector Institute \{aravind\.narayanan,shaina\.raza\}@vectorinstitute\.ai
## 1 引言
金融图表是传达经济数据的主要媒介,而对此类图表的自动问答可以显著减轻实践者的分析负担 (Shu et al. (2025 (https://arxiv.org/html/2606.19782#bib.bib10)))。然而,在金融环境中部署需要的不只是原始准确率。近期研究表明,此类系统在金融任务中表现出显著的幻觉率,给实践者带来了直接的运营和监管风险 (Zhang et al. (2025 (https://arxiv.org/html/2606.19782#bib.bib21)))。一个频繁正确但不可预测地出错的系统难以让人信任,而一个无法提供推理可见性的系统则无法审计。
图1 (https://arxiv.org/html/2606.19782#S1.F1) 展示了一个具体案例:零样本方法在40%阈值以上过度选择了财年,而AgentFinVQA则检查每个多选题选项与10k–25k区间值的对应关系,并恢复出精确的多选答案。另一个硬性约束是,许多金融机构无法将敏感的客户文档发送给外部模型提供商,因此准确的本地部署并非可选项,而是必需。
智能体分解(agentic decomposition)将图表问题拆解为专门的推理步骤,已在通用图表问答中提高了准确率 (Wang et al. (2026 (https://arxiv.org/html/2606.19782#bib.bib1)); Liu et al. (2023a (https://arxiv.org/html/2606.19782#bib.bib12)))。最接近的系统是智能体图表问答框架,例如ChartAgent (Kaur et al. (2026 (https://arxiv.org/html/2606.19782#bib.bib16))),它将查询分解为视觉子任务,但依赖本地的计算机视觉工具来操作图像;以及ChartSketcher (Huang et al. (2026 (https://arxiv.org/html/2606.19782#bib.bib17))),它需要在数十万个标注样本上进行两阶段微调。据我们所知,之前没有任何系统能够提供同时满足以下条件的图表问答:仅使用提示(即无需本地分割模型或特定任务微调)、每个答案可审计、且可在开源权重模型上内部部署——而这正是受监管金融环境所需要的。
参考图例 图1:AgentFinVQA纠正了FinMME堆叠票额大小图表上的零样本过选择问题。零样本列出了10k–25k区间中高于40%的FY18–FY22,而AgentFinVQA独立验证每个多选题选项,排除39.6%的FY23,并返回精确答案:FY18 + FY19 + FY20。
在这项工作中,我们提出一个问题:一个金融图表问答系统能否做到可审计且完全内部运行,同时不牺牲准确率?为了回答这个问题,我们开发了AgentFinVQA,这是一个多智能体流水线,它协调一个纯文本规划器、一个OCR读取器、一个图例关联器、一个轻量级确定性颜色区域测量阶段,以及一个视觉与验证循环,并将每个阶段记录在模型评估包(MEP)中,以实现完全的可审计性和基于置信度的人工审查路由。
参考图例 图2:AgentFinVQA流水线。输入从左到右流经五个必要阶段(蓝色/青色):规划器、OCR读取器、视觉智能体、验证器和MEP输出。紫色框表示有条件触发的阶段:图例关联器(多系列图表)、颜色区域工具(柱状图/饼图比较问题)、强制选择重试(多选题过度拒绝)和置信度门控(低置信度验证器修正)。
在FinMME基准测试 (Luo et al. (2025 (https://arxiv.org/html/2606.19782#bib.bib9)))上,我们的流水线使用专有骨干模型(Gemini-3)相比模型匹配的零样本基线提升了+7.68个百分点(p≈1.1×10^{-16}),其中最大的提升出现在多选题问题上(+8.1个百分点)。相同的流水线使用在单个A100上本地服务的开源权重模型Qwen3.6-27B-FP8,也获得了+4.84个百分点的提升(p≈3.0×10^{-6}),证实了这些提升并不依赖于专有API。
我们的贡献是:(1)AgentFinVQA,一个多智能体图表问答流水线,其每一步都记录在可追溯的MEP中,使每个答案都可审计;(2)证明了准确率提升可以从专有模型迁移到本地服务的开源权重模型,从而在适度准确率权衡下支持内部部署;(3)验证器的判定结果作为一个置信度信号,使人工审阅者能够聚焦于最可能出错的答案。
## 2 相关工作
#### 图表问答基准测试。
早期的数据集如FigureQA (Kahou et al. (2018 (https://arxiv.org/html/2606.19782#bib.bib4)))、DVQA (Kafle et al. (2018 (https://arxiv.org/html/2606.19782#bib.bib5)))和PlotQA (Methani et al. (2020 (https://arxiv.org/html/2606.19782#bib.bib6)))在合成图表上建立了任务,而ChartQA (Masry et al. (2022 (https://arxiv.org/html/2606.19782#bib.bib7)))和ChartQA Pro (Masry et al. (2025 (https://arxiv.org/html/2606.19782#bib.bib8)))则引入了基于真实图表的人类编写问题。FinMME (Luo et al. (2025 (https://arxiv.org/html/2606.19782#bib.bib9)))、FinChart-Bench (Shu et al. (2025 (https://arxiv.org/html/2606.19782#bib.bib10)))和MME-Finance (Gan et al. (2024 (https://arxiv.org/html/2606.19782#bib.bib11)))确认了金融场景的难度,但未提供可部署的智能体解决方案,这正是我们所填补的空白。
#### 分解与结构化提取。
DePlot (Liu et al. (2023a (https://arxiv.org/html/2606.19782#bib.bib12)))将图表转换为数据表格以进行单次LLM推理,将模态转换与推理分离;这启发了我们的设计,其中OCR读取器和图例关联器生成结构化文本元数据,为后续阶段提供基础。与MatCha (Liu et al. (2023b (https://arxiv.org/html/2606.19782#bib.bib13)))和UniChart (Masry et al. (2023 (https://arxiv.org/html/2606.19782#bib.bib14)))不同(它们需要领域特定的预训练),我们的流水线仅通过提示即可达到类似的提取效果,并适用于任何视觉语言模型(VLM)后端。
#### 智能体图表理解。
ReAct (Yao et al. (2023 (https://arxiv.org/html/2606.19782#bib.bib15)))建立了推理与行动的范式;我们的规划、OCR、关联、检查、验证流水线将其应用于图表问答。最接近的系统,ChartAgent (Kaur et al. (2026 (https://arxiv.org/html/2606.19782#bib.bib16)))和基于YOLO的变体 (Wang et al. (2026 (https://arxiv.org/html/2606.19782#bib.bib1))),将查询分解为视觉子任务,但使用本地计算机视觉模型物理操作图表图像。AgentFinVQA则通过注入OCR输出和图例映射作为文本,避免了本地的分割基础设施。ChartSketcher (Huang et al. (2026 (https://arxiv.org/html/2606.19782#bib.bib17)))取得了强劲的结果,但需要在30万样本上进行两阶段强化学习微调;我们的流水线仅使用提示,并可在专有和开源权重后端上运行。MAC-SQL (Wang et al. (2025 (https://arxiv.org/html/2606.19782#bib.bib18)))在text-to-SQL中展示了相同的规划-推理-验证模式。
#### 验证与部署。
先前的工作通过自我纠正或基于判断的分析来减少幻觉 (Pan et al. (2026 (https://arxiv.org/html/2606.19782#bib.bib19)); Zheng et al. (2023 (https://arxiv.org/html/2606.19782#bib.bib22)));我们的验证器遵循这一直觉,但作为仅使用提示的推理阶段运行,并为审查路由提供置信度信号。我们仅将基于判断的分析用于事后错误分类,而答案准确率则通过第4.1节 (https://arxiv.org/html/2606.19782#S4.SS1)中基于规则的评分器来衡量。FAITH (Zhang et al. (2025 (https://arxiv.org/html/2606.19782#bib.bib21)))激发了在金融环境中管理静默失败的需求。
## 3 AgentFinVQA框架
#### 问题设定。
给定一个金融图表图像 cc、一个自然语言问题 qq 以及一个可选的多选题选项集合 O={o1,...,ok}O=\\\{o_{1},\dots,o_{k}\\\},任务是产生一个答案 aa 以及一个可追踪的推理痕迹 M\mathcal{M}。对于开放式(标准)问题,aa 是一个数值或短文本字符串;对于单选多选题,a∈Oa\in O;对于多选多选题,a⊆Oa\subseteq O。答案由一个基于规则的评分器进行评分,该评分器对标准答案应用数值容差,对多选题答案给予部分分,从而得到每个样本在 [0,1][0,1] 范围内的分数(平均答案准确率);当样本得分 ≥0.999\geq 0.999(精确准确率)时,被视为完全正确。除了产生 aa 之外,我们施加了两个部署约束,这些约束是架构旨在满足的同时保持强大的答案准确率:系统必须(i)仅使用提示(即无任务特定微调,无本地计算机视觉模型),并且(ii)可在自托管的开源权重骨干上运行,从而使敏感图表永不离开机构。
AgentFinVQA是一个多智能体系统,包含专门的智能体:一个规划器、OCR读取器、图例关联器、确定性颜色区域工具、视觉智能体和验证器,它们依次操作 (c,q,O)(c,q,O),并生成一个经过验证的答案以及一个完全可追踪的模型评估包(MEP)。流水线以固定顺序执行阶段,当触发条件不满足时跳过关卡阶段:规划→\rightarrowOCR→\rightarrow关联→\rightarrow颜色区域→\rightarrow检查→\rightarrow验证。这个顺序并非随意:每个阶段的结构化输出成为下一个阶段的结构化证据,因此更便宜且更可靠的文本提取(OCR、图例)约束了其后更困难的视觉估计,而验证则独立于图表的视角最后运行。图2 (https://arxiv.org/html/2606.19782#S1.F2) 展示了架构。每个阶段将其输入、输出、工具痕迹和时间戳写入每个样本的MEP中,这是一个便携式JSON工件(见附录B (https://arxiv.org/html/2606.19782#A2)),能够实现可重复评估、事后错误归因以及无需重新运行流水线即可进行的审计。本节所用所有阶段缩写和术语的形式化定义见附录A (https://arxiv.org/html/2606.19782#A1)。
#### 规划器。
一个纯文本LLM接收问题和多选题选项,但不查看图表图像。它输出一个结构化的JSON检查计划,包含两到三个关注点、一个问题类型分类和一个可回答性评估。对于多选题问题,规划器明确指示视觉智能体独立检查每个选项,并验证所选答案不被其他数据矛盾。对于多选问题,它指示智能体收集所有支持的选项,而不是在第一个匹配处停止。
#### OCR读取器。
一次单次聚焦的VLM调用转录所有可见文本,生成结构化元数据:图表类型、轴标签和刻度、图例条目、数据标签和注释(见附录B (https://arxiv.org/html/2606.19782#A2),阶段字段结构)。此输出作为所有后续阶段中可见文本的结构化证据,防止视觉智能体误读已可靠提取的标签。
#### 图例关联器。
一次有针对性的VLM调用将每个图例条目映射到其视觉属性:颜色描述、近似RGB、线型和置信度。此图例映射被注入到视觉提示中作为明确的结构化证据,并指示在值提取期间不要重新分配颜色。一个合规性检查验证视觉智能体的解释是否至少引用了一个图例标签的名称;如果没有,则重新尝试视觉调用。合规性重试在13.2%的MEP中触发,证实了该检查正在积极捕捉不合规情况。此阶段根据图表类型和图例大小进行门控。
表1:AgentFinVQA与模型匹配的零样本基线在FinMME上的对比。McNemar检验:Gemini-3 p≈1.1×10^{-16};Qwen3.6-27B-FP8 p≈3.0×10^{-6}。†Qwen的标准差在噪声范围内(CI≈±10个百分点)。
#### 颜色区域工具。
为了解决堆叠柱状图和饼图上的感知估计错误,我们在图例关联和视觉之间引入了一个确定性像素计数阶段。给定前一阶段生成的图例RGB映射,该工具对每个系列应用HSV颜色掩码(±10色调,±40饱和度/明度),以统计每个图例条目的匹配像素,从而生成一个主导标签提示,注入到视觉提示中。与先前智能体系统 (Kaur et al. (2026 (https://arxiv.org/html/2606.19782#bib.bib16))) 使用的本地计算机视觉模型不同,此阶段不需要GPU、不需要训练模型,也不需要分割基础设施;它是一项轻量级的基于规则的计算,只要安装了Python和OpenCV即可运行。
该阶段以保守方式门控:仅在图表类型为柱状图、饼图或环形图;图例有大于1个条目;问题包含比较关键词(最大、最小、最多、最少等);并且图例条目之间未检测到颜色歧义时(成对HSV色调距离>15)才触发。抑制标志和完整的像素分解存储在MEP的ColorArea字段中,用于事后审计(附录B (https://arxiv.org/html/2606.19782#A2))。
#### 视觉智能体。
一个由CrewAI编排的智能体 (CrewAI (2026 (https://arxiv.org/html/2606.19782#bib.bib3))) 执行检查计划,输入包括图表图像、OCR元数据、图例映射和颜色区域提示(如可用)。它生成一个草稿答案、解释和每个选择的置信度分数。三个提示路径分别处理单选多选题、多选多选题和开放式问题。如果视觉智能体在多选题问题上返回UNANSWERABLE(不可回答),则一次强制选择重试会使用明确指示选择最合理选项的提示重新运行,从而降低UNANSWERABLE率。
#### 验证器。
一次独立的第二次VLM调用审计视觉智能体的草稿答案。相似文章
FinanceComplexQA: 面向工业级金融文档的智能体推理基准评估
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。
面向金融文档问答的代理式检索增强生成
本文介绍了 FinAgent-RAG,这是一个用于金融文档问答的代理式框架,它结合了迭代检索、程序化思维推理和自适应资源分配,以提高准确性并降低成本。
从投票到智能体协作:面向答案类型的BioASQ 14b大语言模型流水线
本文针对BioASQ 14b Task B生物医学问答挑战,提出了一种问题类型特定的大语言模型框架。该框架对是非题、事实题和列表题分别采用不同的推理策略(片段打乱、思维链、多智能体协作),取得了具有竞争力的结果,包括在第四批次的事实题子任务中获得第一名。
AUDITFLOW:基于可执行符号环境的结构化财务报告验证框架
本文提出AuditFlow,一种基于图的多智能体框架,利用可执行符号环境进行结构化财务报告验证,在基于FinAuditing的样本上使用GPT-5.5实现了82.09%的审计准确率。
金融合规基础设施作为AI代理问责制的蓝图——包含现有技术调查
本文认为,数十年来为自动化金融交易建立的问责制基础设施为治理AI代理提供了蓝图,借鉴了FINRA规则5310和SEC规则17a-4等具体监管机制。