CLAIR-Fin: 用于声明级验证和自适应辩论的跨模态金融问答对抗性多智能体框架
摘要
CLAIR-Fin 是一种对抗性多智能体框架,旨在通过将问题分解为原子声明,并使用自适应辩论和验证来减少幻觉,从而增强跨模态金融问答的忠实性。
arXiv:2608.13706v1 公告类型:新
摘要:现有针对检索增强和多智能体管道中幻觉的防御措施仍然是部分的:尽管模态不一致,证据仍被信任,辩论验证的是汇总报告而非个别声明,并且这种验证仅在起草后发生,使得智能体间的错误在最终文本中才被检测到。为了解决这一差距,我们提出了CLAIR-Fin,一个九智能体框架,将每个问题分解为原子声明,并在类型化的Financial Claim Ledger中维护。每个声明通过Asymmetric Evidence Authority解决,它根据声明类型而不是将所有模态视为同等可靠来调整证据信任;Chain-of-Custody Verification,在起草和对抗性审查的交接点检查依据,而不是仅在管道出口处;一个Adaptive Rebuttal Cycle,将争议声明路由通过对抗性辩论,其深度根据辩论发现进行调整;以及一个终端蕴涵审计,配合连续的Hallucination Risk Index,区分通过审查的声明和从未被争议的声明。我们在BB-FinQA-X上评估CLAIR-Fin,这是一个基于孟加拉国银行年报材料构建的500个问题的跨模态金融评估集,按查询类型、格式和难度分层。相对于单次检索增强生成基线,它提高了忠实性($0.780 \rightarrow 0.889$),同时在证据不足时放弃5.4%的问题,而不是强制提供无支持的响应,并且在忠实性上超越了更强的检索策略基线,如HyDE和Graph-RAG($\leq 0.874$)。
查看缓存全文
缓存时间: 2026/08/17 09:43
# CLAIR-Fin:一种用于跨模态金融问答中声明级验证与自适应辩论的对抗性多智能体框架 来源:https://arxiv.org/html/2608.13706 Mukaffi Bin Moin 所属机构:孟加拉国阿赫桑努拉科技大学 Jubayer Al Mahmud 所属机构:孟加拉国贾肖尔科技大学 M. F. Mridha 所属机构:美国国际大学(孟加拉分校) 通讯邮箱:[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]) Md. Alam Hossain 所属机构:孟加拉国贾肖尔科技大学 ###### 摘要 现有针对检索增强及多智能体流程中幻觉现象的防御手段仍不完善:证据虽存在模态差异却被盲目采信,辩论仅验证汇总报告而非独立声明,且验证过程仅发生在生成草稿之后,导致智能体间的错误直至最终文本生成后才被发现。为填补这一空白,我们提出 CLAIR-Fin——一个由九个智能体组成的框架。该框架将每个问题分解为原子化声明,并维护于一个带类型的金融声明账本中。每个声明通过**非对称证据权威机制**进行解析,该机制根据声明类型而非同等对待所有模态来建立证据信任度;通过**监管链验证**在草稿撰写与对抗性审核的交接环节检查依据,而非仅在流程出口处进行;通过**自适应反驳循环**将存疑声明路由至对抗性辩论,辩论深度随审查发现动态调整;最终通过蕴含审计配合持续性的**幻觉风险指数**,区分通过实质性审查的声明与从未被质疑的声明。我们在 BB-FinQA-X 上评估了 CLAIR-Fin,这是一个基于孟加拉国银行年报材料构建的500题跨模态金融评估集,按查询类型、格式和难度分层。与单次检索增强生成基线相比,该框架将忠实度从 0.780 提升至 0.889,同时在证据不足时有5.4%的题目选择弃答而非强行生成无依据的回答;在忠实度指标上,该框架超越了 HyDE 和 Graph-RAG 等更强检索策略基线(≤0.874)。 ## 1 引言 参见图注 图1:分析师的问题输入 CLAIR-Fin,专用智能体为每个声明提取证据。每个声明经历**证据→辩论→审计**流程,存疑声明会进行对抗性审核,引用蕴含关系在合成最终回答前得到验证。 金融机构越来越依赖大型语言模型来回答基于长达数百页、多模态报告的问题,其中同一事实可能在文档中同时以叙述文本、表格和图表形式出现。误读财年标签或将图表近似值报告为精确数值,都可能实质性改变结论;即使是最先进的视觉语言模型在图表解读任务中也会产生幻觉(28)。基于早期表格-文本问答工作的跨模态基准测试(5;36),包括 FinanceBench(15)、FAMMA(32)和 XFinBench(34)发现,当前大语言模型在现实金融问题上表现不佳,随着上下文增长以及证据远离文档起始位置,性能进一步恶化(17)——这正是长篇报告所处的情境。此类系统必须检索相关内容、协调跨模态冲突证据,并在证据不足时忠实回答或拒绝作答。先前的多项工作分别解决了该问题的不同环节,但各自存在缺口。 多智能体框架如 MDocAgent(13)在长文档上协调专用智能体,多模态检索框架如 MultiFinRAG(10)和 FinRAGBench-V(35)联合索引表格、图表和文本,但均未根据声明类型建立证据信任机制。金融辩论框架如 FinDebate(2)和结构化对抗性综合(25)对报告级分析应用对抗角色(8;3),但无论声明争议程度如何,均采用固定轮次对整体论点进行辩论。验证方法如 Chain-of-Verification(6)、FinGround(11)和 FRED(26)则检查原子化声明,自一致性采样提供了一种与声明类型无关的替代方案(20);两者均仅在草稿生成后操作,且未将二元结果与连续风险估计配对(第2.3节)。基准测试如 FinBen(31)也忽略了非日历财年以及南亚中央银行报告典型的密集统计表格。 纵观现有文献,证据权威性具有统一性,验证若存在则滞后,且弃答能力很少被量化(30;19)。我们引入 CLAIR-Fin(声明账本对抗性推理与检索,用于金融文档理解),这是一个由九个智能体组成的框架,用于多模态金融文档的可靠问答,基于中央银行年报进行评估(附录A),其财年定义、货币面额和报告实践与先前评估套件主要针对的企业文件有所不同(第2节)。 **计划协调器**将每个问题分解为包含原子化、带类型断言的**金融声明账本**(FCL),由三个证据智能体填充,并通过账本守护者使用**非对称证据权威机制**(AEA)进行协调——这是一种声明类型感知的加权方案,优先采用表格证据确保数值精确性,同时侧重叙述文本进行因果归因。在对抗性审核前,**监管链验证**(CoCV)验证并恢复证据依据,防止归因漂移传播至后续推理。存疑声明随后通过**自适应反驳循环**(ARC)升级至正方和反方顾问,审议深度根据未解决发现动态扩展,而非遵循预设预算。**法官审计员**随后执行最终蕴含门控,并记录每个 AEA 决定及其等权重反事实对照;持续性的**幻觉风险指数**区分经受实质性审查的断言与从未受到挑战的断言。最后,**摘要合成器**生成回答,并在可用证据无法充分支持答案时选择弃答。 我们将围绕以下研究问题构建该框架的评估体系: - • RQ1. 模态感知的证据优先级排序能在多大程度上提升忠实度和正确性(相对于模态无关的检索)? - • RQ2. 交接级验证在减少无依据声明传播方面的可靠性如何? - • RQ3. 将对抗性辩论路由至存疑声明是否比完全跳过辩论更能提升事实依据性? - • RQ4. 连续风险估计是否比单纯二元验证提供更可靠的信息信号? - • RQ5. 该框架在单模态和多模态呈现格式下的表现如何?哪些配置最具挑战性? ## 2 相关工作 ### 2.1 多模态金融文档理解与检索增强生成 将检索增强生成扩展至多模态金融文档最接近我们的研究场景。通用多智能体在长文档上协调文本和图像智能体(13),而金融专用检索框架将表格和图表图像通过轻量级多模态模型批处理,仅在需要时升级至文本+表格+图像上下文(10),在 RAG 范式内(12)通过无需参考的协议评估忠实度、相关性和上下文精确度/召回率(9)。这提升了检索内容的质量,但将检索视为引用即完成:对于同一数量的表格单元格和近似读取的图表值被视为可互换,缺乏在冲突时仲裁信任依据的机制,这一缺口被忠实度分数放大——因其测量的是某些证据而非正确证据的蕴含关系。 ### 2.2 多智能体辩论与金融多智能体系统 第二条研究路线使用多智能体辩论(大语言模型实例批判和修订输出)来提升事实性和推理能力(8)。金融应用添加领域特定结构:专业角色框架分配盈利、市场、情绪、估值和风险角色,并配有信任/怀疑/领导安全层(2);辩证框架在财报电话会议记录中设置牛市/熊市/魔鬼代言人角色(25);最新研究探讨协调成本与收益的关系(21)。共同假设是辩论是报告的属性而非声明的属性:分歧未被标记,辩论深度固定不变,无视争议程度,导致声明级、难度自适应的验证未被解决。 ### 2.3 声明级验证、提取可靠性与忠实度评估 更接近声明级验证的文献研究对单个陈述而非整个报告的验证。综述描述了该领域的主流流程:检索、分解、检查蕴含关系,应用于已完成的声明(7);图结构验证将声明转换为实体关系图,在判定前检查每个三元组(16),在精神上更接近我们的声明账本,但应用于开放领域声明而非跨模态证据。自一致性方法则采样多个输出并通过多数共识聚合,基于可重复性表示可靠性的前提(29),尽管开放域问答依赖可信提取(15),且大语言模型生成的摘要尽管表面得分高,却经常遗漏源数据(33)。因此验证仅在声明形成后检查,且可重复性不保证正确性。 ### 2.4 研究缺口与 CLAIR-Fin 的定位 跨这三个方向,每个方向单独解决该问题的一个环节——证据仲裁、自适应辩论或交接验证——且未联合运作。CLAIR-Fin 填补了这一缺口:根据声明类型建立证据信任,使跨模态分歧通过明确、可审计的先验解决;仅当证据覆盖不足时将声明路由至对抗性辩论,辩论深度随审查程度动态调整而非固定预算;在草稿撰写与对抗性审核的交接环节验证依据,将即使是自一致的证据也视为可疑。 参见图注 图2:端到端 CLAIR-Fin 框架(阶段 I-VIII,第3节)。问题被分解为原子化声明(阶段 I-II),模态专用智能体为每个声明检索证据(阶段 III),经融合和权威加权决定快速路径或升级处理(阶段 IV)。升级的声明通过对抗性辩论和交接依据检查(阶段 V-VI),随后进行最终的权威加权审计(阶段 VII)。当所有声明解决后,框架生成带引用的回答或选择弃答(阶段 VIII)。 ## 3 CLAIR-Fin 框架 ### 3.1 问题定义 我们解决长篇多模态金融文档的忠实问答,其中证据跨越叙述文本、表格和图表。 **任务**:给定语料库 D 上的问题 q,框架生成带引用的答案 a,或在证据不足时弃答。 **声明分解**:q 被分解为有序原子化声明 C={c₁,...,cₙ},n≤8。每个 cᵢ=(idᵢ,textᵢ,τᵢ) 具有声明类型 τᵢ∈T={FACT_NUMERIC, FACT_TREND, CAUSE_ATTRIBUTION, RATIO_IDENTITY}(公式1),该类型固定了其证据加权方式(第3.4节);声明在合成前依次独立解析。 **证据**:证据跨越四种模态,M={text, table, chart, tool_derived}(公式2),其中 tool_derived 是确定性计算量(如同比增长率)而非直接读取值。每项证据 e=(m,src,page,content,conf) 包含模态 m∈M、来源、页码、内容及置信度 conf∈[0,1]。 **金融声明账本**(FCL):声明和证据累积于一个带类型、有向多重图 G=(V,E) 中,包含六种节点类型(声明、文本片段、表格单元格、衍生指标、图表区域、约束检查)和边 r∈{SUPPORTS, SAME_AS, VIOLATES_CONSTRAINT}(公式3)。G 在问题生命周期内持续存在,作为唯一的验证、审计和引用载体。记 score(u,v) 为 SUPPORTS 边的置信度,supp(c)={v:(v,c,SUPPORTS)∈E} 为 c 的支持证据。 ### 3.2 阶段 I:文档摄入 每个源 PDF 离线处理一次,生成语料库 D,供阶段 III(第3.4节)检索。每页独立处理:仅当文本层未损坏且页面无图表/图像信号时,才信任原生提取(文本层加基于规则的表格检测);否则通过结构化视觉模型调用从渲染图像中提取叙述文本、表格和图表——若存在图表或图像则使用更强大的模型,否则使用更轻量的模型。表格提取最不可靠:温度为0的重复视觉调用可能产生分歧。每个表格最多提取三次,并检查两两一致性(公式4);三次中两次一致标记为高置信度,否则保留首次提取结果并标记为低置信度,保留在语料库中以供溯源。
相似文章
CIFQA:一种基于确定性工具的多智能体LLM金融查询解答框架
CIFQA引入了一种基于确定性工具的多智能体LLM框架,用于金融查询解答。该框架将语言解释与数值执行分离,实现高准确性,并在计算密集型任务上超越更大的模型。
AgentFinVQA: 一种可部署的多代理管道,用于可审计的金融图表问答
AgentFinVQA是一个多代理管道,用于金融图表问答,它将查询分解为规划、OCR、图例确认、视觉检查和验证步骤,并将每一步记录在可追溯的模型评估包中。与零样本基线相比,它实现了显著的准确性提升,同时支持本地部署和可审计性。
面向金融文档问答的代理式检索增强生成
本文介绍了 FinAgent-RAG,这是一个用于金融文档问答的代理式框架,它结合了迭代检索、程序化思维推理和自适应资源分配,以提高准确性并降低成本。
FinanceComplexQA: 面向工业级金融文档的智能体推理基准评估
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。
口语对话中的上下文感知多模态声明验证
本文介绍了MAD2,一个用于口语对话中多模态声明验证的新基准,并提出了音频和文本模型的校准融合,利用对话上下文来提高验证准确性。