CIFQA:一种基于确定性工具的多智能体LLM金融查询解答框架
摘要
CIFQA引入了一种基于确定性工具的多智能体LLM框架,用于金融查询解答。该框架将语言解释与数值执行分离,实现高准确性,并在计算密集型任务上超越更大的模型。
arXiv:2608.26114v1 公告类型:新
摘要:计算密集型金融问题解答需要对结构化利率、时间条件、数值公式和基于规则的约束进行精确推理。尽管大型语言模型(LLM)在自然语言任务上表现强劲,但在解决多步金融计算时,它们经常产生数值错误但看似合理的答案。为解决这一局限性,我们引入CIFQA(计算密集型金融查询解答),一种基于确定性工具的多智能体LLM框架,用于金融查询解答。CIFQA通过分配专门的智能体处理查询解释、路由、参数提取、计算规划和响应生成,将语言理解与数值执行分离,而基于Python的确定性工具执行金融计算和规则应用。我们将CIFQA实例化用于定期存款查询解答,并在一个精心策划的定期存款查询基准上进行评估。CIFQA在计算密集型查询上达到95.54%的准确率,总体准确率为90.87%,即使在提供完整公式、利率卡和基准说明的情况下,也显著超越直接的LLM基线。消融研究表明,诸如精确利率查找、期限计算、滚动年调整和提前支取逻辑等确定性组件是性能的关键贡献者。值得注意的是,在CIFQA内运行的一个170亿参数开源骨干模型,在相同金融信息评估下,超越了规模更大的前沿模型,这表明架构设计比模型规模更是数值可靠性的决定性因素。虽然在定期存款查询上进行评估,但CIFQA为计算密集型金融推理任务提供了一个可泛化的框架。
查看缓存全文
缓存时间: 2026/08/28 09:27
# 1 引言 来源:https://arxiv.org/html/2608.26114 CIFQA:一种基于确定性工具的多智能体LLM框架,用于金融查询解答 Kunjesh Parekh1∗ Dr. Anil Kumar Tiwari1 Dr. Divya Saxena1 1印度理工学院焦特布尔分校人工智能与数据科学学院,拉贾斯坦邦 342030,印度 ∗通讯作者:[[email protected]](mailto:[email protected]) 共同作者:[[email protected]](mailto:[email protected]) 共同作者:[[email protected]](mailto:[email protected]) ###### 摘要 计算密集型的金融问答不仅需要语言理解能力,还需要对结构化的利率、时间条件、数值公式和基于规则的约束条件进行精确的可执行推理。尽管大型语言模型在自然语言任务上表现出色,但在此类查询上常常失败,因为概率性文本生成无法一致地执行确定性的多步计算。因此,LLM可能产生算术幻觉:即使提供了相关公式和上下文信息,仍可能给出数值错误但看似合理的金融答案。我们提出了计算密集型金融查询解答(CIFQA),这是一个用于金融查询解答的确定性工具驱动多智能体LLM框架。CIFQA通过将LLM智能体分配到查询理解、路由、参数提取、计算规划和响应构建等任务,将语言解释与数值执行分离,同时使用确定性的基于Python的工具来执行利率查询、日历感知的期限计算、复利、支付处理和规则应用等金融操作。这样,CIFQA将金融QA视为一个可执行的推理任务,而不仅仅是一个纯文本生成问题。我们在固定存款查询解答领域实例化了CIFQA,并在一个精心策划的固定存款查询基准上进行了评估。CIFQA在计算密集型查询上达到了95.54%的准确率,总体准确率为90.87%,即使提供了完整的公式、利率卡和基准说明,也显著优于直接的LLM基线模型——这证实了局限性在于架构而非信息本身。分类分析显示,该框架在季度支付、月度支付、累积FD、TDS相关和边界案例查询上表现强劲。消融实验进一步证明,确定性组件,特别是滚动年份调整、精确利率查询、期限计算和提前支取逻辑,是性能的关键贡献者。值得注意的是,一个在CIFQA中运行的170亿参数开源主干模型,其表现优于规模更大的前沿模型,包括GPT-5.3、Gemini 3和Claude Sonnet 4.6(后者在评估时也提供了完整的公式和利率信息),这表明对于数值可靠性,架构设计比模型规模更为关键。虽然CIFQA是在固定存款查询上实例化的,但它为计算密集型金融推理提供了一个可泛化和模块化的设计模式,并自然扩展到多工具决策支持、利率趋势分析和跨资产流动性优化等领域。 关键词:计算密集型金融查询解答(CIFQA);金融问答;确定性金融计算;工具驱动的多智能体LLM系统;混合多智能体LLM架构;算术幻觉;金融推理;多智能体金融AI;可执行金融推理;智能体AI 大型语言模型在金融服务领域的应用日益广泛,涵盖客户支持、咨询系统、文档分析和金融问答等方面\[38, 35, 37\]。最近的基准测试,如FinanceBench,进一步凸显了LLM在金融领域问答中的潜力和局限性\[15\]。其强大的自然语言理解能力使得通过对话界面与复杂金融信息进行交互成为可能。然而,金融应用与传统文本生成任务有根本性不同:正确性往往取决于精确的算术执行、日历感知推理、结构化利率检索以及对金融规则和监管条件的严格遵守。在这种环境下,即使是微小的数值偏差也可能导致金融上的错误输出,使得可靠性成为实际部署的关键要求\[6, 33, 9, 22, 36, 13, 16\]。 尽管具有强大的语言生成能力,前沿LLM在涉及精确算术、日历感知推理和基于规则的金融计算的计算密集型金融任务上,表现出系统性的执行失败。图1展示了GPT-5.3、Claude Sonnet 4.6和Gemini 3在涉及利率选择、滚动年份分母处理、支付计划重建和提前支取结算计算的固定存款查询上的代表性示例。 参考标题 图1:前沿LLM在计算密集型固定存款查询上的代表性执行失败案例,即使提供了完整的公式、利率卡和基准说明。观察到的失败并非孤立的数值错误,而是源于概率语言模型无法可靠执行确定性金融计算而产生的系统性执行错误。常见的失败模式包括:从结构化利率表中错误选择利率区间、在闰年边界处不恰当地处理滚动年份分母、支付计划重建失败、提前支取结算不一致以及链式多步计算中的数值漂移。重要的是,即使模型提供了完整的金融公式、利率卡和详细的基准说明,这些失败仍然存在,这表明局限性在于架构而非信息本身。 本文聚焦于我们定义为计算密集型金融查询解答的一类问题,即生成正确响应需要在特定金融规则下,对结构化金融数据进行精确的算术计算。代表性示例包括固定存款利息计算、贷款摊销、债券收益率估算、投资回报分析和税务相关结算计算\[38, 35, 37, 15\]。与主要涉及检索、摘要或文本推理的传统金融问答任务不同,CIFQA需要确定性地执行涉及精确利率匹配、日历感知日期处理、支付计划、复利以及条件性金融规则应用的计算流程。 为解决这一局限性,我们提出了CIFQA,一个用于可执行金融推理的确定性工具驱动多智能体LLM框架,它建立在近期工具增强推理、程序辅助语言模型和智能体AI系统的进展之上\[9, 25, 40, 34, 3, 24, 26, 28, 7\]。CIFQA强制实现了语言理解与数值执行之间的严格分离:LLM智能体负责查询解释、路由、参数提取、计算规划和响应生成,而所有算术操作则委托给确定性执行引擎来处理利率查询、日历感知计算、支付处理和金融规则执行。通过明确阻止LLM直接执行算术操作,CIFQA消除了源于概率令牌预测的确定性计算失败,并确保了可重现的金融计算。 我们在固定存款查询解答领域实例化了CIFQA,并在一个精心策划的包含126个FD查询的基准上对其进行了评估,这些查询涵盖了计算密集型推理、利率查询、提前支取处理、政策解释和边界案例场景。CIFQA在计算密集型查询上达到了95.54%的准确率,总体准确率为90.87%,显著优于GPT-5.3、Gemini 3和Claude Sonnet 4.6。值得注意的是,一个在CIFQA中运行的相对较小的170亿参数开源主干模型,其表现优于规模大得多的前沿LLM(后者在评估时提供了完整的金融公式、利率卡和基准说明),这表明对于可靠的金融推理,确定性的可执行计算比模型规模更为重要。 本工作的主要贡献如下: - •我们识别出计算密集型金融问答作为金融QA问题的一个独立类别,其中正确的响应需要对结构化金融数据、时间条件、数值公式和领域特定规则进行精确的可执行推理。与主要涉及检索或文本生成的传统金融QA任务不同,这些查询需要精确的操作,如利率选择、日历感知计算、复利、支付处理和规则应用。 - •我们提出了一种用于金融查询解答的确定性工具驱动多智能体LLM框架——CIFQA。该框架将语言中心任务与数值执行分离:LLM智能体执行查询解释、路由、参数提取、计算规划和响应构建,而确定性工具以可验证的方式执行金融计算和基于规则的操作。 - •我们在固定存款查询解答领域实例化了该框架,并在精心策划的计算密集型查询基准上对其进行了评估。CIFQA在计算密集型查询上达到了95.54%的准确率,总体准确率为90.87%,优于提供了相关公式和利率信息的直接LLM基线模型。分类和消融分析表明,诸如滚动年份调整、精确利率查询、期限计算和提前支取逻辑等确定性模块对于提高计算正确性和金融推理准确性很重要。 本文其余部分组织如下。第2节回顾了关于金融NLP、检索增强系统、工具增强推理和多智能体LLM框架的相关工作。第3节形式化了CIFQA问题设定。第4节介绍了CIFQA框架架构。第5节描述了实现细节。第6节概述了实验设置。第7节展示结果和分析。第8节讨论了泛化性和局限性,第9节对全文进行总结。 ## 2 相关工作 金融问答研究主要集中在文本理解、信息提取、情感分析和语言模型的金融领域适应等方面\[38, 35, 37, 15, 18, 41\]。例如领域适应的Transformer模型(如FinBERT\[38\])、大规模金融基础模型(如BloombergGPT\[35\])和开源金融LLM(如FinGPT\[37\])在金融文本理解、分类和检索任务上表现出色。然而,这些方法未能解决响应需要对结构化金融数据进行精确数值计算的场景。诸如FinQA\[4\]、TAT-QA\[43\]和ConvFinQA\[5\]等金融QA基准测试表明,即使领域知识可用,对金融文档的数值推理对于现有模型来说仍然是一个重大挑战。 检索增强生成系统已被广泛采用,通过为大型语言模型提供外部知识来提高事实正确性\[19, 10, 1\]。虽然对于知识密集型任务有效,但RAG框架对于计算密集型场景仍然不足,因为它们检索信息但不能保证多步算术计算的正确执行。 近期研究探索了思维链推理、工具增强推理、程序辅助语言模型和推理-行动框架,其中LLM生成中间推理轨迹、可执行程序或外部工具调用,以提高数值推理性能\[33, 9, 25, 40, 3, 42, 31, 39, 24, 21\]。这些方法通过为LLM配备外部计算能力来提高准确性;然而,它们仍然依赖LLM来正确确定计算过程、生成可执行程序或调用适当的工具。类似地,多智能体LLM框架将任务分解为专门的角色,如规划者、执行者和验证者,通过迭代细化和协调的智能体交互来改进推理\[34, 20, 12, 30, 26, 29, 14\]。然而,这些系统通常将LLM保留在计算循环内,使得精确的算术正确性取决于中间LLM决策的可靠性。相比之下,CIFQA将算术执行完全从LLM推理循环中移除,并将所有金融计算委托给确定性引擎,确保金融计算的可重现性和可验证性。 最近的研究探索了将语言模型与确定性计算、外部工具和可执行推理模块相结合的混合AI系统,以提高结构化推理任务中的可靠性\[25, 9, 40, 11\]。
相似文章
CLAIR-Fin: 用于声明级验证和自适应辩论的跨模态金融问答对抗性多智能体框架
CLAIR-Fin 是一种对抗性多智能体框架,旨在通过将问题分解为原子声明,并使用自适应辩论和验证来减少幻觉,从而增强跨模态金融问答的忠实性。
AgentFinVQA: 一种可部署的多代理管道,用于可审计的金融图表问答
AgentFinVQA是一个多代理管道,用于金融图表问答,它将查询分解为规划、OCR、图例确认、视觉检查和验证步骤,并将每一步记录在可追溯的模型评估包中。与零样本基线相比,它实现了显著的准确性提升,同时支持本地部署和可审计性。
Opti-Q:一种基于约束的多LLM问题规划优化框架
Opti-Q 是一个受数据库启发的优化器,用于多LLM问答,通过规划执行DAG,在成本、延迟和能量约束下优化答案质量,在基准测试中取得了显著改进。
FinanceComplexQA: 面向工业级金融文档的智能体推理基准评估
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。
AQuA:递归自我改进的量化交易研究智能体
AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。