FinanceComplexQA: 面向工业级金融文档的智能体推理基准评估
摘要
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。
查看缓存全文
缓存时间: 2026/07/24 13:01
论文页面 - FinanceComplexQA:面向工业级金融文档的智能体推理基准
来源:https://huggingface.co/papers/2607.19238
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
智能体推理(Agentic Reasoning)因能够整合大规模信息并生成可靠准确的内容,已成为金融分析领域的一股变革性力量。然而,在处理复杂的现实世界问题时,不同智能体仍表现出显著的性能差异。在这项工作中,我们设计了 Finance-LaTeXSKILL——一种基于专家知识合成具有复杂布局的金融文档的技能。基于该技能构建的智能体工作流,我们生成了 2,000 份专业金融文档以及 6,000 个高质量问答对。为了全面评估智能体的能力,我们引入了 FinanceComplexQA——一个贴近真实场景的综合性金融文档开放式生成基准。它包含 2,026 个深度研究任务,覆盖 1,009 份金融文档。FinanceComplexQA 具有 8 个关键特征:双语支持;覆盖六大主流场景与七种任务;专家级文档推理问题;复杂布局的深度研究;相对稳定且持久的参考答案;以及通过具备多种评估指标的智能体作为评判者(Agent-as-a-Judge)实现精确评估。利用 FinanceComplexQA,我们对领先的 RAG 系统与面向金融文档问答的智能体推理工具进行了全面评估。通过识别和分析失败案例,我们深入研究了它们在数值计算、多跳推理、内容总结和行业分析方面的能力。
查看 arXiv 页面 (https://arxiv.org/abs/2607.19238)
查看 PDF (https://arxiv.org/pdf/2607.19238)
项目页面 (https://huggingface.co/datasets/Multilingual-Multimodal-NLP/FinanceComplexQA)
GitHub1 (https://github.com/buaacxf/FinanceComplexQA)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19238)
在你的智能体中获取这篇论文:
hf papers read 2607.19238
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型:0
尚无模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2607.19238 即可在此页面建立链接。
引用该论文的数据集:1
Multilingual-Multimodal-NLP/FinanceComplexQA
约2小时前更新 • 21 • 2 (https://huggingface.co/datasets/Multilingual-Multimodal-NLP/FinanceComplexQA)
引用该论文的 Spaces:0
尚无 Space 链接该论文
在 Space README.md 中引用 arxiv.org/abs/2607.19238 即可在此页面建立链接。
包含该论文的收藏集:0
尚无收藏集包含该论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可在此页面建立链接。
相似文章
FinRCA-Bench: 金融AI系统的证据检索与推理基准测试
FinRCA-Bench是一个基准测试,旨在评估金融AI系统的证据检索和推理能力,为评估和改进提供标准化方法。
面向金融文档问答的代理式检索增强生成
本文介绍了 FinAgent-RAG,这是一个用于金融文档问答的代理式框架,它结合了迭代检索、程序化思维推理和自适应资源分配,以提高准确性并降低成本。
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件
本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。
Herculean:面向金融智能的智能体基准测试
介绍了Herculean,这是一个旨在评估AI智能体在各种任务中金融智能水平的基准。论文提出了一个综合性框架,用于评估金融领域的智能体能力。
AgentFinVQA: 一种可部署的多代理管道,用于可审计的金融图表问答
AgentFinVQA是一个多代理管道,用于金融图表问答,它将查询分解为规划、OCR、图例确认、视觉检查和验证步骤,并将每一步记录在可追溯的模型评估包中。与零样本基线相比,它实现了显著的准确性提升,同时支持本地部署和可审计性。