FinRCA-Bench: 金融AI系统的证据检索与推理基准测试
摘要
FinRCA-Bench是一个基准测试,旨在评估金融AI系统的证据检索和推理能力,为评估和改进提供标准化方法。
arXiv:2608.18534v1 公告类型:新
摘要:大型语言模型越来越多地被用于支持金融操作,但它们表面的推理性能可能取决于是否收到正确的证据。在金融对账中,诊断所需的证据分布在发票、采购订单、审批、分配、付款、分类账条目和银行活动之间,通过交易关系而非文本相似性链接。因此,端到端的准确性可能会混淆证据访问和推理质量。我们介绍了FinRCA-Bench,这是一个确定性的合成基准测试,包含2,250个应付账款到银行的对账案例,跨越14个操作表,包括15个因果类别中的1,500个注入失败和750个合法或硬负案例。根本原因标签和记录级证据合约对模型隐藏,允许检索独立于答案正确性进行评估。我们比较了Rules/SQL、经典机器学习、密集语义检索、确定性关系扩展和类型化溯源图检索(TPGR),后者是一种限于持久化交易关系的类型化遍历。Rules/SQL达到84.97%的保留集精确准确率,经典ML达到95.44%。固定推理模型、提示和生成设置,仅改变检索,将宏所需记录召回率从0.83%提高到77.70%,精确16类准确率从2.05%提高到72.44%。在检索充足的情况下,结构性检索失败以95比15超过推理失败;254个正确预测尽管检索不完整,且严格返回证据合约准确率仅为5.72%。在FinRCA-Bench上,检索架构强烈影响观察到的AI系统性能,正确的根本原因标签是可审计诊断的弱代理。
查看缓存全文
缓存时间: 2026/08/20 10:14
# FinRCA-Bench:金融AI系统的证据检索与推理基准测试 来源:https://arxiv.org/abs/2608.18534 文献工具 ## 文献与引用工具 文献探索器切换 代码、数据、媒体 ## 与本文相关的代码、数据和媒体 演示 ## 演示 相关论文 ## 推荐工具与搜索工具 关于arXivLabs ## arXivLabs:与社区协作者共同开展的实验性项目 arXivLabs是一个协作框架,允许合作者直接在我们的网站上开发和共享新的arXiv功能。 与arXivLabs合作的个人和组织均已认同并接受我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,仅与遵守这些价值观的合作伙伴开展合作。 是否有一个能为arXiv社区带来价值的项目构想?**了解更多关于arXivLabs的信息** (https://info.arxiv.org/labs/index.html)。
相似文章
FinProBench:基于专业交付物衍生角色锚定评分标准评估金融AI智能体
介绍了FinProBench,一个基于真实专业交付物衍生角色锚定评分标准来评估金融AI智能体的基准,并提出了RGRC流水线,该流水线改善了对角色专业化任务的评估。
FinanceComplexQA: 面向工业级金融文档的智能体推理基准评估
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。
FinSkillBench: 评估投资管理领域的AI代理和领域技能
FinSkillBench是一个针对投资管理领域AI代理的评估套件,表明精心策划的程序化技能相比自生成技能能提升性能。
RusFinChain:面向金融领域可验证思维链推理的俄语基准测试,配备模糊对齐评估
介绍RusFinChain——首个面向金融领域可验证思维链推理的俄语符号基准测试,涵盖17个领域,包含5,280个参数化示例,并增强了评估指标,包括模糊数值对齐。
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件
本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。