FinRCA-Bench: 金融AI系统的证据检索与推理基准测试

arXiv cs.AI 论文

摘要

FinRCA-Bench是一个基准测试,旨在评估金融AI系统的证据检索和推理能力,为评估和改进提供标准化方法。

arXiv:2608.18534v1 公告类型:新 摘要:大型语言模型越来越多地被用于支持金融操作,但它们表面的推理性能可能取决于是否收到正确的证据。在金融对账中,诊断所需的证据分布在发票、采购订单、审批、分配、付款、分类账条目和银行活动之间,通过交易关系而非文本相似性链接。因此,端到端的准确性可能会混淆证据访问和推理质量。我们介绍了FinRCA-Bench,这是一个确定性的合成基准测试,包含2,250个应付账款到银行的对账案例,跨越14个操作表,包括15个因果类别中的1,500个注入失败和750个合法或硬负案例。根本原因标签和记录级证据合约对模型隐藏,允许检索独立于答案正确性进行评估。我们比较了Rules/SQL、经典机器学习、密集语义检索、确定性关系扩展和类型化溯源图检索(TPGR),后者是一种限于持久化交易关系的类型化遍历。Rules/SQL达到84.97%的保留集精确准确率,经典ML达到95.44%。固定推理模型、提示和生成设置,仅改变检索,将宏所需记录召回率从0.83%提高到77.70%,精确16类准确率从2.05%提高到72.44%。在检索充足的情况下,结构性检索失败以95比15超过推理失败;254个正确预测尽管检索不完整,且严格返回证据合约准确率仅为5.72%。在FinRCA-Bench上,检索架构强烈影响观察到的AI系统性能,正确的根本原因标签是可审计诊断的弱代理。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:14

# FinRCA-Bench:金融AI系统的证据检索与推理基准测试
来源:https://arxiv.org/abs/2608.18534
文献工具

## 文献与引用工具

文献探索器切换

代码、数据、媒体

## 与本文相关的代码、数据和媒体

演示

## 演示

相关论文

## 推荐工具与搜索工具

关于arXivLabs

## arXivLabs:与社区协作者共同开展的实验性项目

arXivLabs是一个协作框架,允许合作者直接在我们的网站上开发和共享新的arXiv功能。
与arXivLabs合作的个人和组织均已认同并接受我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,仅与遵守这些价值观的合作伙伴开展合作。
是否有一个能为arXiv社区带来价值的项目构想?**了解更多关于arXivLabs的信息** (https://info.arxiv.org/labs/index.html)。

相似文章