LLM的财务推理是否可信?基于长周期报表的真实世界测试

arXiv cs.CL 论文

摘要

介绍了FinIndices,一个大规模基准测试,用于评估LLM在未裁剪财务报表上的数据处理保真度,揭示了财务推理中的知识瓶颈和结构瓶颈。

arXiv:2607.28661v1 公告类型:新 摘要:大型语言模型(LLM)是否具备真正的结构化推理能力,还是仅仅依赖于表面的模式匹配?金融领域要求数值精度和长上下文中的多步逻辑,是一个理想的试验场。现有基准测试未能捕捉真实世界的工业复杂性,主要依赖基于裁剪表格的多项选择题或单跳问答,而忽略了复杂的跨报表动态和时间去累积(temporal de-cumulation)。 为弥补这一空白,我们提出了FinIndices,一个大规模基准测试,评估在未裁剪财务报表(最长32K token)上的数据处理保真度。利用带有对抗性陷阱的自动化合成流水线,FinIndices涵盖单指数计算和表指数制表,以测试复杂的领域、时间和口径推理。 我们的评估揭示了LLM的两个严重漏洞。第一是“知识瓶颈”:尽管模型在预训练中记住了公式,但表现出脆弱的模式匹配。移除显式公式提示会导致性能崩溃(例如,Gemini-3.1-Pro在表格任务上从70.70%下降到38.22%),暴露出时间去累积和存量-流量口径不匹配方面的致命缺陷。第二是“结构瓶颈”:生成多指标、多周期表格所带来的高强度认知负荷会大量消耗推理能力。在结构压力下,能够完美执行孤立推导的LLM会退化为浅层启发式方法,例如获取错误的相邻列,或用懒惰的字面算术替代深层的会计调整。最后,监督微调(SFT)带来了可观的零提示增益(Single +8.54%,Table +3.82%),验证了结构化逻辑可以通过以数据为中心的对齐得到部分恢复。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:32

# 大语言模型的金融推理可信吗?对长时域陈述的真实世界测试
来源:https://arxiv.org/abs/2607.28661
作者:Xinke Tong (https://arxiv.org/search/cs?searchtype=author&query=Tong,+X), Xuanming Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+X), Tianyi Tang (https://arxiv.org/search/cs?searchtype=author&query=Tang,+T), An Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+A), Jiatu Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+J), Guojie Lin (https://arxiv.org/search/cs?searchtype=author&query=Lin,+G), Zhenzhen Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+Z), Lingfeng Zeng (https://arxiv.org/search/cs?searchtype=author&query=Zeng,+L), Boyu Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+B), Bing Zhao (https://arxiv.org/search/cs?searchtype=author&query=Zhao,+B), Hu Wei (https://arxiv.org/search/cs?searchtype=author&query=Wei,+H), Lin Qu (https://arxiv.org/search/cs?searchtype=author&query=Qu,+L), Dayiheng Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+D)

查看 PDF (https://arxiv.org/pdf/2607.28661)

> 摘要:大语言模型(LLMs)是否具备真正的结构性推理能力,还是仅仅依赖于表面层面的模式匹配?金融领域要求数值精度和长上下文中的多步逻辑推理,是理想的测试平台。现有基准测试未能反映真实世界工业场景的复杂度,它们主要依赖选择题或基于裁剪表格的单跳问答,忽视了错综复杂的跨报表动态关系和时间去累计。为弥补这一差距,我们提出了 FinIndices——一个在未裁剪财务报表(最长 32K tokens)上评估数据处理保真度的大规模基准测试。FinIndices 利用带有对抗性陷阱的自动化合成流水线,涵盖单指数计算和表格指数制表,以测试复杂的领域、时间维度及口径推理。我们的评估揭示了大语言模型的两个严重缺陷。第一是“知识瓶颈”:尽管模型在预训练期间记住了公式,其模式匹配仍然脆弱。移除显式公式提示会导致性能崩溃(例如,Gemini-3.1-Pro 在表格任务上从 70.70% 降至 38.22%),暴露出时间去累计和存量-流量口径错配方面的致命缺陷。第二是“结构瓶颈”:生成多指标、多周期表格所需的高强度认知负荷会不断消耗推理能力。在结构压力下,原本能完美执行独立推导的大语言模型会退化为浅层启发式策略,例如抓取错误的相邻列,或用机械的字面算术替代深层会计调整。最后,监督微调(SFT)在零提示条件下带来了显著提升(单指数任务 +8.54%,表格任务 +3.82%),验证了以数据为中心的对齐方式能够部分恢复结构化逻辑。

## 提交历史

来自:Xinke Tong [查看邮箱](https://arxiv.org/show-email/3e6f09c2/2607.28661) **[v1]** 2026年7月22日(周三)06:53:07 UTC(2,233 KB)

相似文章

金融服务业LLM评估的元基准

arXiv cs.AI

本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。