LLM的财务推理是否可信?基于长周期报表的真实世界测试
摘要
介绍了FinIndices,一个大规模基准测试,用于评估LLM在未裁剪财务报表上的数据处理保真度,揭示了财务推理中的知识瓶颈和结构瓶颈。
arXiv:2607.28661v1 公告类型:新
摘要:大型语言模型(LLM)是否具备真正的结构化推理能力,还是仅仅依赖于表面的模式匹配?金融领域要求数值精度和长上下文中的多步逻辑,是一个理想的试验场。现有基准测试未能捕捉真实世界的工业复杂性,主要依赖基于裁剪表格的多项选择题或单跳问答,而忽略了复杂的跨报表动态和时间去累积(temporal de-cumulation)。
为弥补这一空白,我们提出了FinIndices,一个大规模基准测试,评估在未裁剪财务报表(最长32K token)上的数据处理保真度。利用带有对抗性陷阱的自动化合成流水线,FinIndices涵盖单指数计算和表指数制表,以测试复杂的领域、时间和口径推理。
我们的评估揭示了LLM的两个严重漏洞。第一是“知识瓶颈”:尽管模型在预训练中记住了公式,但表现出脆弱的模式匹配。移除显式公式提示会导致性能崩溃(例如,Gemini-3.1-Pro在表格任务上从70.70%下降到38.22%),暴露出时间去累积和存量-流量口径不匹配方面的致命缺陷。第二是“结构瓶颈”:生成多指标、多周期表格所带来的高强度认知负荷会大量消耗推理能力。在结构压力下,能够完美执行孤立推导的LLM会退化为浅层启发式方法,例如获取错误的相邻列,或用懒惰的字面算术替代深层的会计调整。最后,监督微调(SFT)带来了可观的零提示增益(Single +8.54%,Table +3.82%),验证了结构化逻辑可以通过以数据为中心的对齐得到部分恢复。
查看缓存全文
缓存时间: 2026/08/03 07:32
# 大语言模型的金融推理可信吗?对长时域陈述的真实世界测试 来源:https://arxiv.org/abs/2607.28661 作者:Xinke Tong (https://arxiv.org/search/cs?searchtype=author&query=Tong,+X), Xuanming Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+X), Tianyi Tang (https://arxiv.org/search/cs?searchtype=author&query=Tang,+T), An Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+A), Jiatu Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+J), Guojie Lin (https://arxiv.org/search/cs?searchtype=author&query=Lin,+G), Zhenzhen Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+Z), Lingfeng Zeng (https://arxiv.org/search/cs?searchtype=author&query=Zeng,+L), Boyu Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+B), Bing Zhao (https://arxiv.org/search/cs?searchtype=author&query=Zhao,+B), Hu Wei (https://arxiv.org/search/cs?searchtype=author&query=Wei,+H), Lin Qu (https://arxiv.org/search/cs?searchtype=author&query=Qu,+L), Dayiheng Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+D) 查看 PDF (https://arxiv.org/pdf/2607.28661) > 摘要:大语言模型(LLMs)是否具备真正的结构性推理能力,还是仅仅依赖于表面层面的模式匹配?金融领域要求数值精度和长上下文中的多步逻辑推理,是理想的测试平台。现有基准测试未能反映真实世界工业场景的复杂度,它们主要依赖选择题或基于裁剪表格的单跳问答,忽视了错综复杂的跨报表动态关系和时间去累计。为弥补这一差距,我们提出了 FinIndices——一个在未裁剪财务报表(最长 32K tokens)上评估数据处理保真度的大规模基准测试。FinIndices 利用带有对抗性陷阱的自动化合成流水线,涵盖单指数计算和表格指数制表,以测试复杂的领域、时间维度及口径推理。我们的评估揭示了大语言模型的两个严重缺陷。第一是“知识瓶颈”:尽管模型在预训练期间记住了公式,其模式匹配仍然脆弱。移除显式公式提示会导致性能崩溃(例如,Gemini-3.1-Pro 在表格任务上从 70.70% 降至 38.22%),暴露出时间去累计和存量-流量口径错配方面的致命缺陷。第二是“结构瓶颈”:生成多指标、多周期表格所需的高强度认知负荷会不断消耗推理能力。在结构压力下,原本能完美执行独立推导的大语言模型会退化为浅层启发式策略,例如抓取错误的相邻列,或用机械的字面算术替代深层会计调整。最后,监督微调(SFT)在零提示条件下带来了显著提升(单指数任务 +8.54%,表格任务 +3.82%),验证了以数据为中心的对齐方式能够部分恢复结构化逻辑。 ## 提交历史 来自:Xinke Tong [查看邮箱](https://arxiv.org/show-email/3e6f09c2/2607.28661) **[v1]** 2026年7月22日(周三)06:53:07 UTC(2,233 KB)
相似文章
大语言模型在最长简单链式推理任务上的表现如何:关于等价类问题的实证研究
本实证研究通过评估大语言模型在等价类问题上的表现,以考察其长链推理能力。研究发现,非推理模型在此类任务上表现失败,而推理模型虽表现更好,但仍难以完全解决特定结构性难题。
基准测试不等于验证:金融大语言模型应用的系统级视角
本文认为,金融大语言模型应用需要超越基准测试分数的系统级验证,涵盖数据、模型设计、检索、智能体行为、治理和实施。文章主张持续的验证纪律,并提出了面向系统感知评估的研究议程。
金融服务业LLM评估的元基准
本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。
LinAlg-Bench:揭示大语言模型数学推理中结构性失败模式的诊断性基准
介绍了LinAlg-Bench,这是一个诊断性基准,用于评估10个前沿大语言模型在矩阵维度上的结构化线性代数计算,揭示了大语言模型的数学失败在结构上受到约束,并在4x4规模下从执行错误过渡到计算放弃。
提示中的分析师:LLM金融分析中的角色、检索与记忆偏差
本文研究了用户上下文在大型语言模型中如何影响金融分析,发现解释偏差比检索偏差更为显著,并评估了缓解策略。