基于Forma的完整财务报表长期预测
摘要
本文介绍了ProForma-20Q,一个用于预测未来1至20个季度78个财务报表行项目的基准,以及Forma,一个基于Transformer的模型,它超越了通用方法,尤其是在长期预测中,并具有接近会计恒等式的一致性。
arXiv:2608.11327v1 公告类型:新
摘要:在预测财务报表时,专项训练优于通用规模。据我们所知,此前没有任何工作能够联合预测超过一年的完整财务报表,然而在贴现现金流估值中,大部分企业价值都位于该窗口之后。我们发布了ProForma-20Q,这是一个可复现的基准,用于根据过去的报表和行业代码,对匿名企业未来1至20个季度的78个报表行项目进行预测,并以变化空间$R^2$作为评分。在该基准上,Forma——一个将报表视为(账户、季度、数值)元组集合的Transformer,并最大化掩码元组高斯似然——击败了我们部署的所有竞争对手:经典机器学习、链式梯度提升、零样本时间序列基础模型以及前沿大语言模型。其优势随预测期限的延长而扩大,而估值恰恰在最需要准确性的地方,并且其高斯预测区间从未出现覆盖不足。Forma的预测几乎满足会计恒等式;精确的一致性可以在没有统计学显著精度损失的情况下恢复。其元组接口支持无需重新训练的情景分析,并且我们表明,固定未来收入路径能够使报表其余部分更加精确。
查看缓存全文
缓存时间: 2026/08/13 15:34
# 完整财务报表的长时序预测(Forma) 来源:https://arxiv.org/html/2608.11327 陈一浩,劳伦·法尔维,唐纳德·奥科费 2026年8月11日 ###### 摘要 在财务报表预测中,专科模型胜过通用大模型。据我们所知,此前没有工作联合预测超过一年的完整财务报表,然而在现金流折现估值中,大部分企业价值恰好落在这个窗口之后。我们发布了 ProForma-20Q,这是一个可复现的基准,用于从过去的报表和行业代码出发,预测匿名企业78个报表项目未来1至20个季度的情况,并以变化空间R^2^评分。在该基准上,Forma——一个将报表读作(科目,季度,数值)元组集合、并最大化掩码元组高斯似然的Transformer——击败了我们测试的所有竞争对手:经典机器学习、链式梯度提升、零样本时间序列基础模型,以及前沿大型语言模型。它的优势随预测期限拉长而扩大,而估值恰恰在最需要准确性的地方依赖长期限预测;其高斯预测区间也从未出现覆盖率不足的问题。Forma的预测几乎满足会计恒等式;精确一致性可以在无统计显著精度损失的前提下恢复。其元组接口支持无需重训练的情景分析,我们表明,钉住未来收入路径可以使报表其余部分的预测更加精确。††脚注:所有作者均就职于德克萨斯大学奥斯汀分校,美国德克萨斯州奥斯汀市。†这些作者对这项研究贡献相同。我们感谢Quent Capital、朗斯顿家族财富管理中心和AIM投资中心提供的财务支持。联系方式:[email protected]、[email protected]、[email protected]、[email protected]、[email protected]、[email protected]。 ## 1. 引言 一份完整的*备考*(pro forma)财务报表预测是估值、信用风险分析和财务规划的原材料。然而,学术文献通常只提供单一项目(通常是盈利)的一年期点预测。相比之下,在现金流折现(DCF)估值中,大部分企业价值来自一年之后的现金流(而非盈利)。其中最大的组成部分是终值:预测终点(通常为5至10年)的企业价值,以同行或永续倍数乘以末期预测值设定[39 (https://arxiv.org/html/2608.11327#bib.bib39)]。然而,一个末期数字的可信度取决于其背后的报表:利润率、再投资和融资必须相互协调,这正是从业者构建完整备考报表的原因。因此,与经济相关的目标是对整个报表在价值所在的时间期限上进行联合预测。据我们所知,此前没有研究提供此类预测。 我们引入 ProForma-20Q,一个针对该任务的基准。它要求模型利用相同项目的12个季度滞后值以及一个行业代码,预测78个报表项目在1至20个季度后的值。我们发布了完整协议,在拥有WRDS访问权限的情况下,可通过一条命令复现(§3 (https://arxiv.org/html/2608.11327#S3))。由于估值依赖于跨期限的条件均值聚合,并且我们不想为传播持续水平而庆贺,模型以样本外R^2^对变化进行预测的得分排名。 财务报表数据对标准的监督学习模板构成了阻力。我们样本中的平均公司季度仅报告78个报表项目中的64个,单个项目在公司季度中最低仅有32%的报告率,*少于2%的公司季度报告了完整项目集*。该数据还结合了刚性结构(跨科目和跨季度的精确会计恒等式)与软结构(潜在经济状态,如竞争壁垒和财务约束)。 我们设计并评估了Forma,一种针对此场景定制的基于Transformer的架构。报表历史被编码为(科目,季度,数值)元组的*集合*,缺失项目不产生token,未来项目为掩码元组。Forma为每个掩码输出高斯预测均值和方差,并训练以最大化掩码后数值的似然。在ProForma-20Q上,一个约0.9M参数的Forma击败了所有竞争对手(表2 (https://arxiv.org/html/2608.11327#S5.T2)):使用插补缺失值的经典机器学习(ML)方法,如惩罚回归、随机森林(RF)[4 (https://arxiv.org/html/2608.11327#bib.bib4),10 (https://arxiv.org/html/2608.11327#bib.bib10)]和前馈神经网络(FFNN)[1 (https://arxiv.org/html/2608.11327#bib.bib1)];一个在其套件内重新实现的最接近的概念竞争对手,即Geertsema等人2026年提出的链式梯度提升机(GBM)[15 (https://arxiv.org/html/2608.11327#bib.bib15)];以及两个通用模型,包括一个零样本时间序列基础模型(TSFM)和一个尽力而为的三个前沿大型语言模型(LLM)组合。Forma在h\>2之后的每个期限都优于所有模型,而且其优势随预测期限增长而扩大,到h=20时至少达到3.2个百分点(pp)的R^2^(图1 (https://arxiv.org/html/2608.11327#S5.F1))。LLM的表现总体较差:最好的前沿模型也逊于除最简单专用模型之外的所有模型,其相对Forma的R^2^差距从h=1时的5.5pp扩大到h=20时的15.9pp。 我们的贡献是: - **任务与协议**:我们定义并发布ProForma-20Q,一个用于完整财务报表预测的交钥匙协议,在公共样本上以变化空间评分。 - **架构与问题的契合**:我们围绕数据和任务设计了一个元组集合Transformer——Forma。未报告的项目不产生token(不做任何插补);恒等式感知掩码迫使模型学习经济学而非会计代数;钉住未来掩码训练模型在选定实现上做条件预测,用于情景分析。 - **概率性报表预测**:通过异方差输出头和五种子混合,我们生成报表上的预测密度。这些密度支持在统计显著精度损失不显著的情况下进行精确事后调和,且在任何期限下高斯中心区间都不会覆盖率不足。 - **专科模型获胜且优势扩大的结果**:我们记录了Forma优于所有竞争对手(包括LLM),且其优势随期限拉长而扩大。 ## 2. 相关工作 表1:针对企业层面财务报表预测的学术研究。所调查的所有系统均未联合预测一年以上的报表,更不用说分布性预测;Forma则二者兼备。 | 研究类型(代表性论文) | 预测结果 | 输出数量 | 期限(年) | 架构 | 跨项目建模 | 分布性输出 | 会计结构 | |---|---|---|---|---|---|---|---| | Panel A. 单项盈利预测 | | 基于会计的盈利回归(Hou et al. 2012 [24](https://arxiv.org/html/2608.11327#bib.bib24),So 2013 [35](https://arxiv.org/html/2608.11327#bib.bib35)) | 年度盈利 | 1 | 1–5^a^ | OLS | — | — | — | | ML盈利模型(Chen et al. 2022 [8](https://arxiv.org/html/2608.11327#bib.bib8),Hess et al. 2026 [23](https://arxiv.org/html/2608.11327#bib.bib23),Campbell et al. 2026 [6](https://arxiv.org/html/2608.11327#bib.bib6)) | 盈利或盈利方向 | 1 | 1–5^a^ | 树、回归、FFNN | — | — | — | | 分位数盈利风险模型(Konstantinidi and Pope 2016 [26](https://arxiv.org/html/2608.11327#bib.bib26)) | 年度盈利分布 | 1 | 1 | 分位数回归 | — | ✓ | — | | Panel B. 多项财务报表预测 | | 多任务神经网络基本面(Alberg and Lipton 2017 [1](https://arxiv.org/html/2608.11327#bib.bib1),Chauhan et al. 2020 [7](https://arxiv.org/html/2608.11327#bib.bib7)) | 选定报表项目 | 16–17 | 1 | FFNN、LSTM | 共享模型[7](https://arxiv.org/html/2608.11327#bib.bib7) | — | — | | 多模型基本面基准(Divo et al. 2025 [12](https://arxiv.org/html/2608.11327#bib.bib12)) | 横跨三张报表的五个选定项目 | 1或5 | 1 | 24种模型^d^ | 各有不同 | 各有不同 | — | | 链式报表(Geertsema et al. 2026 [15](https://arxiv.org/html/2608.11327#bib.bib15)) | 部分利润表和资产负债表 | 29\+19^b^ | 1 | 链式GBM | 顺序链 | — | 衔接子集 | | Panel C. 长期限完整报表预测(本文) | | **Forma** | 标准化利润表、资产负债表和现金流量表 | 78 | 5 | 元组集合Transformer | 共享模型 | ✓ | 可选投影^c^ | 注:输出数量统计每个系统预测的指标数。跨项目建模要求多个输出项目被联合建模或共享参数;仅作为预测因子的报表变量不合格。对勾表示连续分布预测(二元类别概率不合格);破折号表示不存在;“各有不同”表示所引用的基准涵盖具有和不具有该属性的模型。^a^为所引用研究中的范围。^b^直接预测29个;19个由会计关系计算得出。^c^恒等式可以在事后精确施加(§5.3 (https://arxiv.org/html/2608.11327#S5.SS3))。^d^从局部统计基线到深度序列模型,包括通用Transformer(Transformer、TFT)和预训练Chronos。 表1 (https://arxiv.org/html/2608.11327#S2.T1) 及以下各段将我们的工作与现有的企业层面财务预测研究在预测范围、期限、跨项目建模、分布性输出和会计结构等方面进行了对比。单输出模型可以达到多年期限,而多输出系统最多覆盖一年内的选定或简化子集。据我们所知,Forma是第一个在估值期限上生成三张报表模式预测的学习系统,也是第一个为此问题使用元组集合Transformer的系统。^1^ ^1^Divo等人2025年[12](https://arxiv.org/html/2608.11327#bib.bib12)包含了通用序列Transformer(Transformer、TFT、Chronos),它们消费一个稠密的20指标面板来预测五个目标项目;没有一个会对稀疏元组进行注意力处理,而这种表示正是使完整的78项模式可行所需。 我们还讨论了三个相邻文献——LLM预测、长期限时间序列和协调预测——它们提供了竞争模型和评估方法。 ##### 盈利预测。 会计、金融和机器学习文献通常预测*盈利*或其他个别项目。Hou等人2012年[24](https://arxiv.org/html/2608.11327#bib.bib24)系列的横截面模型[35 (https://arxiv.org/html/2608.11327#bib.bib35),28 (https://arxiv.org/html/2608.11327#bib.bib28)]及其机器学习后继模型[8 (https://arxiv.org/html/2608.11327#bib.bib8),23 (https://arxiv.org/html/2608.11327#bib.bib23),25 (https://arxiv.org/html/2608.11327#bib.bib25)]在1至5年的期限内为每个拟合规范预测一个目标(点实现或变化方向)。它们相对于分析师共识的表现对规范十分敏感[6 (https://arxiv.org/html/2608.11327#bib.bib6)]。分位数回归提供了下一年度的分布性盈利预测[26 (https://arxiv.org/html/2608.11327#bib.bib26)]。分析师预测和教科书备考报表是实践基准,而非学习系统[39 (https://arxiv.org/html/2608.11327#bib.bib39),32 (https://arxiv.org/html/2608.11327#bib.bib32)]。 ##### 报表级系统。 Alberg和Lipton 2017年[1 (https://arxiv.org/html/2608.11327#bib.bib1)]用多任务前馈和长短期记忆(LSTM)网络联合预测16个基本面指标一年;Chauhan等人2020年[7 (https://arxiv.org/html/2608.11327#bib.bib7)]将设计扩展到17个目标并带有不确定性估计。Divo等人2025年[12 (https://arxiv.org/html/2608.11327#bib.bib12)]对24种不同模型在四个季度内横跨三张报表的五个项目进行了基准测试。最接近的系统是Geertsema等人2026年[15 (https://arxiv.org/html/2608.11327#bib.bib15)],它通过链接逐项GBM预测29个核心利润表和资产负债表项目一年后,并利用会计关系推导出另外19个。我们在套件内重新实现它,并发现在其自身的项目覆盖范围内它不如Forma。 ##### LLM与财务报表。 大型语言模型已被提出为零样本预测器,可以将数值序列转换为token字符串并直接外推[20 (https://arxiv.org/html/2608.11327#bib.bib20)],尽管语言模型本身是否有助于数值预测仍存争议[36 (https://arxiv.org/html/2608.11327#bib.bib36)]。我们的LLM组合(§5 (https://arxiv.org/html/2608.11327#S5))为推理增强的前沿模型提供了与其他所有模型相同的匿名报表和行业代码,这比Gruver等人2023年[20 (https://arxiv.org/html/2608.11327#bib.bib20)]的token字符串提示或Tan等人2024年[36 (https://arxiv.org/html/2608.11327#bib.bib36)]中消融的微调适配器都更接近*更强的通用条件*。尽管如此,我们仍然表明,一个小的专科模型在样本外R^2^的所有期限上都胜过LLM。 ##### 长期限与基础模型预测。 长期时间序列预测(“LTSF”)文献以步长来计量“长期”,例如Zeng等人2023年[41 (https://arxiv.org/html/2608.11327#bib.bib41)]中的数百个逐小时电力或交通读数。我们则以日历时间计量“长期”——我们的20个季度步长跨越五年,远长于标准LTSF期限——因此难点在于信号衰减和分布漂移,而非序列长度。零样本时间序列基础模型[9 (https://arxiv.org/html/2608.11327#bib.bib9),2 (https://arxiv.org/html/2608.11327#bib.bib2)]提供了我们的第二个通用基线臂(§5.1 (https://arxiv.org/html/2608.11327#S5.SS1))。我们的经典基线承袭了Grinsztajn等人2022年[19 (https://arxiv.org/html/2608.11327#bib.bib19)]关于表格数据中树模型与深度学习之争的先验:树集成在这里同样是最有力的竞争对手。 ##### 协调预测。 预测调和是调整预测以满足分层时间序列中的聚合约束,如Wickramasuriya等人2019年[40 (https://arxiv.org/html/2608.11327#bib.bib40)]的MinT方法,并有端到端和概率性扩展[33 (https://arxiv.org/html/2608.11327#bib.bib33),31 (https://arxiv.org/html/2608.11327#bib.bib31)]。作为带符号的线性关系,会计恒等式落在Girolimetto和Di Fonzo 2024年[16 (https://arxiv.org/html/2608.11327#bib.bib16)]的一般框架之内。我们在§5.3 (https://arxiv.org/html/2608.11327#S5.SS3)中报告无约束违反情况,并应用方差加权调和。 ## 3. ProForma-20Q 任务与协议 ### 3.1. 任务 每个预测示例由企业ff及预测起点季度tt索引;期限hh指绝对季度t+ht+h。设D\\mathcal\{D\}为78个会计项目标识符的集合,cfc\_\{f\}为企业ff的行业类别。企业报告的每个值是一个元组(h,id,x)(h,\\mathrm\{id\},x),其中id∈D\\mathrm\{id\}\\in\\mathcal\{D\}标识会计项目,xx是其经§3.2 (https://arxiv.org/html/2608.11327#S3.SS2)标准化后在季度t+ht+h的值。历史输入是一个集合 Sf,t=\{(h,id,x):h=−11,...,0,id∈D,id在t+h被报告\}。\\displaystyle S\_\{f,t\}=\\left\\\\\{(h,\\mathrm\{id\},x):h=\-11,\\ldots,0,\\;\\mathrm\{id\}\\in\\mathcal\{D\},\\;\\mathrm\{id\}\\ \\text\{在 \}t\{\+\}h\text\{ 被报告\}\\\\right\\\\\}。 对于任何请求的未来期限和会计项目,预测任务是学习 x^=g(Sf,t,cf;h,id),h=1,...,20,id∈D,\\displaystyle\\widehat\{x\}=g\(S\_\{f,t\},c\_\{f\};h,\\mathrm\{id\}\),\\qquad h=1,\\ldots,20,\\quad\\mathrm\{id\}\\in\\mathcal\{D\}, (1) 其中x^\\widehat\{x\}是在给定截至tt的信息条件下,对季度t+ht+h相应标准化值的预测。ProForma-20Q因此固定了12个季度的历史、78个项目和一个20季度的期限。该公式本身也适用于其他项目集、历史和期限。元组集合是该任务的规范编码:它记录每个
相似文章
QuantFlow:一种基于联邦Mamba的后Transformer基础模型,用于时间序列预测
QuantFlow引入了一种基于联邦Mamba的时间序列预测基础模型,该模型结合了逆序嵌入、双向状态空间解码器和分位数回归,在保持数据隐私的同时在基准测试上取得了强劲结果。
从长新闻到精准预测:重要性感知融合与PRM引导的反思在时间序列预测中的应用
本文介绍了一个时间序列预测框架,该框架利用重要性感知的新闻压缩和过程奖励模型引导的检索,在固定上下文长度内融入长新闻文章,从而提高金融、能源、交通和比特币基准上的预测精度。
PMDformer:面向长期预测的补丁均值解耦信息变换器
PMDformer 引入了补丁均值解耦和专用注意力机制,以改进长期时间序列预测中的形状相似性建模,在多个基准测试上优于现有方法。
面向金融应用的多模态事件序列基础模型
本文提出了一种基于预训练Transformer的基础模型,该模型对金融应用中的多模态事件序列进行训练,统一了异构数据源,并通过下一事件预测学习通用表示。该方法优于传统的任务专用模型,并已在东欧一家大型银行部署,带来了可衡量的业务改进。
LLM的财务推理是否可信?基于长周期报表的真实世界测试
介绍了FinIndices,一个大规模基准测试,用于评估LLM在未裁剪财务报表上的数据处理保真度,揭示了财务推理中的知识瓶颈和结构瓶颈。