提升分部披露的完整性与可比性:一种大语言模型方法
摘要
本文提出一种基于大语言模型的框架,从10-K文件中提取分部披露信息,通过检索增强系统提升纵向与跨公司分析的完整性和可比性。
arXiv:2605.23924v1 Announce Type: new
摘要:分部层面披露是财务报告的核心组成部分,可揭示企业的内部组织架构以及经济活动在各运营单元之间的分配情况。然而,分部信息常以定性和定量两种形式呈现,分散于10-K文件的表格和叙述章节中。依赖结构化数据库的实证研究面临完整性和可比性两大挑战:部分公司-年度观测值可能缺失、嵌套分部披露未被捕获,且对纵向与跨公司可比性的支持有限。本研究开发了一种基于大语言模型的框架,直接从10-K文件中提取分部披露信息,并同时保留可报告分部与嵌套分部信息。我们进一步设计了一个检索增强系统,整合多份文件中的信息以支持可比性。我们通过两个代表性场景展示其应用:公司内部分部随时间变化的纵向分析,以及不同报告结构公司间地理分部的跨公司对齐。结果表明,该工具能准确提取分部层面信息,并有效回答需要跨期间知识的提问,彰显了基于大语言模型的方法在提升分部披露的测量与解读方面的潜力。
查看缓存全文
缓存时间: 2026/05/26 08:58
# 提高分部披露的完整性与可比性:一种大语言模型方法 来源:https://arxiv.org/html/2605.23924 Yue Liu Rutgers Business School Rutgers University \- Newark Newark, NJ, USA yl1641@scarletmail\.rutgers\.edu Longying Lai Simon Business School University of Rochester Rochester, NY, USA longyinglai703@gmail\.com (2026年4月16日) ###### 摘要 分部层面的披露是财务报告的核心组成部分,能够洞察公司的内部组织以及经济活动在各运营单位之间的分配情况。然而,分部信息通常以定性和定量两种形式呈现,分散在10-K表格的表格和叙述性章节中。依赖结构化数据库的实证研究面临完整性和可比性两方面的挑战,因为某些公司-年度观测值可能缺失,嵌套的分部披露未被捕获,且对纵向和跨公司可比性的支持有限。本研究开发了一种基于大语言模型的框架,直接从10-K表格中提取分部披露,并同时保留可报告分部及嵌套分部信息。我们进一步设计了一个检索增强系统,整合多个申报文件中的信息以支持可比性。我们通过两个代表性场景来展示其应用:公司内部的纵向分析,以解释分部随时间的变化;以及跨公司的地理分部对齐,针对不同报告结构的企业。结果表明,该工具能准确提取分部层面信息,并能有效回答需要跨期知识的问题,展现了基于LLM的方法在增强分部披露测量与解释方面的潜力。 数据可用性:数据集可从文中引用的公共来源获取。 JEL分类:C80;M41 关键词:分部披露,大语言模型,设计科学 财务冲突:作者声明无财务利益冲突。 ## 1 引言 分部披露是公司财务报告的重要组成部分,能让投资者及其他利益相关者深入了解公司运营、绩效和风险在不同业务活动中的差异。通过分解合并财务信息,分部披露允许使用者更好地理解公司价值的来源,并通过内部组织的视角评估管理决策。因此,分部层面信息长期以来一直是会计监管和实证研究的重点。 美国公认会计原则(U.S. GAAP)下的分部披露要求已从基于规则的分类转向以管理层为导向的报告框架。早期指引由SFAS No. 14(美国财务会计准则委员会,1976 (https://arxiv.org/html/2605.23924#bib.bib14))确立,要求公司使用外部定义的标准报告行业和地理分部¹¹¹外部标准指公司外部定义的标准化分类方案,例如基于标准工业分类(SIC)或类似外部强制指引的行业分类。根据SFAS No. 14,分部识别由这些预定义类别指导,而非公司内部组织结构,结果导致披露更统一但与管理相关性较低。。然而,有证据表明SFAS 14允许过度汇总,且披露决策有用性有限(Street等人,2000 (https://arxiv.org/html/2605.23924#bib.bib33)),促使美国财务会计准则委员会(FASB)将其替换为SFAS No. 131(美国财务会计准则委员会,1997 (https://arxiv.org/html/2605.23924#bib.bib15))。SFAS 131引入了管理法,要求公司基于内部组织结构和首席运营决策者定期审查的信息披露运营分部。此方法旨在通过使外部报告与内部绩效评估和资源分配决策保持一致,增强分部信息的相关性。SFAS 131随后被编入ASC Topic 280(美国财务会计准则委员会,2023a (https://arxiv.org/html/2605.23924#bib.bib16), b (https://arxiv.org/html/2605.23924#bib.bib17)),继续指导美国的分部报告。根据ASC 280,公司必须披露分部收入、利润或亏损指标、资产、与合并总额的调节信息,以及适用的选定地理和主要客户信息。虽然管理法提高了信息相关性,但也赋予管理者在界定分部边界、汇总层级和描述性标签方面相当大的自由裁量权,导致分部披露中的异质性和可比性挑战(Berger和Hann,2003 (https://arxiv.org/html/2605.23924#bib.bib2); Hinson等人,2019a (https://arxiv.org/html/2605.23924#bib.bib18), b (https://arxiv.org/html/2605.23924#bib.bib19))。 这些特征给大样本研究带来了挑战。首先,尽管分部披露包含表格展示,但重要信息往往分布在10-K表格中的表格和叙述性脚注中,如图1 (https://arxiv.org/html/2605.23924#S6.F1)所示。这种分散性使得大规模系统性地提取和整合分部信息变得困难。其次,管理法下引入的管理自由裁量权导致分部定义、汇总和标签方式的变化,跨公司以及同一公司随时间产生不一致。这种不一致使分部结构的识别和比较变得复杂。因此,常用的结构化数据库可能包含缺失观测值、遗漏相关细节,或引入不一致性,从而掩盖分部披露的基础经济内容。 大语言模型(LLMs)的最新进展为应对这些挑战提供了新机遇。LLMs在处理长篇幅、非结构化的文本文件以及从异构来源提取结构化信息方面表现出强大能力(Zhang等人,2025 (https://arxiv.org/html/2605.23924#bib.bib37))。与基于规则的方法或传统自然语言处理方法不同,LLMs能够捕捉句子间的上下文关系,链接文档不同部分呈现的信息,并解读措辞和呈现方式的差异。这些能力特别适合处理分部披露,因为需要整合叙述性解释和脚注表格中的信息,并适应公司和年份间披露方式的显著差异。此外,最新证据表明,LLMs不仅能理解文本,还能支持定量财务任务,包括多步推理和策略生成(Kang等人,2026 (https://arxiv.org/html/2605.23924#bib.bib23))。这一能力在我们的场景中尤其重要,因为比较不同报告结构公司的分部披露,往往需要协调定义并对财务量进行基本的汇总和转换。 本文开发了一个基于大语言模型的框架,直接从公司的10-K表格中提取和解读分部披露。该方法旨在解决分部层面研究的两个基本挑战:不完整性和不可比性。为解决不完整性问题,我们构建了一个基于文件的提取程序,从原始申报中恢复可报告分部和嵌套披露,保留了结构化数据库中常常丢失的分部报告层次结构。通过直接处理源文档,该框架能捕获分散在叙述性解释和表格展示中的信息,提供公司分部披露更完整的表示。 为改善公司分部层面披露的可比性,我们扩展了框架,加入了一个检索增强组件,能够整合多个申报文件中的信息。这种设计使分部披露能够在上下文中而非孤立地被解读。我们考虑了两个代表性场景。首先,在公司内部的纵向分析中,该方法能够识别分部变化,总结这些变化背后的经济原因,并将当前分部结构与前几年联系起来。其次,在跨公司分析中,我们通过比较同一行业内两家使用不同汇总层级的公司其亚洲收入,来审视地理分部披露。该方法不依赖预定义规则或Compustat Historical Segment等数据库中的结构化标识符,而是利用披露中的上下文信息来协调命名、汇总和报告结构上的差异。这些组件共同提供了一个统一框架,用于构建既更完整又更具可比性的分部数据,从而促进在档案会计研究中更可靠地使用分部信息。 本文其余部分结构如下。第2节回顾相关文献。第3节识别分部披露中的测量挑战,这些挑战推动了工具的设计。第4节描述基于LLM的提取与检索系统的开发和实施。第5节评估该工具的性能并呈现验证结果。第6节总结并讨论局限性及未来研究方向。 ## 2 文献综述 ### 2.1 分部披露中的管理自由裁量权 管理法下的分部报告赋予管理者在定义、组织和标注运营分部方面相当大的自由裁量权。SFAS No. 131(后来编入ASC Topic 280)要求公司基于首席运营决策者(CODM)审查的内部报告来报告分部信息,而非强加外部定义的行业分类。此设计旨在通过使外部分部披露与内部资源分配和绩效评估流程保持一致,增强信息相关性。 然而,先前研究表明,管理法也引入了显著的自由裁量权。Berger和Hann (2003 (https://arxiv.org/html/2605.23924#bib.bib2)) 指出,从SFAS No. 14向SFAS No. 131的过渡增加了分部分解程度,并改变了披露的信息含量,这与管理激励影响分部定义和报告方式一致。Bens等人 (2011 (https://arxiv.org/html/2605.23924#bib.bib1)) 提供的证据表明,管理者在汇总运营分部时行使自由裁量权,尤其是在分部分解可能揭示专有信息或降低报告灵活性时。类似地,Wang (2015 (https://arxiv.org/html/2605.23924#bib.bib34)) 记录了管理者在跨分部分配公司层面费用和收入时行使自由裁量权,从而影响报告的分部盈利能力。 除测量选择外,研究还强调了由于自由裁量的分部定义而产生的跨公司异质性和可比性挑战。Nichols等人 (2013 (https://arxiv.org/html/2605.23924#bib.bib29)) 回顾了关于管理法的文献,得出结论认为,尽管分部披露可能更好地反映内部运营,但同时也降低了跨公司的标准化程度。由于运营分部是内部定义的,并可能随组织重组而演变,即使基础经济活动相似,公司在汇总层级、命名惯例和分部绩效指标上也存在显著差异。 这种自由裁量权的一个重要含义是,分部披露并非静态的报告构建体。公司可能会重新命名分部、修改描述性标签或重新汇总业务单元,而不一定经历基础运营的实质性变化。这种灵活性使纵向分析复杂化,并在研究人员仅凭报告的分部标识符来解读分部的增加、删除或重组时引入不确定性。分部报告内在的自由裁量权产生了测量挑战,促使对原始披露文档进行更仔细的审查。 ### 2.2 测量挑战与结构化数据库的局限性 由于分部披露通常出现在10-K表格的叙述性脚注和定制化表格格式中²²²CFA Institute (2018 (https://arxiv.org/html/2605.23924#bib.bib5)) 的财务报告使用者指出,美国公认会计原则并未规定分部披露的统一呈现格式,分部信息通常嵌入叙述性脚注而非标准化表格中。报告强调,这种灵活性导致公司在呈现分部结果及相关调节信息时出现差异。来源于:https://rpc.cfainstitute.org/research/surveys/segment-disclosures-survey-report?³³³Deloitte (2025 (https://arxiv.org/html/2605.23924#bib.bib11)) 观察到,包括ASU 2023-07增强在内的分部披露,受各申报人内部报告实践影响,导致跨公司呈现格式的定制化。来源于:https://dart.deloitte.com/USDART/home/publications/deloitte/financial-reporting-spotlight/2025/disclosure-trends-2024-reporting-season.,实证研究通常依赖结构化的商业数据库(最著名的是Compustat)来获取分部层面信息。尽管这些数据库促进了大量研究,但先前的会计文献警告,由于数据处理惯例、分类规则、汇总程序和报告异质性,来自二手数据源的变量可能与基础披露存在偏差。 Hribar和Collins (2002 (https://arxiv.org/html/2605.23924#bib.bib20)) 证明,常用的会计指标可能受到机械性数据构建选择的影响,当研究人员仅依赖数据库字段时会导致测量误差。类似地,Loughran和McDonald (2014 (https://arxiv.org/html/2605.23924#bib.bib28)) 表明,标准化的文本处理方法可能无法捕捉嵌入在叙述性申报中的特定上下文披露特征。这些更广泛的担忧在分部报告中尤为突出,因为披露本质上具有公司特异性,并受ASC Topic 280下管理自由裁量权的影响。 因此,分部层面数据库面临独特的测量挑战。首先,覆盖可能不完整。对于早期阶段(尤其是SEC的XBRL强制要求之前),分部披露并非机器可读,需要手动提取或第三方标准化。即使在后期,结构化数据集也可能遗漏公司-年度观测值或嵌入在分部脚注中的嵌套披露。其次,分部标识符和描述性标签常常跨公司和跨时期变化。由于结构化数据库通常依赖机械性的字符串匹配或内部分配的标识符,轻微的命名差异、汇总变化或格式变体可能会打乱纵向记录,并在公司内部分析中引入噪声。 综上所述,这些局限性表明结构化数据库提供的是分部披露的加工后表示,而非原始申报的直接反映。当披露具有自由裁量性时,
相似文章
利用大语言模型增强基本面分析:基于RAG的投资者简报生成系统
本文探讨了使用大语言模型与RAG系统,通过处理财务报告和宏观经济数据来自动化公司基本面分析,生成由个人投资者评估的投资者简报。
通过检索增强大型语言模型提升金融情感分析
本文介绍了一种检索增强的大型语言模型框架用于金融情感分析,相比传统模型及ChatGPT、LLaMA等大型语言模型,在准确率和F1分数上实现了15%至48%的提升。
大型语言模型响应的全面评估:多因素评分系统
本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。
大语言模型的序贯统计推断:表征、有效性与监控
本文主张采用序贯推断框架来增强LLM的可信度,通过将交互建模为依赖随机过程,确保在重复使用下的有效性,并实现行为变化的在线监控。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。