FinReportBench:衡量与改进机构级财务报告生成
摘要
FinReportBench 是一个基于专家经验的基准测试,用于衡量和改进机构级财务报告生成,包含 35 项可观察标准,涵盖可交付性、报告身份和机构完整性。它精选了 244 个双语任务,评估了九个模型家族,并使用基准引导的技能蒸馏来改进五个模型家族的生成和自我审查能力。
arXiv:2608.04374v1 公告类型:新
摘要:大型语言模型能够生成流畅的财务分析,但流畅性本身并不能确定报告是否适合机构交付。我们引入了 FinReportBench,这是一个基于专家经验的基准测试,用于衡量和改进机构级财务报告生成。专家审查揭示了在报告身份、机构组件、来源纪律和视觉交付方面反复出现的差距。我们通过专家偏序、多模态证据和决策边界审计,推导出一份包含 35 项 rubric 的评估标准,涵盖可交付性、报告身份和机构完整性。从 10,000 条平衡的中英文财务研究源记录出发,我们围绕三种研究对象和两种输入层级精选了 244 个双语任务。每个任务都分离了公开查询、重建的研究轨迹和隐藏的源数据包。三个独立的评审家族以接近天花板的比例复现了专家偏序,表明有界、可观察的标准能够支持可靠的评估。在九个模型家族中,基本可交付性几乎饱和,而报告身份和机构完整性仍是主要瓶颈。最大的跨模型差距涉及生成轨迹控制、信息密度和数据纪律,而非基本报告框架。随后,我们使用基准引导的技能蒸馏,将反复出现的失败转化为可复用的生成和自我审查约束。在五个模型家族中,改进后的技能相比配对的无线索运行,平均 G1 提高了 33.85 分,平均 G2 提高了 13.83 分,同时每个配对都保持了 G0。代码和基准测试工件可在 https://github.com/MisterBrookT/finreportbench 获取。
查看缓存全文
缓存时间: 2026/08/06 07:47
# 衡量与改进机构级财务报告生成 Source: https://arxiv.org/html/2608.04374 ###### 摘要 大型语言模型能够生成流畅的财务分析,但流畅性本身并不能证明报告是否适合机构级交付。现有评估使用较为宽泛的维度,无法识别导致专业拒绝的具体缺陷。我们引入FinReportBench,一个基于专家经验的基准,用于衡量和改进机构级财务报告生成。在一项试点评审中,三位专家对来自三个模型的全部75份报告给出了最低的"就绪度"评分,尽管这些报告普遍具备流畅的财务行文;反复出现的差距涉及报告身份、机构化组件、来源纪律和视觉呈现。试点访谈进一步识别出报告标准的层级结构。随后,我们通过两轮迭代推导出评分细则:专家对少量输出集合的偏序关系用于引导基于多模态证据的条目归纳,并由专家审核最终的判定边界。最终评估工具包含35个可观察条目,涵盖可交付性、报告身份和机构完整性三个层面。我们从10,000条平衡的中英文财务研究源记录出发,构建了244个双语任务,覆盖三种研究对象和两种输入层级。每个任务将公开查询、重建的研究轨迹和隐藏来源包分离。三个独立的评判者家族以接近上限的比例复现了专家偏序,表明该评分细则中限定的、可观察的标准能够支持可靠的评估。在九个模型家族中,基础可交付性几乎饱和,而报告身份和机构完整性仍是主要瓶颈。最大的跨模型差距出现在生成轨迹控制、信息密度和数据纪律方面,而非基础报告框架。最后,我们使用基准引导的技能蒸馏,将这些反复出现的失败转换为可复用的生成与自我审查约束。在五个模型家族中,演化后的技能使平均G1提升33.85分,平均G2提升13.83分(与无技能的配对条件相比),同时每个配对都保持了G0不变。代码和基准工件可在https://github.com/MisterBrookT/finreportbench获取。 ## 引言 金融机构通过专业报告传递研究成果。这些报告融合了分析观点、数据、图表、来源归属、机构身份和稳定的文档结构(Jin et al. 2026 (https://arxiv.org/html/2608.04374#bib.bib84);Lifan et al. 2026 (https://arxiv.org/html/2608.04374#bib.bib85))。它们作为可问责的研究工件被评审、分发和归档。我们将达到这种交付标准的报告称为*机构级财务报告*。 语言模型能够生成流畅的财务分析,但其输出往往无法说服专业读者。在与三位财务专家的初步访谈中,三位专家将所有75份评审的模型生成工件都评为1分,即五级量表上的最低值。他们发现,输出中可能包含合理或局部准确的陈述,但仍远未达到可接受的研究交付物标准。最大的缺陷集中在专业报告规范和视觉呈现上,包括封面框架、机构身份、页码系统、合规组件和来源呈现。这些不足要求一种能够识别生成财务报告中具体问题的系统性评估。 近期已有工作开始对财务报告生成进行基准测试,但其评估标准仍然宽泛且粗粒度。FinSight评估事实准确性、信息有效性和呈现质量,而Cogito评估数据质量、分析质量和呈现质量(Jin et al. 2026 (https://arxiv.org/html/2608.04374#bib.bib84);Lifan et al. 2026 (https://arxiv.org/html/2608.04374#bib.bib85))。这些维度支持整体系统比较,但无法识别阻碍机构使用的具体问题。例如,一份具有精美图表的网页式报告即使缺少发布机构、分析师身份和稳定的页码系统,仍可能获得较高的呈现得分。 为填补这一空白,我们提出FinReportBench,这是首个旨在衡量生成财务报告是否符合机构交付标准的基准。构建这样的基准需要应对三个挑战。首先,将专家知识转化为可靠的评分细则十分困难。专业人员依赖实践中习得的惯例,相对于穷尽式评分规则,他们通常能更可靠地表达相对偏好。因此,访谈和偏好标签必须被转化为可观察的标准、清晰的边界和可被其他标注者复现的规则。此外,整报告评审成本高昂,限制了可用于构建评分细则的专家标注数量。其次,已发布的报告仅展示最终工件。原始客户请求和产生报告的研究步骤通常不可得,因此无法直接收集现实的基准输入。第三,宽泛的分数可以对系统进行排名,但无法告诉开发者应该修复什么。可操作的评估需要具体的失败证据,这些证据能够在不暴露测试答案或基准内容的情况下指导改进。 参见图注图1:FinReportBench的元数据概览。(a) 共享的多语言嵌入空间的二维投影将244个选定任务置于10,000任务参考池的密度中;颜色表示研究对象,标记形状是语言诊断。覆盖度在原始嵌入空间中计算,该套件在余弦相似度≥0.60时覆盖95.65%的参考任务。(b1) 模型输入显著长于仅查询的财务报告基准;(b2) 组件画像展示了244条脚本化研究轨迹的构成。(c1) 每个任务包含多个检索到的来源和结构化证据事实。(c2) 跨诊断领域分类法的计数展示了选定研究主题的广度。我们做出五项贡献: - •专家根基的缺口诊断。我们提供了基于专家经验的诊断,解释为何流畅的模型输出仍不适合作为机构报告。三位资深财务专业人士的评审识别出这一差距,并揭示了专业要求的层级结构(§ 2)。 - •财务报告生成数据集。我们引入一个244任务双语数据集,从平衡的10,000任务参考空间构建,覆盖三种研究对象、两种输入层级,以及95.65%的多语言语义空间。每个任务都包含带有分离的公开查询、检索证据和隐藏来源包的工具使用研究轨迹(§ 3)。 - •层级化评估框架。我们提出一个从专家评审和偏好引导的评分细则归纳中推导出的层级化框架。它通过35个可观察标准和基于证据的多模态评判协议来评估机构就绪度(§ 4)。 - •基准引导的技能演化。我们提出一种将跨模型的重复性条目级失败转换为紧凑、可复用的生产技能的方法。该方法在外部任务上开发和选择技能修订,然后进行锁定的跨模型迁移测试(§ 5)。 - •评估与发现。在已完成的评估中,我们通过FinReportBench上的条目级分析刻画了九个模型家族。每个模型使用相同的任务集,可见的输出缺陷仍是已测结果的一部分。我们还测试了演化技能是否在五个模型家族间迁移(§ 6)。 ## 相关工作与试点访谈 ### 相关工作 金融NLP基准主要评估基于表格、文件和对话的问答与多模态推理(Chen et al. 2021 (https://arxiv.org/html/2608.04374#bib.bib1), 2022 (https://arxiv.org/html/2608.04374#bib.bib2);Zhu et al. 2021 (https://arxiv.org/html/2608.04374#bib.bib3);Zhao et al. 2022 (https://arxiv.org/html/2608.04374#bib.bib4);Islam et al. 2023 (https://arxiv.org/html/2608.04374#bib.bib5);Reddy et al. 2024 (https://arxiv.org/html/2608.04374#bib.bib6);Liu and others 2025 (https://arxiv.org/html/2608.04374#bib.bib7);Xie and others 2024 (https://arxiv.org/html/2608.04374#bib.bib8);Xie et al. 2023 (https://arxiv.org/html/2608.04374#bib.bib9);Wu et al. 2023 (https://arxiv.org/html/2608.04374#bib.bib10)),而智能体基准和训练方法侧重于网页交互、检索和多步骤信息寻求(Mialon et al. 2024 (https://arxiv.org/html/2608.04374#bib.bib14);Zhou et al. 2024 (https://arxiv.org/html/2608.04374#bib.bib16);Wu and others 2025 (https://arxiv.org/html/2608.04374#bib.bib21);Nakano et al. 2021 (https://arxiv.org/html/2608.04374#bib.bib13);Jin and others 2025 (https://arxiv.org/html/2608.04374#bib.bib20);Wei and others 2025 (https://arxiv.org/html/2608.04374#bib.bib15);Deng et al. 2023 (https://arxiv.org/html/2608.04374#bib.bib17);Gou and others 2025 (https://arxiv.org/html/2608.04374#bib.bib18);Baek et al. 2024 (https://arxiv.org/html/2608.04374#bib.bib19);Li et al. 2026 (https://arxiv.org/html/2608.04374#bib.bib31);Bian et al. 2025 (https://arxiv.org/html/2608.04374#bib.bib33))。近期的财务报告系统增加了宽泛的事实、分析和呈现维度(Jin et al. 2026 (https://arxiv.org/html/2608.04374#bib.bib84);Lifan et al. 2026 (https://arxiv.org/html/2608.04374#bib.bib85);Weng et al. 2025 (https://arxiv.org/html/2608.04374#bib.bib22);Tang et al. 2026b (https://arxiv.org/html/2608.04374#bib.bib23);Xie et al. 2024 (https://arxiv.org/html/2608.04374#bib.bib28), 2026 (https://arxiv.org/html/2608.04374#bib.bib30);Tan and others 2024a (https://arxiv.org/html/2608.04374#bib.bib34);Wu and others 2024 (https://arxiv.org/html/2608.04374#bib.bib35);Kim and others 2024 (https://arxiv.org/html/2608.04374#bib.bib37);Asai and others 2024 (https://arxiv.org/html/2608.04374#bib.bib39)),但这些分数并不能识别导致专业拒绝的具体缺陷。FinReportBench则通过细粒度的可观察条目评估完整渲染的报告,并按照专家推导出的层级进行组织。 近期工作也从资源或执行失败中提取可复用的智能体技能,并在保留任务上选择修订(Li and others 2026 (https://arxiv.org/html/2608.04374#bib.bib86);Huang and others 2026 (https://arxiv.org/html/2608.04374#bib.bib87);Alzubi and others 2026 (https://arxiv.org/html/2608.04374#bib.bib88);Shen and others 2026 (https://arxiv.org/html/2608.04374#bib.bib89);Zhang and others 2026 (https://arxiv.org/html/2608.04374#bib.bib90))。我们将这一思想应用于机构报告:重复出现的条目级失败被转换为紧凑的生产规则,外部验证则防止负迁移。 ### 试点专家访谈 我们与三位资深财务专业人士进行了多轮试点访谈,每位都有超过十年的经验。他们评审了三个模型针对25个查询生成的75份匿名报告,并在五级量表上对完整报告就绪度进行评分。所有75份报告都获得了最低的1分。访谈产生了三项设计发现。首先,流畅的输出仍然缺乏专业结构、机构身份、来源纪律、风险披露和一致的视觉呈现(Qu and others 2025 (https://arxiv.org/html/2608.04374#bib.bib63);Wen et al. 2026 (https://arxiv.org/html/2608.04374#bib.bib25);Tang et al. 2026c (https://arxiv.org/html/2608.04374#bib.bib27))。其次,评审是层级化的:专家先检查可交付性,然后是报告身份,再是详细的机构组件。第三,研究先于写作;分析师期望模型从有组织的证据状态继续,而不是直接从简短查询生成。 这些发现分别推动了细粒度条目评估、G0–G1–G2层级,以及FinReportBench使用的重建研究轨迹。访谈问题、评审说明和其他协议细节见补充材料。 ## FinReportBench数据集 ### 数据集设计目标 FinReportBench追求四个特性:真实性,从真实分析师或机构来源推导任务;多样性,涵盖语言、研究对象、领域和查询具体性;效率,选择一个紧凑的套件以保留更大池的语义覆盖度;以及真实的生成流水线,其中报告写作从富含证据的研究轨迹继续,而非仅从查询开始。 ### 构建流水线 图2 (https://arxiv.org/html/2608.04374#Sx3.F2)总结了五个阶段:来源收集、任务合成、查询验证、覆盖度导向的策展和轨迹构建。 参见图注图2:FinReportBench数据集构建流水线。我们合成并验证基于来源的任务,策展基准以获得广泛覆盖,并为每个选定任务构建研究轨迹。#### 基于来源的任务合成。 我们构建了一个平衡的多语言参考池,包含5,000份来自东方财富的中文分析师报告和5,000份来自世界银行的英文机构出版物。由于原始客户请求很少可用,反向合成从每个来源的研究对象、背景和分析角度中恢复出一个合理的请求。基于LLM的审计会拒绝不自然的请求、分类法错误,以及发布者、来源或答案泄漏。每个被接受的任务都将公开查询卡与隐藏来源映射和构建元数据分离;来源工件永远不会提供给报告模型。 #### 覆盖度导向的策展。 我们将所有来源推导出的研究任务嵌入到一个多语言语义空间中,并在平衡语言、研究对象、领域和查询具体性的同时选择一个紧凑的套件。语言是一个诊断切片,而不是一个单独的基准。由此产生的244个任务包含122个中文和122个英文请求;其中61个是公司任务,92个是行业任务,91个是宏观任务。87个是开放式T0请求,157个是论点引导的T1请求。在余弦相似度0.60下,选定集覆盖了10,000任务参考空间的95.65%,包括中文参考的99.46%和英文参考的91.84%。 #### 研究轨迹构建。 对于每个选定的任务,我们重建一个脚本化的深度研究轨迹,包含公开请求、搜索决策、检索证据和最终文本研究笔记。最终用户消息要求生成一份自包含的HTML报告。该轨迹不会重放隐藏来源,并从研究笔记中排除基准标识符、内部证据标签和URL列表。所有244条轨迹都通过角色顺序、来源、最终笔记和泄漏检查。 补充材料提供了来源池构成、语义指纹字段、嵌入与选择细节、查询审计标准、完整的轨迹契约,以及额外的数据集统计。 ## 评估设计 ### 评估设计目标 我们的评估器追求三个特性。低成本专家根基使用稀疏的查询内偏好而非穷尽式条目标注。细粒度诊断返回可观察的条目决策和支持证据,而非仅有总体分数。层级有效性遵循试点研究中发现的专业评审顺序,防止后续阶段的优势完全补偿早期阶段的失败。 ### 评估构建流水线 图3 (https://arxiv.org/html/2608.04374#Sx4.F3)总结了原
相似文章
FinResearchBench II:一项采用共识派生黄金评分准则以区分财务报告质量的深度研究基准
介绍了FinResearchBench II,这是一个用于评估深度研究智能体财务报告质量的基准,它采用可扩展的流程,通过LLM共识自动生成并筛选评分准则,从而在没有人类专家的情况下实现系统差异化。
FinProBench:基于专业交付物衍生角色锚定评分标准评估金融AI智能体
介绍了FinProBench,一个基于真实专业交付物衍生角色锚定评分标准来评估金融AI智能体的基准,并提出了RGRC流水线,该流水线改善了对角色专业化任务的评估。
面向基础模型综合评估的细粒度基准生成
一种新的自动化基准生成框架能够实现基础模型的细粒度、全面评估,具有更低的错误率和更丰富的元数据,在机器学习、公司金融和个人金融基准上得到了验证。
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件
本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。
FilmBench:一个电影级视频生成基准
FilmBench是一个面向电影级视频生成的新基准,其提示源自跨越20种类型的获奖影片,并采用包含35+子指标的三级电影级分类体系。它包含一个开源自动化评估代理(FilmOps),该代理以高相关性复现人工模型排名,揭示了动态美学和多镜头表现方面的显著差距,相较于以往的网页风格基准。