FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件

arXiv cs.CL 论文

摘要

本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。

arXiv:2605.15482v1 公告类型:新发布 摘要:大语言模型(LLMs)正越来越多地应用于金融分析、报告、投资决策支持、风险管理、合规及专业培训。然而,对其在金融领域专业能力的稳健评估仍不完善。广泛使用的开放基准如FinQA、ConvFinQA和TAT-QA在推动金融问答与数值推理方面发挥了重要作用,但它们主要关注金融报告上的问答,并未提供明确的专业难度层次。更广泛的资源,包括FinanceBench、PIXIU、FinBen和FLaME,扩展了金融任务的覆盖范围,但如何评估从基础知识到专家级金融推理的过渡问题仍未解决。在这项工作中,我们提出了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估。FINESSE-Bench结合了受专业认证(类似CFA一级至三级、类似CMT二级、类似CFTe一级)启发的考试型数据集、应用交易任务集合以及一个俄语奥林匹克基准。这种设计能够评估域广度、难度增加时的性能下降、解决计算任务的能力,以及模型在专业金融领域的表现。我们还描述了一个统一的评估协议,涵盖选择题、数值答案和简短开放式回答,并基于LLM-as-judge范式为自由形式答案提供了自动评分方案。FINESSE-Bench旨在作为现有开放金融基准的补充,也是对大语言模型中专业相关金融能力进行更实质性评估的工具。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:31

# FINESSE-Bench:一个用于大型语言模型金融领域知识和技术分析的分层基准测试套件
来源:https://arxiv.org/html/2605.15482
Nini Kamkia Lime FinTechAlexey Khoroshilov Lime FinTechDmitry Zmitrovich Lime FinTechDenis Kokosinskii Lime FinTechZhirayr Hayrapetyan Lime FinTechAndrei Kalmykov Lime FinTech

###### 摘要

大型语言模型(LLMs)正越来越多地被应用于金融分析、报告、投资决策支持、风险管理、合规以及专业培训。然而,对其金融领域能力的稳健评估仍不完善。广泛使用的开放基准测试(如FinQA、ConvFinQA和TAT-QA)在推动金融问答和数值推理方面发挥了重要作用,但它们主要侧重于金融报告上的问答,并未提供明确的专业难度层次[14 (https://arxiv.org/html/2605.15482#bib.bib1),13 (https://arxiv.org/html/2605.15482#bib.bib2),2 (https://arxiv.org/html/2605.15482#bib.bib3)]。更广泛的资源(包括FinanceBench、PIXIU、FinBen和FLaME)扩展了金融任务的覆盖范围,但评估从基础知识到专家级金融推理的过渡问题仍然有待解决[8 (https://arxiv.org/html/2605.15482#bib.bib4),9 (https://arxiv.org/html/2605.15482#bib.bib5),10 (https://arxiv.org/html/2605.15482#bib.bib6),3 (https://arxiv.org/html/2605.15482#bib.bib7)]。

在这项工作中,我们提出了 FINESSE-Bench,这是一个包含八个专门基准测试的套件,共计3,993个问题,用于对LLMs的金融能力进行分层评估。FINESSE-Bench 结合了受专业认证(类似 CFA 一级至三级、类似 CMT 二级和类似 CFTe 一级)启发的考试导向数据集、应用型交易任务集合以及一个俄语奥林匹克竞赛基准测试。该设计能够评估领域广度、随难度增加的性能下降、解决计算任务的能力以及模型在专门金融领域中的行为。

我们还描述了一个统一的评估协议,涵盖多项选择题、数值答案和简短开放式回答,并基于 LLM 作为评判者的范式[5 (https://arxiv.org/html/2605.15482#bib.bib8),11 (https://arxiv.org/html/2605.15482#bib.bib9)],为自由形式答案提供了自动评分方案。FINESSE-Bench 既旨在作为现有开放金融基准测试的补充,也旨在作为对大型语言模型中专业相关金融能力进行更实质性评估的工具。

## 1 引言

大型语言模型(LLMs)在文本理解、推理和结构化生成方面取得了显著进展,这推动了它们在金融行业的应用,包括金融分析、报告、投资研究、风险管理、合规和专业培训。然而,在高风险场景中的部署需要对模型的领域能力进行可靠评估,涵盖财务报告、公司金融、投资组合管理、衍生品和技术分析等领域。

在过去几年中,业界引入了重要的开放基准测试来评估金融领域的模型。FinQA、ConvFinQA 和 TAT-QA 为金融文档及混合表格-文本数据上的金融问答和数值推理奠定了基础[14 (https://arxiv.org/html/2605.15482#bib.bib1),13 (https://arxiv.org/html/2605.15482#bib.bib2),2 (https://arxiv.org/html/2605.15482#bib.bib3)]。近期的研究进一步拓宽了任务覆盖范围:FinanceBench 引入了针对上市公司文档金融问答的大型开放基准测试[8 (https://arxiv.org/html/2605.15482#bib.bib4)];PIXIU、FinBen 和 FLaME 则将该方向扩展到语言模型和金融 NLP 任务的更广泛评估[9 (https://arxiv.org/html/2605.15482#bib.bib5),10 (https://arxiv.org/html/2605.15482#bib.bib6),3 (https://arxiv.org/html/2605.15482#bib.bib7)]。

尽管这些资源很有价值,但仍存在至少两个局限。首先,现有基准测试中很大一部分集中在金融报告的问答、信息提取或金融 NLP 上,而一些实际重要的领域——如技术分析、衍生品交易和基于场景的投资组合管理——仍然代表性不足。其次,大多数开放金融基准测试缺乏明确的难度层次,无法衡量模型行为从基础金融知识向需要多步分析和综合的专家级任务转变时的变化。

金融数值推理方面的最新文献为更具挑战性和诊断性的基准测试提供了额外动力。特别是,FinanceReasoning 强调金融基准测试不仅应根据流行度来评估,还应考虑保真度、难度和金融概念覆盖的完整性[15 (https://arxiv.org/html/2605.15482#bib.bib10)]。与此同时,像 Fin-R1 这样的专用模型的发展表明,在标准公共数据集上取得强劲结果并不一定能全面描述模型在更广泛专业金融任务中的行为[12 (https://arxiv.org/html/2605.15482#bib.bib11)]。

在这项工作中,我们提出了 FINESSE-Bench,一个用于评估 LLMs 金融能力的分层基准测试套件。FINESSE-Bench 包含八个数据集,共 3,993 个问题,并融合了两个关键原则。第一个是**难度层次**:套件的一部分受专业认证结构启发,能够衡量从基础到高级再到专家级能力的过渡。第二个是**领域专业化**:除了经典金融学科,该套件还涵盖了技术分析、应用型衍生品交易以及俄语奥林匹克竞赛风格的问题。

除了数据集构建,我们还描述了一个统一的评估协议,适用于异构任务类型:多项选择题、数值答案、简短自由形式答案以及案例关联问题。对于精确匹配不足的任务,我们采用基于 LLM 作为评判者的方案,该方案植根于开放式回答自动评估的现代方法[5 (https://arxiv.org/html/2605.15482#bib.bib8),11 (https://arxiv.org/html/2605.15482#bib.bib9)]。完整结果、扩展表格及基准测试套件的补充材料已在项目仓库中发布:https://github.com/LimexAILab/FINESSE-Bench。

#### 贡献。

我们的工作做出了以下贡献:

1.  我们引入了 FINESSE-Bench,一个包含八个专门金融基准测试、共计 3,993 个问题的套件。
2.  我们提出了一种**分层评估设计**,能够衡量模型性能从基础到高级再到专家级金融难度的退化情况。
3.  我们通过纳入技术分析、衍生品交易和一个俄语奥林匹克竞赛模块,**拓宽了领域覆盖范围**,超越了标准的金融报告问答。
4.  我们描述了一个针对异构金融任务的**统一评估协议**,结合了固定提示模板、适用的确定性推理设置以及基于评判模型的开放式答案评分。
5.  我们以**非商业研究用途**发布数据集,并讨论了与数据来源、潜在的污染和许可相关的局限性。

## 2 相关工作

### 2.1 LLM 的金融基准测试

近年来,针对语言模型的金融基准测试开发加速。最早的重要方向之一是创建金融问答和数值推理数据集。FinQA 引入了一个经过专家标注的金融报告问答数据集,并附带可执行的推理程序[14 (https://arxiv.org/html/2605.15482#bib.bib1)]。ConvFinQA 将该设置扩展到对话式金融问答,需要更长的数值推理链[13 (https://arxiv.org/html/2605.15482#bib.bib2)]。TAT-QA 提出了一种混合格式,结合了金融问答任务中的表格和文本来源[2 (https://arxiv.org/html/2605.15482#bib.bib3)]。

后续工作引入了更广泛的资源。FinanceBench 提出了一个针对上市公司文档金融问答的大型开放基准测试[8 (https://arxiv.org/html/2605.15482#bib.bib4)]。PIXIU 提出了一个金融生态系统,包括指令数据、一个模型以及一个涵盖多种类型金融任务的基准测试组件[9 (https://arxiv.org/html/2605.15482#bib.bib5)]。FinBen 通过聚合数十个跨多个金融领域的数据集和任务类型,扩展了全面评估的方向[10 (https://arxiv.org/html/2605.15482#bib.bib6)]。FLaME 通过提供一个更广泛的评估金融语言模型的平台,延续了这一方向[3 (https://arxiv.org/html/2605.15482#bib.bib7)]。

这些努力极大地推动了该领域的发展,但并未完全解决专业金融能力的**分层评估**问题。特别是,现有资源往往缺乏三个特性的同时结合:明确的难度分层、立足于专业上可识别的专长水平,以及更广泛的应用金融领域覆盖。

### 2.2 自由形式答案评估与 LLM 作为评判者范式

随着基准测试任务从精确答案匹配转向更开放的响应格式,自动评估变得更加困难。Zheng 等人表明,强语言模型可以作为评判者,用于可扩展的开放式响应评估,并系统化了这种方法的局限性,包括偏差和提示敏感性[5 (https://arxiv.org/html/2605.15482#bib.bib8)]。后续工作,包括 Arena-Hard 和 BenchBuilder,证明了基于 LLM 的评估不仅对模型排名有用,而且对构建更具区分度的基准测试也有用[11 (https://arxiv.org/html/2605.15482#bib.bib9)]。

在我们的工作中,模型作为评判者的评估被用作一种实用且可复现的机制,用于统一评估异构的开放式金融任务。同时,我们并不将自动评判者评分视为专家标注的完全替代,而是将其视为大规模基准测试评估中的可扩展折衷方案。

### 2.3 金融基准测试的难度、保真度和稳健性

最近的工作如 FinanceReasoning 强调,金融基准测试不仅应根据规模来分析,还应考虑保真度、覆盖完整性和真实任务难度[15 (https://arxiv.org/html/2605.15482#bib.bib10)]。特别是,作者修订并更新了现有金融数值推理基准测试的部分内容,强调了基准测试设计质量作为一个独立研究课题的重要性。

同时,包括 Fin-R1 在内的专用模型的发展表明,在标准公共金融基准测试数据集上取得强劲结果是有用的,但未必能反映在更广泛金融场景中的稳健专业能力[12 (https://arxiv.org/html/2605.15482#bib.bib11)]。这进一步促使需要构建基准测试,不仅要评估狭窄格式下的准确性,还要评估领域覆盖的广度、技能迁移以及跨难度级别性能的变化。

### 2.4 专业导向和领域专用的基准测试

使用考试风格和专业导向的任务是评估应用领域领域能力的自然方式。在金融领域,这种方法特别合适,因为相当大一部分专业知识已经以认证和应用工作场景的形式结构化。

FINESSE-Bench 正是遵循这一逻辑:我们构建了一套互补的基准测试,其中一些反映了从基础准备到专家级任务的进步,而另一些则针对现有开放资源中代表性不足的实践导向领域。

## 3 FINESSE-Bench:设计原则

在设计 FINESSE-Bench 时,我们从 LLM 的金融能力不是一个单一维度的量这一前提开始。同一个模型可能自信地回答基础财务报告问题,但在投资组合构建、技术分析或衍生品交易任务上表现明显较差。因此,一个金融基准测试套件不仅应评估平均准确性,还应评估跨任务类型和难度级别的**模型错误结构**。

#### 现实性。

我们旨在提出反映真实金融实践和专业培训所需技能的问题:财务报表解读、公司估值、风险管理、投资决策、技术指标的使用以及期权策略计算。

#### 难度层次。

FINESSE-Bench 的一个核心原则是明确的难度分层。受多级专业认证启发,我们包含了对应于基础、中级和专家级的任务集。这使得可以衡量模型如何将基础知识迁移到更复杂的基于场景和多步骤的任务中。

#### 领域广度。

在金融领域,现有的开放基准测试资源在金融报告问答和金融 NLP 任务方面尤其强大[14 (https://arxiv.org/html/2605.15482#bib.bib1),13 (https://arxiv.org/html/2605.15482#bib.bib2),2 (https://arxiv.org/html/2605.15482#bib.bib3),8 (https://arxiv.org/html/2605.15482#bib.bib4),10 (https://arxiv.org/html/2605.15482#bib.bib6)]。我们通过纳入技术分析、衍生品交易和俄语奥林匹克竞赛问题的数据集来补充这一方向,以拓宽可诊断的能力范围。

#### 格式多样性。

FINESSE-Bench 包括多项选择题、数值答案、简短自由形式响应和基于关联案例的问题。这种多样性使得更难以针对单一评估格式进行狭隘优化,同时也使基准测试更接近真实的教育和专业场景。

#### 多语言性。

尽管大多数开放金融基准测试是英文的,但 LLM 在金融中的实际应用通常是多语言的。为此,FINESSE-Bench 包含了俄语模块 VLigaBench-ru,从而能够在英文之外评估模型行为。

#### 可验证性。

所有问题都配有可验证的答案,某些任务还附带了简短的理由说明或计算模板。这有助于自动评分和错误分析,并使基准测试套件更适合可复现的比较。

## 4 数据集描述

FINESSE-Bench 包含八个专门的数据集,共计 3,993 个问题。下面,我们简要描述每个数据集的目的及其在基准测试套件整体层次结构中的角色。

### 4.1 类似 CFA 一级

类似 CFA 一级111https://www.cfainstitute.org/programs/cfa-program 针对基础金融学科:伦理、量化方法、经济学、财务报告、公司金融和投资基础。该基准测试包括 1,069 个问题,主要采用多项选择格式。其目的是衡量基本的金融素养和应用能力。

### 2 类似 CFA 二级

类似 CFA 二级222https://www.cfainstitute.org/programs/cfa-program 侧重于更复杂的应用场景。它包含 293 个问题,组织成关联的项目集,其中几个相互关联的问题依赖于一个共同案例。多步计算、高级财务报

相似文章

面向基础模型综合评估的细粒度基准生成

arXiv cs.LG

一种新的自动化基准生成框架能够实现基础模型的细粒度、全面评估,具有更低的错误率和更丰富的元数据,在机器学习、公司金融和个人金融基准上得到了验证。

金融服务业LLM评估的元基准

arXiv cs.AI

本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。

JFinTEB:日本金融文本嵌入基准

arXiv cs.CL

JFinTEB引入了首个全面的基准,专门用于评估日本金融文本嵌入,填补了特定领域和语言特定评估资源的空白。该基准包括在日本特定、多语言和商业嵌入模型中评估的检索和分类任务,数据集和评估框架已公开发布。