金融服务业LLM评估的元基准

arXiv cs.AI 论文

摘要

本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。

arXiv:2607.01740v1 Announce Type: new 摘要:公开的LLM排行榜优化的是全局平均性能,未能捕捉金融服务业工作的特定认知需求:在MMLU-Pro上领先的模型可能在基于文档的合规推理上表现不佳,而编程领先者可能难以处理多轮客户交互。我们提出了一种元基准测试框架,将452个公开报道的基准测试整理为41个O*NET通用工作活动,并将这些活动汇总到38个BIAN银行业务领域,涵盖销售、运营、风险和支持工作。一个乘性加权方案(区分度×覆盖率×新颖度),在滚动模型窗口上计算,奖励那些仍能区分最佳模型、被广泛报道且仍在活跃使用的基准测试,同时自动抑制饱和的遗留测试。这些权重用于缩放配对Elo锦标赛中的K因子,从而产生跨基准可比较的工作活动分数,无需原始分数归一化;业务领域分数是组成工作活动Elo的加权平均值。我们在一个截至2026年6月的时点公开快照上演示了该框架,该快照涵盖来自25个组织的288个模型,并描述了方法论、完整分类、设计决策和局限性,旨在使该方法对面临类似选择和治理挑战的机构可复现。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:45

# 1 引言 来源:https://arxiv.org/html/2607.01740 公共大语言模型排行榜呈现的是综合评分,这些评分融合了从本科常识到竞技编程等各类任务的性能。对于一个为特定运营目的选择和治理模型的组织而言,这些综合评分是不够的:在MMLU-Pro上领先的模型可能在基于文档的合规推理中表现不佳;一个编程领先的模型可能在多轮客户交互任务中得分很低。为受监管行业选择和治理AI模型需要更精确的工具。我们描述了一个在金融服务研究背景下开发的元基准测试框架,用以弥补这一差距。该框架不引入任何新的基准测试。相反,它将452个现有公开报道的基准测试按照O\*NET通用工作活动分类法(National Center for O\*NET Development 2024)中的41个工作活动进行聚合,并进一步将这些工作活动聚合到根据BIAN服务景观14.0.0(Banking Industry Architecture Network 2024)划分的38个银行业务领域中。一个动态加权方案会奖励那些在技术前沿被积极竞争的基准测试,并抑制那些已经饱和或近期模型很少尝试的基准测试。参见图注:图1:评估金字塔。从下往上读,288+个模型在452个公共基准测试上得分,这些基准测试映射到41个O*NET通用工作活动,聚合成38个BIAN业务领域,并归入五个BIAN业务领域。

贡献有四个方面。第一,我们阐述了一个基于原则的分类法,将基准测试映射到标准化的工作活动和银行业务领域,该方法根植于既定的外部标准(O\*NET和BIAN)。第二,我们描述了一种加权和归一化方法,能够处理异构且快速演变的公共基准测试领域,无需手动进行评分策展。第三,我们描述了由此产生的能力概况在初步模型比较、风险知情筛选和治理研究中的实际应用。第四,我们提供了足够的方法论细节,使得该分类法和聚合方法对于面临类似模型选择和治理挑战的机构具有可复现性。*本文的分析仅使用公开报道的基准测试数据。所描述的排名、能力评估和所有应用均基于此公开证据基础,不一定代表澳大利亚联邦银行已部署的AI系统、运营流程、采购决策或供应商关系。任何考虑用于运营的模型都需要单独的隐私、安全、法律、风险、合规和治理审查。*

### 1.1 为什么不使用内部基准测试进行评估?

另一种方法是使用来自内部数据和运营流程的、组织特定的基准测试。这在概念上很有吸引力:原则上,特定领域的评估应该比通用测试更相关。然而在实践中,若干挑战使得这种方法在当前模型发布速度下难以维持。

**速度和覆盖范围。**模型发布的速率从2024年起急剧加速(第3节 (https://arxiv.org/html/2607.01740#S3))。针对每个新版本在所有相关能力领域运行内部基准测试,可能会对受监管机构的评估能力造成持续压力。

**执行成本。**在数百个模型-能力组合上运行即使是一套适中的基准测试,也需要大量的API支出或专用的GPU分配,这是一项经常性成本,必须根据相对于公共基准测试的边际信息增益来证明其合理性。

**每个模型的网络安全和风险管理开销。**内部基准测试要求模型首先通过供应商和网络安全入职、安全评估、供应商尽职调查、数据处理协议和访问控制。在评估之前为每个候选模型完成这一流程是一个顺序问题,随着候选池的扩大而难以维持,而且许多模型只能通过与该机构没有现有商业关系的供应商来访问。

**基准测试策展和区分度。**构建能够真正区分前沿模型(而不是被记忆或轻易解决)的示例,需要领域专业知识和迭代优化;一个设计不佳的基准测试可能对模型进行相同的排名,不提供任何可操作的信号。

**维护开销。**金融服务任务的分布会随着新产品、监管变化和组织重组而发生变化。内部基准测试需要定期重新策展才能保持有效,这是一项在初期经常被低估的持续成本。

本文描述的框架通过以下方式应对这些挑战:从大量且不断更新的公共基准测试库中进行聚合,应用一个自动跟踪哪些基准测试在当前前沿具有区分能力的加权方案,并将它们映射到一个根植于金融服务工作结构的分类法。这减少了在初步筛选阶段使用敏感内部数据的需要,同时并未取代内部评估或治理。

### 1.2 方法论概述

该流程包含四个阶段:基准测试收集和归一化(第3节 (https://arxiv.org/html/2607.01740#S3)),复合权重计算(第4节 (https://arxiv.org/html/2607.01740#S4)),配对Elo评分(第5节 (https://arxiv.org/html/2607.01740#S5)),以及能力聚合(第6节 (https://arxiv.org/html/2607.01740#S6))。参见图注:图2:四阶段流程:收集并归一化基准测试,根据区分度、覆盖范围和时效性分配复合权重,通过成对比较得出每个工作活动的Elo评分,并聚合成BIAN业务领域概况。

配对Elo将每个基准测试视为一系列模型之间的两两对比:对于共享某个基准测试分数的每一对模型,得分较高的模型记为胜场,得分较低的记为负场,每次比较都会根据基准测试的复合权重成比例地更新它们的评分。在一个任务的所有基准测试上运行这些比较,会产生一个单一的评分标尺,该标尺在基准测试之间具有可比性,无论其绝对分数范围或难度如何。具体机制详见第5节 (https://arxiv.org/html/2607.01740#S5)。

## 2 相关工作

### 2.1 通用评估和基准测试聚合

将大语言模型性能聚合成综合评分已从多个角度进行了探索。语言模型整体评估 (HELM) 框架(Liang et al. 2023)在一套精心挑选的场景和指标上评估模型,强调覆盖范围和透明的指标构建;BIG-Bench及其更难版本(Srivastava et al. 2023; Suzgun et al. 2023)聚合了超过200个贡献的任务;Open LLM排行榜(Fourrier et al. 2024)保持持续的社区排名,并定期刷新以应对饱和问题。lm-evaluation-harness(Gao et al. 2024)标准化了执行流程,以便复现已发布的结果。我们的工作是互补性的:我们从公开报告中聚合分数,而不是重新运行评估,关注的是在元层次上哪些基准测试对特定领域具有证据权重。

Chatbot Arena(Chiang et al. 2024)将配对Elo应用于人类偏好判断,提供了一个与基于任务的基准测试正交的对话质量度量。我们使用了类似的成对比较程序,但基于报告的基准测试分数,并归一化到以50为中心的标尺以便于解释(第5节 (https://arxiv.org/html/2607.01740#S5))。

### 2.2 基准测试饱和、污染和动态评估

基准测试聚合中的一个关键挑战是饱和:一旦有足够多的模型在某个基准测试上超过90%的准确率,该基准测试就不再能区分前沿系统(Kiela et al. 2021)。例如,MMLU(Hendrycks et al. 2021)在2023年是占主导地位的通用基准测试,但随着前沿模型持续超过90%的准确率而饱和。MMLU-Pro(Y. Wang et al. 2024)被设计为更难的新版本,包含更多需要推理的问题,并且对提示工程伪影具有更强的抵抗力。GPQA(Rein et al. 2024)针对专家级科学问题,人类最后考试 (HLE)(Phan et al. 2025)则包含在发布时所有测试模型均未能解决的问题。LiveBench(White et al. 2025)是明确针对污染问题设计的:它每月更新,使用来自近期竞技编程、数学和推理挑战的新问题,因此很难被纳入预训练数据。污染风险(即基准测试示例出现在预训练语料中)加剧了饱和问题(Xu et al. 2024; Chen et al. 2025)。我们的加权方案通过在一个滚动时间窗口内衡量顶尖得分者之间的区分度来解决这两个问题,随着基准测试的前沿区分能力下降,自动将其抑制(无论是饱和还是污染),无需手动管理基准测试生命周期。

### 2.3 任务分类法和能力本体

将NLP任务分组为更高级别的类别有着悠久的历史。早期的任务套件基准测试,如GLUE(A. Wang, Singh, et al. 2019)和SuperGLUE(A. Wang, Pruksachatkun, et al. 2019),确立了自然语言理解分组评估的实践,随后随着模型能力的增长被更大的聚合基准测试所取代。与这些供应侧的分组不同,我们从需求侧定义评估分类法,基于两个既定的外部标准:O\*NET通用工作活动目录(涵盖了各职业中常见的认知工作)和BIAN服务景观(银行业务领域),而不是基于可用的基准测试集合。

### 2.4 金融和企业大语言模型评估

通用排行榜无法可靠预测特定领域任务的性能。Wu等人(2023)表明,一个金融适应模型在金融NLP任务上优于更大的通用模型,确立了领域特定性对于评估和训练的重要性。FinBen(Q. Xie et al. 2024)评估了24个维度下的42项金融任务,FinanceBench(Islam et al. 2023)报告称,即使是带有检索的最新模型,在对真实公司申报文件的问题中也有很大比例回答错误或拒绝回答,这一发现直接推动了特定领域的评估。HELM金融(Stanford CRFM 2024)将HELM适应于金融任务,包括FinQA、FinanceBench和BANKING77。总的来说,这些工作确立了特定领域评估的重要性,以及通用排行榜对于受监管行业的部署决策是不够的。

### 2.5 代理和工作流评估

金融服务的用例越来越多地涉及代理工作流:与工具、结构化数据源和外部系统的多轮交互。τ-bench(Yao et al. 2025)评估了在现实领域中与工具和模拟用户交互并遵循特定领域规则的代理,报告称即使是强大的模型在客户服务场景中也难以可靠地完成任务。SWE-bench Verified(OpenAI 2024)是软件工程任务的人工验证子集,提供了与软件工程工作活动直接相关的可靠编码代理评估。伯克利函数调用排行榜(Patil et al. 2023)评估了在真实世界API上的函数和工具调用可靠性,并定期更新,使其成为我们“工具使用”任务中的关键区分项。OSWorld(T. Xie et al. 2024)提供了在真实桌面环境中对多模态计算机使用代理的基于执行的评估,与“视觉与图形用户界面”维度中的自主运营任务直接相关。这些代理基准测试通过评估可靠执行(而非孤立问题的准确性)来补充基于知识的测试。

## 3 基准测试收集

### 3.1 数据来源

基准测试分数来自LLM Stats API(“LLM Stats: Aggregated LLM Benchmark Results” 2024) (https://llm-stats.com/),该API聚合了来自供应商技术报告、第三方评估组织和社区维护排行榜的公开报道评估结果。分数被聚合到单个版本化的快照中:每条记录对应一个模型,包含其原始基准测试分数、基准测试元数据(标签、日期范围、分数分布)以及后续章节中描述的基准测试到活动、活动到领域的映射。上游原始分数未经修改;工作活动和业务领域分数是根据后续方法从这些原始分数推导出来的。

**数据快照。**本文中的所有分数均来自2026年6月执行的一次数据获取。该快照固定在此日期;后续模型版本或追溯添加的基准测试分数未反映在内,如果针对更晚的快照重新生成,结果可能会有所不同。

### 3.2 模型覆盖范围

截至2026年6月,数据集涵盖来自25个组织的288个模型,时间跨度从2022年1月到2026年6月。涵盖的组织包括Anthropic、Google DeepMind、OpenAI、Meta AI、Mistral、xAI、阿里巴巴(Qwen)、Cohere等。模型范围从低于7B参数的开放权重指令模型到专有前沿系统。数据集同时包含开放权重模型(根据Apache 2.0、MIT、Llama社区许可证及类似许可证发布)和专有API访问模型。

### 3.3 模型发布

按季度发布的模型数量,按开放权重和专有类型细分,如图3 (https://arxiv.org/html/2607.01740#S3.F3)所示。在索引的模型群体中,从2024年起发布速度明显加快。参见图注:图3:每季度模型发布数量(2022–2026),按开放权重(绿色)和专有(琥珀色)划分。从2024年第二季度起发布速度明显加快。

### 3.4 基准测试目录

当前目录包含452个独特的基准测试标识符,映射到41个工作活动(第6.6节 (https://arxiv.org/html/2607.01740#S6.SS6))。该映射是多对多的:一个基准测试可能出现在多个工作活动中(例如,MMLU映射到“分析数据或信息”、“判断对象、服务或人的质量”以及“更新和使用相关知识”),每个工作活动包含多个基准测试。基准测试-工作活动分配的总数为1,750。在当前滚动窗口中,得分模型少于三个的基准测试权重为零,并且在该时期不贡献工作活动分数;它们保留在目录中以供历史时期使用。该管道不会插补缺失分数;一个模型如果没有某个基准测试的分数,则不会参与该基准测试的评分。每个工作活动的基准测试标识符数量如图4 (https://arxiv.org/html/2607.01740#S3.F4)所示;完整列表见附录A (https://arxiv.org/html/2607.01740#A1)。参见图注:图4:分配给每个工作活动的基准测试标识符数量。诸如“处理信息”和“决策与解决问题”等信息处理活动覆盖最为广泛;身体活动和管理活动没有公共基准测试覆盖。

## 4 任务分组和基准测试复合权重

### 4.1 基准测试到任务的映射

每个基准测试通过一个结构化配置文件被分配到一个或多个任务维度。该映射独立于流程进行管理。

相似文章

MerchantBench:评测LLM智能体在电子商务运营中的长期连贯性

arXiv cs.AI

MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。

元认知监测电池:LLM自我监测的跨域基准

arXiv cs.CL

一个包含524个项目的新型跨域基准(元认知监测电池)使用人类心理测量方法评估LLM在六个认知领域的自我监测能力。应用于20个前沿LLM后,揭示了三种不同的元认知配置,并表明准确率排名与元认知敏感性排名基本相反。