APEX-Accounting

arXiv cs.CL 论文

摘要

APEX-Accounting 是由 Mercor 和 Ramp 联合创建的基准测试,用于评估前沿人工智能模型在实际会计任务中的表现。表现最佳的模型 Claude-Fable-5 (Max) 达到了 56.4% 的平均标准。

arXiv:2607.27189v1 公告类型:新 摘要:我们介绍 APEX-Accounting,这是一个由 Mercor 与 Ramp 合作构建的基准测试,旨在评估前沿模型能否胜任会计师的实际工作。任务包括对账、计提费用、过账和生成报告。私有评估集包含 160 个任务,分布在 10 个世界中。每个世界包含一套会计系统,以及电子表格、PDF 文件和其他文件。每个任务均由会计和簿记专家编写和解决,他们还撰写了评分标准。在九个前沿模型中,Claude-Fable-5 (Max) 以 56.4% 的 Mean Criteria@3 领先,高于 Muse-Spark-1.1 (xHigh) 的 52.6%。没有任何模型的 Pass^8 得分超过 2.6%(GPT-5.6-Sol (Max+Pro)),最高的 Pass@8 为 21.5%(Muse-Spark-1.1 (xHigh))。我们尝试将令牌预算从 1 美元增加到 50 美元,并观察到辛普森悖论的一个实例:随着令牌预算增加,得分上升,但在给定的预算受限的评测框架内,模型在花费更多令牌的任务上得分反而更低。由于 APEX-Accounting 是一个封闭的基准测试,可根据要求对任何前沿模型运行排行榜评估。
查看原文
查看缓存全文

缓存时间: 2026/07/30 10:00

# 摘要 来源:https://arxiv.org/html/2607.27189 APEX\-Accounting Julien Benchek1∗Austin Bennett1∗Jasmin Kern1∗Ryan Stevens2René Sultan2Charis Ching1Hayley Popiel1Vaibhav Mittal1Felix Mercier1Brendan Foody1Bertie Vidgen1 1Mercor2Ramp ∗同等贡献。如需了解APEX–Accounting的更多信息,请联系[email protected]。 ### 摘要 我们介绍了APEX–Accounting,这是由Mercor与Ramp合作构建的一个基准测试,用于评估前沿模型是否能够胜任会计的实际工作。任务包括对账、费用计提、过账交易和生成报告。私有评估集包含160160个任务,分布在1010个世界(world)中。每个世界包含一个会计系统,以及电子表格、PDF和其他文件。每个任务均由会计和簿记专家撰写并解决,他们还编写了评分细则。在九个前沿模型中,Claude\-Fable\-5 (Max) 以56.4%56.4%的Mean Criteria@3领先,Muse\-Spark\-1.1 (xHigh) 以52.6%52.6%紧随其后。没有任何模型的Pass^8得分超过2.6%2.6%(GPT\-5.6\-Sol (Max\+Pro)),最高的Pass@8得分为21.5%21.5%(Muse\-Spark\-1.1 (xHigh))。我们尝试将token预算从1美元增加到50美元,并观察到了辛普森悖论的一个实例:随着token预算的增加,得分会提高,但在给定的预算受限框架内,模型在花费更多token的任务上得分反而较低。由于APEX–Accounting是一个封闭的基准测试,可以应要求为任何前沿模型运行排行榜评估。 ††footnotetext:致谢。我们感谢所有为创建APEX–Accounting做出贡献的专家。我们还感谢Yash Bharti在创建评估集方面的支持,Arnav Garg的研究协助,以及Mercor研究团队的成员对本文的审阅。 ## 1 引言 全球范围内,会计行业产生的收入约为7007000亿美元 (Hughes,2024 (https://arxiv.org/html/2607.27189#bib.bib7)),仅美国在2024年就雇用了近160万会计师 (National Center for O\*NET Development,2025 (https://arxiv.org/html/2607.27189#bib.bib9))。为每家公司(无论规模或行业)编制正确的年终账目并正确报税都是一项要求。这类知识工作需要技能和注重细节,需要深入理解业务背景,同时也具有重复性、程序性和文档密集性。人工智能模型早已通过了该行业的认证考试:2023年,使用10次提示的GPT\-4在CPA、CMA、CIA和Enrolled Agent考试中的平均得分为85.1%85.1% (Eulerich et al.,2024 (https://arxiv.org/html/2607.27189#bib.bib5))。一项对277277名会计师的斯坦福调查发现,人工智能提高了他们的工作质量,尽管他们也表达了对数据安全和工作稳定性的担忧 (Choi and Xie,2026 (https://arxiv.org/html/2607.27189#bib.bib4))。2026年哈佛商学院的一项分析,在0–1的评分尺度上(衡量生成式AI在多大程度上可以替代特定职业的人力劳动),将会计行业的得分定为0.51 (Chen et al.,2024 (https://arxiv.org/html/2607.27189#bib.bib3) and (Azpúrua,2026 (https://arxiv.org/html/2607.27189#bib.bib2))。 我们介绍了APEX–Accounting,这是由Mercor与Ramp合作构建的一个基准测试。它包含分布在1010个合成生成世界中的160160个任务,涵盖四种任务类型:对账、数据录入、差异分析以及附表与计提。每个世界都是一个独立的公司,在月末结账时被冻结,每个任务均由会计专家编写并解决。模型输出由LLM评判器根据任务特定的评分细则进行评分,这些细则由二元的、基于结果的评判标准组成。我们还开源了一个公开的开发集世界(n=10n=10个任务),包括提示、评分细则和任务文件。111https://huggingface.co/datasets/mercor/apex-accounting 图1:模型在APEX–Accounting排行榜上的表现,采用Mean Criteria@3指标,附95%95%任务自举置信区间。请参阅图注 很少有基准测试评估AI模型在真实会计工作中的表现。AuditBench (Wang et al.,2025 (https://arxiv.org/html/2607.27189#bib.bib12)) 将真实的S&P 500公司财务报表与合成交易配对,以测试不一致性检测。FinMaster (Jiang et al.,2025 (https://arxiv.org/html/2607.27189#bib.bib8)) 涵盖金融流程,使用纯文本、模拟器生成的任务。AccountingBench (Penrose,2025 (https://arxiv.org/html/2607.27189#bib.bib11)) 评估代理在完成一家真实SaaS公司的结账工作方面,与人类CPA的表现对比。OpenAI的GDPval (Patwardhan et al.,2025 (https://arxiv.org/html/2607.27189#bib.bib10)) 在其开源的金子集里,有五个(共n=220n=220个)针对会计师和审计师工作的任务。这些任务都没有测试构成簿记员或初级会计师日常工作的、大规模的日常簿记和月末结账工作。 我们评估了99个前沿模型在APEX–Accounting排行榜上的表现,使用了Loop框架,该框架实现了规范的while\-loop\-with\-tools代理架构 (Goyal,2025 (https://arxiv.org/html/2607.27189#bib.bib6))。在Mean Criteria@3指标上,Claude\-Fable\-5 表现最佳,得分为56.4%56.4%,其次是Muse\-Spark\-1.1,得分为52.6%52.6%。Pass@8的最高得分为21.5%21.5%(Muse\-Spark\-1.1),Pass^8的最高得分为2.6%2.6%(GPT\-5.6\-Sol)。我们引入了一个细粒度的失败分类法,适用于会计工作,并利用它对来自三个表现最佳模型的低分轨迹进行标注。它们的失败模式惊人地相似:推理失败占主导地位(每个模型标注失败的5959%–79%79%)。信息收集和指令遵循(通常可以通过更好的框架来改进)加起来仅占约四分之一。没有标注的失败涉及工具使用。两项消融实验指向同一结论:将每个任务的预算从1美元提高到50美元,仅对token消耗量大使严格预算成为限制因素的模型有帮助;而一个专门构建的会计框架仅使Mean Criteria@3平均提高了+1.2+1.2个百分点。 第̃2节 (https://arxiv.org/html/2607.27189#S2) 描述了会计专家如何设计世界、文件和任务。第̃3节 (https://arxiv.org/html/2607.27189#S3) 概述了我们的评估方法、评判模型和指标。第̃4节 (https://arxiv.org/html/2607.27189#S4) 报告了排行榜、预算消融实验和框架实验。第̃5节 (https://arxiv.org/html/2607.27189#S5) 报告了表现最佳模型的失败模式,以辅助未来的模型和代理开发。 表1:APEX–Accounting任务按类别划分(n=160n=160),附类别定义。文件计数是解决提示所需的文件数量,无论是从共享世界语料库中提取,还是随任务提供。| 类别 | 定义 | 任务数 | 平均评判标准数 | 中位评判标准数 | 平均文件数 | 中位文件数 |
|---|---|---|---|---|---|---|
| 对账 | 将两个数据源关联起来,识别差异,并解释或纠正差异。 | 6161 | 14.614.6 | 1111 | 7.497.49 | 77 |
| 数据录入 | 过账或更新交易、日记账分录、供应商账单和发票。 | 2626 | 16.3516.35 | 1313 | 8.048.04 | 66 |
| 差异分析 | 将实际结果与预算、前期或预期进行比较,并解释驱动因素。 | 2828 | 14.5414.54 | 1111 | 7.867.86 | 77 |
| 附表与计提 | 构建或更新支持性附表,计算应计项目,并将正确的余额带入结账。 | 4545 | 10.2910.29 | 88 | 7.007.00 | 66 |
| 整体 | — | 160160 | 13.6613.66 | 1010 | 7.517.51 | 77 |
## 2 基准设计 APEX–Accounting包含分布在1010个保留后的合成公司世界中的160160个任务,每个世界有1616个任务。公开开发集包含一个世界和1010个任务。 ### 2.1 专家遴选 APEX–Accounting由4242位会计专家创建,职业生涯经验中位数为1111年(平均12.612.6年)。背景主要偏向企业财务和会计经验(4242位专家中的3535位)。52.4%52.4%的专家曾在四大会计师事务所(德勤、毕马威、安永或普华永道)工作过。 ### 2.2 世界构建 每个世界都是一个独立的公司,在特定的月末结账时被冻结。每个世界都基于一个真实的业务场景,拥有自己的实体类型、会计科目表、收入模型和前期的余额。在各个任务中,世界平均引用73.173.1个独特的必需输入文件(参见表6 (https://arxiv.org/html/2607.27189#A3.T6))。这些文件是与Ramp合作确定的,以确保公司概况在收入、员工人数、行业和地理位置方面具有多样化的分布。每家公司都遵循美国通用会计准则(U.S. GAAP)的权责发生制会计。 世界的构建分四个阶段进行。首先,我们进行了跨世界范围界定,为每个世界分配一个高级别的概况,并在整个集合中保持平衡。其次,我们为每个世界提供了详细的规范:每个文件的描述、每个要构建的任务(包括每个任务旨在捕获的刻意陷阱),以及一个记录所有预设矛盾的陷阱登记册。第三,我们反复迭代一个参考文件,直到其格式和风格显得真实,然后推导出每个世界的风格指南。我们对照规范和风格指南验证了所有文件,以确保它们读起来像来自一家公司。大多数世界文件是合成填充的,始终在专家的规范和审查下进行。每个文档都是新颖的,并已针对公开来源进行了筛查,因此任何世界都无法在线找到或提前记忆。平均每个世界有1414位专家参与工作。 ### 2.3 任务创建 每个任务都与一个世界相关联。它由一个提示、一组必需的输入文件、一份黄金答案以及一份评分细则组成。222附录A (https://arxiv.org/html/2607.27189#A1) 端到端地展示了一个开发集任务——提示、两个代表性的评分细则标准以及一个简化的评估轨迹——以使任务和评分细则结构更加具体。每个任务的必需输出是发送到控制台的一条消息。平均而言,每个任务有7.57.5个模型需要找到并阅读的必需输入文件。这些文件大多属于共享的世界文件语料库,但大约一半的任务会提供额外的任务特定文件,这些文件在任务开始时被放置在文件系统中,与世界文件放在一起。在保留集的所有任务中,160160个任务中的8383个(52%52%)至少包含一个任务特定文件(中位数22,每个此类任务平均2.72.7个)。任务特定文件在对账任务(61个中的33个33/6133/61)、附表与计提任务(45个中的29个29/4529/45)和差异分析任务(28个中的17个17/2817/28)中最常见,在数据录入任务(26个中的4个4/264/26)中很少见。 提示模仿会计师在工作环境中会收到的真实请求。它们简洁明了,包含对最终输出的明确期望,但没有解释一个称职会计师已经知道的方法,也没有给出文件名,除非文件名不直观或出乎意料。333数据集构建过程中应用的质量控制流程,包括专家审查、自动化QC和独立的重新解决基线化,见附录B (https://arxiv.org/html/2607.27189#A2)。每个任务都属于四个类别之一:对账、数据录入、差异分析和附表与计提。表̃1 (https://arxiv.org/html/2607.27189#S1.T1) 定义了每个类别,并报告了其任务数量以及每个任务的评判标准和文件统计信息。 专家为每个任务创建了一个评分细则,包含二元(通过/不通过)的未加权评判标准。平均每个任务有13.713.7个评判标准。为确保评分公平性,每个评判标准都是独立的、易于解释的、与提示一致的,并且基于结果的(表̃2 (https://arxiv.org/html/2607.27189#S2.T2))。专家还为每个任务创建了黄金答案,它代表了顶级的行业质量输出,在评分细则上获得100%100%的分数。 表2:每个评分细则标准必须满足的要求。| 要求 | 定义 |
|---|---|
| 自包含 | 无需参考其他标准即可评分。 |
| 易于解释 | 每个标准只涉及一个事实或判断,因此不会因复合要求而丢失部分分数。 |
| 与提示一致 | 仅对提示所要求的内容进行评分。 |
| 基于结果 | 仅对最终答案进行评分,不对中间步骤评分。我们应用可接受的范围来处理合理的四舍五入差异。 |
## 3 实验设置 ### 3.1 模型 我们评估了99个前沿模型在APEX–Accounting排行榜上的表现:Claude\-Fable\-5、Muse\-Spark\-1.1、GPT\-5.6\-Sol、Claude\-Opus\-4.8、GLM\-5.2、Grok\-4.5、Kimi\-K2.7\-Code、Gemini\-3.1\-Pro 和 Qwen3.5\-397B\-Fp8。每个模型独立执行每个任务88次,总共产生11,52011,520条轨迹。轨迹是指模型执行的一系列步骤,其中每个步骤是模型的一次调用。它可以包括输出token、推理token以及一个或多个工具调用。我们允许每个任务最多500500个步骤和55百万个token。444每个模型的提供商、上下文窗口、最大输出、思维努力配置和每次运行的挂钟时间见附录D (https://arxiv.org/html/2607.27189#A4)。 ### 3.2 框架 我们使用两种框架评估模型:标准的循环框架和Ramp框架。这两种框架均在Archipelago(我们用于大规模运行代理评估的内部框架)中实现和执行。555https://github.com/Mercor-Intelligence/archipelago排行榜结果使用循环框架。循环框架反复将上下文传递给模型以解决任务。而Ramp框架则在ReAct风格框架 (Yao et al.,2023 (https://arxiv.org/html/2607.27189#bib.bib14)) 的基础上扩展了并行子代理。这个Ramp框架是与Ramp合作构建的,以模仿他们为会计工作专门设计的框架。图̃2 (https://arxiv.org/html/2607.27189#S3.F2) 显示了Ramp框架的示意图。具体来说,有六个属性旨在模拟真实会计部署的约束: 1. 1.重试感知:在执行工具调用之前,框架会检查是否已经进行过相同的调用;如果是,则阻止该调用,从而避免无限循环和低效的重复工具使用。 2. 2.工具白名单:每个代理仅接触解决问题所需的一组工具。 3. 3.工具验证:工具参数在执行前进行解析和验证。 4. 4.不可用工具恢复:如果模型请求了一个它不能使用的工具,框架会返回一个模型可见的工具错误,而不是执行任何操作。 5. 5.读/写执行策略:只读工具可以通过子代理并行运行,而写工具则串行运行,以避免冲突的副作用。 6. 6.子代理委派:某些工具调用可以启动一个单独的代理循环来完成更狭窄的子任务,然后将结果返回给父循环。 图2:Ramp框架示意图。请参阅图注 对于标准的排行榜评估,我们将代理限制在55百万个token和500500个步骤。我们创建了框架的版本,在每一步告诉模型还有多少步骤和token剩余。如果达到步骤或token限制,模型会被要求提交最终答案;未能提交则得分为零。如果达到token限制,我们会提醒模型预算已用尽,并给予它额外的一次机会来提交答案。任何当前活动的子代理都会被取消,不允许返回。这确保了优雅地停止,而不会在原始token预算之外获得显著优势。此外,我们针对Claude\-Fable\-5、GPT\-5.6\-Sol 和 Gemini\-3.1\-Pro 进行了一项实验,比较了无限制token消耗与55百万token上限的效果。对于所有三个模型,55百万token限制的得分略高,这支持了这一设计选择。框架在每一步都会报告剩余的token,一个有限且可见的预算会促使模型整合中间结果。

相似文章

Claude Fable 5 的 FrontierMath 分数

Reddit r/singularity

Epoch AI 发布了 FrontierMath 基准测试的 v2 更新,纠正了 42% 问题中的错误,并提高了所有模型的分数,但排名基本保持不变;第 1-4 级正在接近饱和。