EuroExec:前沿语言模型在欧洲高管决策任务上未达到专家判断水平

arXiv cs.CL 论文

摘要

本文介绍了 EuroExec,这是一个用于评估前沿大语言模型在开放式欧洲高管决策任务上表现的人类专家基准。研究发现,最强的模型仅能解决 56.9% 的任务,远低于专家撰写的参考答案,凸显了现实世界开放式问题解决能力的差距。

arXiv:2608.04549v1 公告类型:新 摘要:前沿大语言模型越来越多地被用于开放式复杂问题,这些问题的性质与它们通常被评估的问题不同。我们投入超过 4,000 小时的人类专家时间,对六款前沿大语言模型在此类问题中的一个代表——EuroExec 上进行评估。EuroExec 是我们引入的基于人类专家的基准,由 47 位经过审查的领域专家撰写的 413 个开放式长篇欧洲高管任务组成,每个问题都来自真实案例的经验。每个回答都通过多属性评分标准、针对具体项目的需求清单以及偏好排名顺序进行人工评估,并提取出综合指标“解决率”。最强的模型仅解决了 56.9% 的任务,而专家撰写的参考答案在盲评中几乎达到天花板水平,并且在 74% 的直接排名中优于每一个模型回答,使得前沿生成系统远低于它们已被用于工作的专业标准。我们发现,得出此类结论的最佳方式是采用人工评估者,通过严谨的统计分析仔细检查他们的一致性,并观察到在评估这类具有主观真值的现实世界开放式问题时,自动测量方法也有所不足。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:48

# EuroExec:前沿语言模型在欧洲高管决策任务上未达到专家判断水平

来源:https://arxiv.org/html/2608.04549

Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro  
Sovrano AI  
{pau, khaled, danylo, amrut, marcus}@sovrano.ai

###### 摘要

前沿大语言模型(LLM)越来越多地被用于开放式复杂问题,这类问题与其通常接受的评测任务性质不同。我们投入了超过4,000小时的专家人工时间,对六款前沿LLM在该类问题的一个子类上的表现进行了评估:EuroExec,这是我们引入的基于人类专家的基准,包含由47位经过审核的领域专家撰写的413个开放式长篇欧洲高管任务,每个问题均来自真实案例中的实践经验。每个回答都由人工通过多属性评分标准、针对具体条目的要求检查清单以及偏好排序进行评估,并提取出聚合指标“Solve Rate”。最强的模型仅解决了56.9%的任务,而由专家撰写的参考答案在盲评中接近满分,并且在74%的直接排序中优于所有模型回答,这使得前沿生成系统远低于它们已被用于执行的专业工作标准。我们发现,得出此类结论的最佳方式是使用人类评估者,通过严格的统计分析仔细检查其一致性,并观察到自动评测在评估这类具有主观真值的现实世界开放性问题时也存在不足。

EuroExec:前沿语言模型在欧洲高管决策任务上未达到专家判断水平

Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro  
Sovrano AI  
{pau, khaled, danylo, amrut, marcus}@sovrano.ai

## 1 引言

对自动文本生成系统的评估是生成模型领域进步的基础,对其开发和基准测试都至关重要(Reiter,2026(https://arxiv.org/html/2608.04549#bib.bib48))。这通常通过精心设计任务来实现,以便适用客观的确定性指标,例如选择题(Zellers等,2019(https://arxiv.org/html/2608.04549#bib.bib8);Hendrycks等,2021(https://arxiv.org/html/2608.04549#bib.bib1);Rein等,2024(https://arxiv.org/html/2608.04549#bib.bib2))、输出以其他方式受限的任务(Rajpurkar等,2016(https://arxiv.org/html/2608.04549#bib.bib3);Kwiatkowski等,2019(https://arxiv.org/html/2608.04549#bib.bib9))、具有黄金标准答案的任务(如摘要或翻译)(Papineni等,2002(https://arxiv.org/html/2608.04549#bib.bib31);Lin,2004(https://arxiv.org/html/2608.04549#bib.bib30);Zhang等,2020(https://arxiv.org/html/2608.04549#bib.bib32)),或输出可执行并自动评估的编程练习(Chen等,2021(https://arxiv.org/html/2608.04549#bib.bib12);Jimenez等,2024(https://arxiv.org/html/2608.04549#bib.bib10);Jain等,2025(https://arxiv.org/html/2608.04549#bib.bib11))。这类封闭式生成任务的集合也被用来衡量生成模型的通用能力(Wang等,2019a(https://arxiv.org/html/2608.04549#bib.bib5),b(https://arxiv.org/html/2608.04549#bib.bib4);Srivastava等,2023(https://arxiv.org/html/2608.04549#bib.bib6);Liang等,2023(https://arxiv.org/html/2608.04549#bib.bib35);Gao等,2024(https://arxiv.org/html/2608.04549#bib.bib7))。这些方法用于评估模型的内在知识、推理或多模态能力,但并不直接衡量其在LLM日常工作中常见的那类开放式文本生成任务上的表现(Novikova等,2017(https://arxiv.org/html/2608.04549#bib.bib37);Huang等,2023(https://arxiv.org/html/2608.04549#bib.bib39)),例如聊天交互、一般性问题解决、创意草拟、文档分析,或者——如本研究所关注的——高管决策辅助。在上述所有应用以及其他类似应用中,都不存在唯一完美的答案。尽管如此,这些任务确实存在专业标准,该领域的从业者能够识别出是否达到该标准(Basile等,2021(https://arxiv.org/html/2608.04549#bib.bib46);Uma等,2022(https://arxiv.org/html/2608.04549#bib.bib45))。开放式任务不仅更能代表生成模型的实际用途,而且缺乏“黄金答案”还带来其他好处:该领域必须正视一个事实,即所有具有明确正确答案的公开基准任务可能已被它们所要评估的模型训练过,这使得一个疑问悬而未决:新模型所展现的提升在多大程度上源于更好的基座性能,又在多大程度上源于它们对已知答案的复述(Zhou等,2023(https://arxiv.org/html/2608.04549#bib.bib42);Yang等,2023(https://arxiv.org/html/2608.04549#bib.bib43);Li和Flanigan,2024(https://arxiv.org/html/2608.04549#bib.bib40);Zhao等,2025(https://arxiv.org/html/2608.04549#bib.bib41))。

最近,一些开放式文本生成任务的评估方法利用LLM本身作为AI评审,遵循预设的评分标准(Chiang和Lee,2023(https://arxiv.org/html/2608.04549#bib.bib17);Chen等,2023(https://arxiv.org/html/2608.04549#bib.bib36);Desmond等,2024(https://arxiv.org/html/2608.04549#bib.bib34);Bavaresco等,2025(https://arxiv.org/html/2608.04549#bib.bib18);Wang等,2025(https://arxiv.org/html/2608.04549#bib.bib21);Akyürek等,2026(https://arxiv.org/html/2608.04549#bib.bib27)),但一个问题仍然悬而未决:这些LLM评审在多大程度上真正代表了它们声称代表的标尺——即真实的人类判断,尤其是基于专家的评估(Zheng等,2023(https://arxiv.org/html/2608.04549#bib.bib33);van Miltenburg等,2023(https://arxiv.org/html/2608.04549#bib.bib24);Chen等,2024(https://arxiv.org/html/2608.04549#bib.bib19);Panickssery等,2024(https://arxiv.org/html/2608.04549#bib.bib22);Szymanski等,2025(https://arxiv.org/html/2608.04549#bib.bib20);Tan等,2025(https://arxiv.org/html/2608.04549#bib.bib25);Huidrom和Belz,2025(https://arxiv.org/html/2608.04549#bib.bib23);Ni等,2026(https://arxiv.org/html/2608.04549#bib.bib26))。由于涉及高昂成本,只有少数近期研究对开放式文本生成任务进行了完全基于人类的评估(Chiang等,2024(https://arxiv.org/html/2608.04549#bib.bib38);Guo等,2026(https://arxiv.org/html/2608.04549#bib.bib28);Badawi等,2026(https://arxiv.org/html/2608.04549#bib.bib29))。

我们引入了EuroExec,这是一个基于人类评估的基准,专注于对欧洲高管级用例的开放式长篇问题进行专家评估,包含413个由具备认证专业经验的专家撰写的详细而复杂的问题,素材来自他们实际处理过的案例。不同模型生成的回答由这些专家使用三种工具进行人工评估:一个包含多个类别的通用评分标准、一个与问题共同编写的具体检查清单,以及对所有回答的明确偏好排序。我们观察到,所有前沿模型都未达到辅助欧洲高管决策所需的标准——而专家们则以明显优势满足了这些标准——并且在这类任务上评估前沿模型的最佳方式是建立在人类评估之上的。在本文其余部分,我们首先详述问题数据集是如何构建的(第2节(https://arxiv.org/html/2608.04549#S2)),我们如何收集自动回答(第3节(https://arxiv.org/html/2608.04549#S3)),以及专家评估所采用的方法论(第4节(https://arxiv.org/html/2608.04549#S4))。然后在第5节(https://arxiv.org/html/2608.04549#S5)中讨论结果,并在第6节(https://arxiv.org/html/2608.04549#S6)中得出结论。

## 2 问题数据集

我们通过简历筛选和一对一面试选出了47位专家。专家根据其专长分为四个领域:财务、市场营销、商业和产品。他们均具有针对欧洲的商业和管理背景,并在其撰写问题和评估模型回答的领域拥有一手专业经验。表1(https://arxiv.org/html/2608.04549#S2.T1)汇总了每个领域的专家和问题数量。

### 2.1 问题制定

数据集中的每个问题条目均由人工精心编写,包含问题描述以及回答应涵盖的检查清单。问题作者收到的指令要求问题必须:自包含(纯推理任务)、开放式、长篇、具体(具体地点、合理名称、至少一个摩擦点)、目标导向(陈述目标但不给出任何步骤,难度来源于判断),并且设计上针对欧洲市场(例如德国人力资源决策中的劳资委员会步骤)。问题作者可以自由选择他们从自身职业经验中直接了解的主题和具体情况,并能确定性地判断出任何正确回答必须满足的要点。这些问题相当详细地描述了真实的商业情境,往往较长(约1,200个字符,约200词),并要求给出内容详尽的回答。检查清单与问题一同创建,扮演真值的角色:每个检查清单包含5至10条以动词开头的短语,描述了一个好的回答应满足的标准。有关此类问题条目的评分示例,请参见附录D(https://arxiv.org/html/2608.04549#A4)。

表1:每个领域的专家和问题数量

### 2.2 验证流程

为确保问题的相关性和质量,使其适合评估前沿生成模型,所有问题都经过了专门设计的验证流程。第一阶段即“自动化QA”,由一个自动LLM(Claude Sonnet 4.6)根据6条拒绝标准检查问题-检查清单条目对:提示泄漏(问题泄露了检查清单条目)、检查清单相关性(检查清单与问题匹配)、不良模式(身份探测、注入、不安全提示或问题非自包含)、不专业的语言、角色不清晰或场景不具体。第二阶段即“难度门槛”,涉及来自不同模型家族的两个LLM(以避免Panickssery等人(2024(https://arxiv.org/html/2608.04549#bib.bib22))发现的自我增强偏差),其中一个扮演求解者(Claude Haiku 4.5),另一个扮演评分者(Gemini Flash 3.5),以确保数据集中的所有问题都对当前前沿模型构成一定的合理判断或推理挑战。评分者将模型的自动回答与检查清单进行交叉比对,难度分数定义为自动通过的检查清单事实的百分比。根据5次通过的平均值,设定了60%的首轮自动满足率上限作为问题阈值。虽然此步骤确实涉及对问题的自动评分作为流程的一部分,但这是为了让问题作者能够快速迭代所必需的,并且不会削弱人类评估相对自动评估的可靠性,我们将在第5.4节(https://arxiv.org/html/2608.04549#S5.SS4)中看到这一点。作者被要求重写问题、检查清单或两者,直到自动LLM回答无法自动满足检查清单,这平均需要约30次尝试。我们使用“难度门槛”的得分将最终问题条目分为容易、中等和困难,而不针对任何特定分布。表2(https://arxiv.org/html/2608.04549#S2.T2)显示了我们的手工数据集中每个难度类别的问题条目数量,依据是其自动检查清单失败率。有关被此验证流程自动拒绝的问题示例,请参见附录E(https://arxiv.org/html/2608.04549#A5)。

表2:根据“难度门槛”得分得到的每个难度类别的问题数量

## 3 回答生成

我们选择了六款前沿LLM,旨在涵盖领先的商业系统并覆盖来自世界各地的多个提供商,这些模型列于表3(https://arxiv.org/html/2608.04549#S3.T3)。每个模型都通过其提供商API使用其默认解码设置进行查询。模型以单个提示词接收问题,不带任何额外上下文(如系统提示、对话历史、工具或文件访问),这与条目的自包含设计一致。每个回答都记录了成本和响应长度,用于附录B(https://arxiv.org/html/2608.04549#A2)和附录C(https://arxiv.org/html/2608.04549#A3)中的次要分析。

表3:六款被评估的前沿模型及其提供商。

## 4 专家评估

评估依据三种独立工具进行:通用评分标准的得分、针对具体条目的检查清单完成情况,以及根据偏好对所有回答进行的明确排序。检查清单标准由人工评估为命中、部分命中或未命中。评分标准在所有问题中由相同的五个属性组成,按李克特量表1至5分评分:

表4:不同人类评估方法的结果汇总:Solve Rate、偏好排序(平均排名和胜率)、评分标准得分和检查清单完成率。人类结果来自单独的33个问题子样本。

#### 领域
回答中呈现的信息是否符合问题所属领域?所呈现的事实、数字和框架是否正确?

#### 本地化
回答是否遵循市场特定的本地惯例、规则、制度和法规?

#### 推理
逻辑是否严密,是否导向所提出的建议,并尊重问题所指定的约束条件?

#### 沟通
回答是否面向建议、结构清晰、简明扼要,适合高管受众?

#### 可执行性
回答是否提出了具体且现实的计划,考虑了行动顺序,并包含具体的数值、日期和工具?

在人类评估过程中,模型回答被匿名化并针对每个问题打乱顺序。每个回答由两位领域专属评估者独立评分。这是一个高度耗费时间的过程:回答平均约44,000个字符(约7,500词),对全部六个回答按三种工具进行评分,每个条目大约需要5小时。超过4,000小时的人工时间被投入到全部413个问题的评估中。此外,在33个问题的子集中,问题作者被要求写出一份理想回答,并由两位独立专家将其作为第七个模型进行盲评。从这三种工具中,我们提取了一个代表每个模型平均表现的总体指标:我们引入“Solve Rate”(SR)聚合指标,定义为模型解决的条目比例。当平均评分标准得分≥3.0且检查清单完成率≥60%时,该问题条目被视为已解决,我们认为这是对所谓严格考试而言较为宽松的及格线。提取的其他指标包括:偏好排序的平均排名、胜率(模型产生最受欢迎回答的百分比)、平均评分标准得分和检查清单完成率。

相似文章

注意差距:前沿大语言模型能否通过标准办公能力考试?

arXiv cs.AI

本文介绍了OfficeEval,一个基于中国全国计算机等级考试(NCRE)的基准测试,用于评估大语言模型代理在复杂办公自动化任务上的表现。前沿模型在单轮交互中最高得分36.6%,在使用智能体系统时达到68.8%,远低于人类水平。

前沿大型语言模型的响应漂移

arXiv cs.CL

一项针对10个前沿大语言模型、涵盖62个问题的大规模人类评估发现,所有模型都表现出响应漂移,其中大多数模型收敛到78-81%的偏差上限,而两个模型实现了较低的偏差。漂移程度因领域和问题而异,自动指标几乎无法解释人类判断,这凸显了人类评估的必要性。

OmegaUse-OfficeVal:基于经济基准的长期办公套件任务LLM代理评估

Hugging Face Daily Papers

OmegaUse-OfficeVal是一个基准测试,用于评估LLM代理在长期办公套件任务中的表现,并结合经济基准,比较人力成本与LLM推理成本。该基准包含100个任务,每个任务需要约2.3小时的人力劳动。研究发现,前沿LLM虽然更便宜、更快速,但质量仍低于人类水平。