从全球基准到本地评估:为德国公共部门基准测试LLMs
摘要
本文介绍了MÖVE,一个针对德国公共部门LLMs的整体评估框架,考察了能源消耗、提供商透明度和德国政党立场知识等治理维度,揭示了需要根据具体上下文选择模型的权衡。
arXiv:2608.17827v1 公告类型:新
摘要:公共机构在为其特定上下文选择LLMs时面临持续挑战。然而,现有基准用途有限,因为它们主要反映以英语和美国为中心的设置,并且通常只评估任务性能。本文首次介绍了MÖVE的结果,这是一个针对德国公共部门的整体评估框架,考察了三个很少被考虑的治理维度:能源消耗、提供商透明度和德国政党立场知识。我们的结果显示了显著的权衡,没有一个模型在所有维度上都表现出色:估计的能源消耗变化超过60倍,并且不能仅由模型大小解释;信息披露因提供商而异;欧洲模型并未表现出对德国政党立场的更强知识。因此,公共机构的模型选择不能仅依赖性能排名。相反,评估还应反映部署上下文的治理要求。
查看缓存全文
缓存时间: 2026/08/19 10:05
# 从全球基准到本地评估:德国公共部门LLMs基准测试 来源:https://arxiv.org/html/2608.17827 Thilo Michael, Robin Schaefer, Daniel Weinland 德国柏林联邦印刷有限公司创新部,[email protected] ###### 摘要 公共机构在选择适合其特定环境的大语言模型时面临持续挑战。然而,现有基准测试的作用有限,因为它们主要反映英语和美国中心的环境,且通常仅评估任务性能。本文介绍了MÖVE(公共行政模型评估框架)的初步结果,这是一个面向德国公共部门的整体评估框架,考察了三个常被忽视的治理维度:能耗、供应商透明度和对德国政党立场的了解。研究结果揭示了显著的权衡取舍,没有单一模型能在所有维度上表现突出:估计能耗差异超过60倍,且不能仅由模型大小解释;信息披露在不同供应商之间存在系统性差异;欧洲模型在德国政党立场方面的知识并未表现出更强优势。因此,公共机构的模型选择不能仅依赖性能排名,评估还应反映部署环境的治理要求。 \*\*脚注1:这些作者对本工作贡献均等。††脚注2:本文将在KONVENS 2026(德国汉堡)同期举办的Eval4SD研讨会上展示。 ## 1 引言 大语言模型(LLMs)在包括公共管理在内的高风险环境中应用日益广泛。与此同时,模型选择不再仅仅是在一两个知名供应商之间进行决策。公共机构现在可以从一个快速扩展且多样化的模型景观中进行选择,这些模型在规模、性能、能耗、文档实践和上下文知识等方面各有差异。 随着LLM生成的文本越来越多地用于政策分析和公共部门决策,建立稳健且本地化的基准测试实践变得愈发紧迫。仅凭通用基准性能难以充分证明模型是否适用于特定的机构、语言或社会环境。因此,识别潜在危害并在预期使用场景中预见故障的能力,使得模型评估成为一门必不可少的学科。 现有的LLM基准测试主要测量英语数据集上的任务性能,且常反映美国或英国特定环境。多语言基准测试将覆盖范围扩展到更多语言,但通常依赖现有数据集的翻译版本,因此未能解决领域或环境差距问题。此外,基准测试通常优先考虑任务性能,而非更全面评估所涉及的广泛治理问题。因此,尽管模型在传统基准测试中可能表现良好,但其可能消耗不成比例的资源或提供不足的文档,而这些对于LLMs的广泛采用至关重要。这些限制对公共机构尤为重要,因为它们不仅必须评估模型能否应用于任务,还必须评估其部署是否能向决策者、监督机构和公众证明其合理性。 本文介绍了MÖVE(Modellen für die öffentliche Verwaltung evaluieren,公共行政模型评估)的初步结果,这是一个面向德国公共部门的整体评估框架。MÖVE被设计为一个动态基准,将根据评估模型和评估标准定期更新。我们的排行榜可在此访问:https://moeve.bundesdruckerei.de/(德语)。框架代码可在此获取:https://github.com/Bundesdruckerei-GmbH/moeve-lmbench。有关评估标准、数据集、提示和结果的更多详细信息,请参阅我们的MÖVE框架论文。虽然该框架的当前状态包含七项性能和治理标准,但本文重点评估了39个LLMs在三个治理维度上的表现。我们使用特定任务的输出统计数据来估算推理时能耗,通过一个由七个文档领域的21个问题组成的人工验证矩阵来评估供应商透明度,并使用来自64个德国政党的4,788个官方立场来评估政治知识。尽管需要不同的评估方法,但这三个维度共同解决了一个问题:模型是否适合在特定的公共部门环境中部署,而不仅仅是在通用任务上的表现。 ## 2 基准设计 ### 2.1 范围与目标群体 我们评估了来自13个供应商的39个开源权重和专有LLMs,这些模型涉及公共部门部署相关的三个治理维度:推理时能耗、供应商透明度和对德国政党立场的了解。该基准是通过利益相关者参与流程制定的,包括与公共部门代表的半结构化反馈会议以及与从业者的交流。遵循基准设计应基于预期用途和利益相关者需求的建议,我们区分了四个目标群体:1)人工智能决策者,2)公共管理领域专家,3)IT部门和安全关键机构,4)更广泛的社会。他们的需求分别涉及战略模型比较、操作适用性、安全合规部署和公共问责。 表1:用于计算模型评估期间能耗的数据集概览。*类型*表示数据集是预先存在的还是专门为基准构建的。后者不向公众发布。数据集大小根据每个任务中使用的评估单元报告,例如,摘要任务中的*摘要*。 ### 2.2 能耗 当模型大规模部署时,能耗可能大幅累积,因此能源效率既是运营考量也是环境考量。为了能够比较本地部署和通过API访问的模型,我们使用EcoLogits估算推理时能耗。该框架根据模型的总参数数量、混合专家架构的活跃参数数量以及生成的输出令牌数量来估算能耗。开源模型的参数信息来自官方文档;对于未公开参数数量的专有模型,我们依赖EcoLogits提供的假设。 我们不使用固定的输出长度,而是使用在模型评估期间记录的九个德语数据集上的实际输出令牌计数(表1):四个摘要数据集,三个问答数据集,以及两个主题提取数据集。我们报告了每个推理请求的平均估计能耗(瓦时),按任务和跨任务计算。 ### 2.3 供应商透明度 有意义的风险评估依赖于供应商的透明度。如果没有关于训练数据、偏差缓解、计算资源和模型局限性的充分信息,采用机构无法独立评估转移给它们的风险。这些信息在欧洲监管环境中也日益重要,特别是考虑到欧盟人工智能法案第53条对通用AI模型提供商设定的文档要求。 供应商透明度通过一个包含七个领域21个问题的结构化数据集进行评估:模型识别;架构与特性;分发与访问;使用与部署;训练与数据;计算资源与能耗;对欧盟通用AI实践守则的认可。这些问题源于守则的透明度章节和模型文档表格,使第53条规定的文档义务得以具体化。 对于每个模型,我们从三种来源收集公开可验证的信息:官方供应商网站、官方模型卡片以及供应商发布的技术出版物。每个问题评分为:0表示无信息可用,1表示信息部分,2表示提供清晰可验证的信息。实践守则的签署被视为二元标准。文档首先由主要研究人员手动评估,由第二位研究人员独立评分子集。为支持质量保证,我们还实现了一个自动评分代理,检索相同来源并独立评分所有标准。自动评估和手动评估最初在27.4%的项目上存在分歧。这些案例经过审查并在必要时进行修正,反复出现的分歧被编码为明确的评分说明,将分歧减少到16.2%——这是最终协议内部一致性的衡量,而非准确性的衡量,因为说明和手动评分在此过程中都进行了修订。第二位研究人员审查了完整输出。在39个模型中,生成的数据集包含819个模型-问题评估。完整的矩阵,包括评分说明、每个评分的理由和基础来源,已公开提供。 图1:欧盟人工智能法案实践守则签署方与非签署方按领域的平均透明度分数(%)。 ### 2.4 政治知识 公共部门使用的模型需要产生事实准确的输出。政治知识是一个特别重要的例子,因为对政策立场的错误表述可能影响面向公民的信息服务和政策相关应用。现有研究经常通过政治罗盘或国家投票建议应用程序等工具检查归因于LLMs的政治偏好。然而,这些结果对提示表述、语言以及用于将政治立场归因于模型的假设很敏感。因此,我们将政治知识与政治偏好区分开来。我们不测量模型输出中的政治偏好,而是评估这些输出是否正确反映了德国政党公开记录的立场。这种表述将政治定位视为基于外部参考的事实分类任务,而非将党派偏好归因于模型。 政治知识使用来自德国Wahl-O-Mat(一个由联邦政治教育中心维护的投票建议应用程序)的官方政党回答进行评估。该数据集涵盖最近四次联邦选举,即2013、2017、2021和2025年,并包括所有参与政党。政党未提供立场的命题被移除,最终得到来自64个政党的4,788个标记立场(同意、不同意或中立)。47.5%的立场同意给定命题,而39.7%和12.8%分别表示反对或中立。 模型接收一个政治命题、一个政党、选举年和响应选项的德语提示,并被要求预测指定政党如何定位自己。每个模型每个数据点被查询一次。性能通过与官方政党回答的分类准确性来衡量。尽管理论上这一任务对LLMs构成挑战(因为政党立场可能随时间变化),但我们认为这是识别LLMs在政治环境中性能上限的一个有力用例。 ## 3 结果 我们的结果揭示了显著差异和权衡。估计的平均能耗在评估的模型之间相差63倍,从每次查询0.647瓦时到40.6瓦时不等,中位数为1.788瓦时。对于未公开参数数量的专有模型,此估算应谨慎解读。能耗也强烈依赖于任务:摘要比问答和主题提取更耗能,因为它产生更长的输出。推理模型的能耗尤其高,而几个较小的模型在能耗显著更低的情况下仍具有竞争力。因此,我们的分析表明,性能的边际改进可能带来不成比例的高能耗。 #### 能耗 估计能耗在39个模型之间变化了63倍,从0.647瓦时到40.6瓦时不等,中位数为1.788瓦时。对于未公开参数数量的专有模型,此估算应谨慎解读。能耗也强烈依赖于任务:摘要比问答和主题提取更耗能,因为它产生更长的输出。推理模型的能耗尤其高,而几个较小的模型在能耗显著更低的情况下仍具有竞争力。因此,我们的分析表明,性能的边际改进可能带来不成比例的高能耗。 #### 供应商透明度 总体透明度分数范围从18到42中的38,表明模型和供应商之间存在显著差异。文档通常在模型识别、架构和访问方面较强,但在上游信息方面较弱。计算与能耗是最不透明的领域,平均分数为11.5%;84.6%的模型未披露训练能耗,79.5%的模型未提供测量方法。训练数据保障和偏差缓解实践也文档化不足(完整结果见附录A)。签署了欧盟通用AI实践守则的供应商总体分数仅略高于非签署方,其优势集中在下游信息(如预期用途和部署指南)上,而非训练数据、计算或能耗披露(图1)。 #### 政治知识 没有模型在反映德国政党立场方面产生持续准确的输出(表2)。两个表现最好的模型在来自64个政党的4,788个立场中仅达到0.671的准确率。尽管较大的模型平均表现更好,但模型大小并非决定性能的因素:一个小型GPT-4o Mini与一个大型DeepSeek R1在排名顶部匹配,而中型和微调模型也取得了有竞争力的结果。
相似文章
MÖVE:德国公共部门的全面LLM基准
MÖVE 是一个全面的基准测试,用于评估德国公共部门中的大型语言模型,涵盖 39 个模型在十个德语数据集上的性能和治理标准。
金融服务业LLM评估的元基准
本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。
基准并非铁板一块:面向LLM评估的样本级审计与编排
本文提出了一种以数据集为中心的元评估框架,在五个潜在维度上对LLM基准进行样本级审计,揭示其内部异质性,并支持基于标准的基准子集组合,以实现针对性的模型评估。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。