谁来验证基准测试?去中心化大型语言模型评估中的信任
摘要
本文提出一种基于区块链的提交-揭示协议,以去中心化LLM基准测试中的信任,使用匿名多模型验证器来解决基准声明中的身份感知偏差和操纵问题。
arXiv:2608.07762v1 公告类型:新
摘要:LLM基准测试可以建立组织的声誉并吸引客户,但前提是结果透明且可验证。关于DeepSeek R1优于OpenAI o1的未经证实的说法,是2025年1月27日市场恐慌的原因之一,当时Nvidia市值损失了5890亿美元。然而,供应商基准测试往往依赖诚信体系。学术再评估和独立排行榜发现了专有模型未披露的更改、受污染的训练数据以及选择性报告。LLM-as-a-judge方法通过减少人工审查来扩展评估规模。然而,研究表明,评审者可能表现出身份感知偏差,即根据答案的来源模型而非其质量来评分。这种偏差在政治敏感、推理密集和基于偏好的任务中尚未得到充分衡量或修正。我们使用七个验证器模型来研究这个问题:GPT-OSS 120B、Llama 3.3 70B、GLM 5.1、Qwen3 32B、DeepSeek V4 Pro、Mistral Large3和Sarvam M。它们对三个主要模型在58个事实性、推理、政治和基于偏好问题上的匿名和身份公开回答进行评分。身份公开略微提高了事实性问题的分数,对压力推理性任务有中等影响,并对地缘政治敏感话题造成较大变化。显著结果包括GLM5.1(+7.00分,p = 0.0249)和Llama 3.3 70B(+1.56分,p = 0.00)。我们还介绍了一种基于区块链的提交-揭示协议,使用以太坊兼容账本上的自主经济代理。在第一阶段,每个评审者在候选身份被揭示之前记录其分数和秘密盐的单向哈希。在第二阶段,身份和原始分数在链上披露并验证。这创建了一个防篡改的审计跟踪,将盲评与事后声明分开,并减少了独立研究人员和排行榜运营商的验证负担。
查看缓存全文
缓存时间: 2026/08/11 08:03
# 谁来验证基准测试?大型语言模型评估中的去中心化信任
来源:https://arxiv.org/html/2608.07762
\[1\]\\fnmMadhusudan\\surSingh
\[1\]\\orgdiv区块链数据智能实验室\\orgname宾夕法尼亚州立大学,\\orgaddress\\street201 Old Main,\\city大学公园,\\postcode16802,\\state宾夕法尼亚州,\\country美国
###### 摘要
大型语言模型(LLM)基准测试展示了各组织的专业能力,以吸引客户。未经核实的 DeepSeek R1 基准测试声称,其表现优于 OpenAI 的 o-1 模型,引发了市场恐慌,并于 2025 年 1 月 27 日导致 NVIDIA 损失 5890 亿美元。在没有加密的情况下,供应商主导的信用体系支撑着基准测试的声称。学术复评和第三方排行榜显示出系统性的基准测试操纵,包括秘密修改专有模型、污染训练语料库和选择性披露,这已经超越了市场波动本身。LLM 作为裁判(LLM-as-a-judge)取代了人工评估以实现可扩展性。研究表明,LLM 可能存在身份感知偏差,即评分会根据响应模型的身份而非答案质量进行调节。目前尚无研究测量或纠正过在政治敏感、强推理和基于偏好类信息中的身份偏见。七个模型验证器(GPT OSS 120B、Llama 3.3 70B、GLM 5.1、Qwen3 32B、DeepSeek V4 Pro、Mistral Large 3、Sarvam M)在一个包含 58 个问题的基准测试中,对三个主要模型的响应进行匿名和透明的评分,这些题目涵盖事实、推理、政治和基于偏好的类别,以考察身份感知偏差。身份披露对事实类问题得分略有提升,对压力推理任务适度提升,对地缘政治敏感话题显著提升(GLM 5.1:+7.00 分,p = 0.0249;Llama 3.3 70B:+1.56 分,p = 0.00)。我们基于经验数据,提出了一种基于区块链的提交-揭示协议,利用以太坊兼容账本上的自主经济智能体(AEAs),在披露候选模型名称之前锁定裁判评分。第一阶段在披露身份前将评分与随机盐的单向哈希提交到区块链,第二阶段披露身份并提交原始评分以供链上验证。这提供了一条可审计的证据链,将盲评与事后声明分离,减少了独立研究人员和第三方排行榜的验证责任。
###### 关键词:
人工智能、基准测试、区块链、大型语言模型(LLM)
## 1 引言
LLM 基准测试已成为 AI 进展的主要货币,同时也是一种被系统性操纵的测量系统,其完整性依赖于无报酬的学术劳动。各大公司自行报告的分数会撼动数十亿美元的市场。最显著的例子是 2025 年 1 月 27 日,DeepSeek R1 声称其基准测试优于 OpenAI 的 o-1 模型,引发了恐慌,导致 NVIDIA 市值单日蒸发 5890 亿美元。这一恐慌源于 DeepSeek 声称其模型在推理能力上追平了 OpenAI 的模型,例如在 AIME 2024 数学基准测试中得分 79.8%,而 ChatGPT o-1 为 79.2%,同时其训练成本仅约 600 万美元,且使用的是受美国出口管制限制的硬件\[14 (https://arxiv.org/html/2608.07762#bib.bib14)\]。这是美国股市有史以来最大的单日损失之一,主要由科技股推动,因为投资者恐慌性抛售。即便股价出现如此高风险的波动,目前仍没有任何框架能够确保这些基准测试声称在发布前是正确的。主流媒体中出现的一个重大事件是 Meta 的 Llama 4 提交到 LMArena 的测试,后来 Meta 前首席科学家 Yann LeCun 在接受《金融时报》采访时也证实了这一点\[19 (https://arxiv.org/html/2608.07762#bib.bib19)\]。另一个例子是 OpenAI 资助了名为 FrontierMath 的领先基准测试\[22 (https://arxiv.org/html/2608.07762#bib.bib22)\]。我们的工作以此为背景,提出一种基于区块链的验证基础设施,能够将这些声称锚定在加密真实之上,而不是供应商主导的信用体系。我们提出了一种去中心化验证协议,利用自主经济智能体(AEAs)和基于区块链的提交-揭示机制。通过在身份披露之前以密码学方式绑定裁判的承诺,我们的协议用数学强制力取代了自愿声明,用于 LLM 评估。
以下各节讨论如下内容:相关工作/文献综述、方法、实验、数学、系统架构图、实验分析、建议解决方案、讨论、结论和参考文献。
## 2 相关工作 / 文献综述
近期研究表明,多个模型家族都存在偏见,而且当候选模型的来源或身份已知时,偏见会越来越趋向于负面\[1 (https://arxiv.org/html/2608.07762#bib.bib1),2 (https://arxiv.org/html/2608.07762#bib.bib2)\]。一个显著的观察结果是,当裁判与候选模型属于同一模型家族时,分数往往会被抬高,这被称为自我偏见。2025 年的一项研究发现,ChatGPT-4o 和 Claude 3.5 Sonnet 等模型对自己的输出给出了更高的分数,并且还表现出家族偏见\[2 (https://arxiv.org/html/2608.07762#bib.bib2)\]。另一个此类情形是,当模型看到能显示自信和权威的信号时,例如引用、语气变化或“大多数用户更喜欢这个答案”“这是一个精炼的答案”等措辞,即使答案较弱,模型也会给出更高的分数。作为裁判的模型会顺从这些信号,倾向于选择更受偏爱的答案,添加虚构引用,并给那些被标记为“精炼”的答案打出更高分数,即使内容并没有任何变化\[1 (https://arxiv.org/html/2608.07762#bib.bib1),3 (https://arxiv.org/html/2608.07762#bib.bib3)\]。不过,目前已有积极的工作来防止此类偏见;其中一些主要框架包括 BiasScope 和 JudgeBenchPro\[4 (https://arxiv.org/html/2608.07762#bib.bib4)\]。在基于区块链的去中心化协作 LLM 评估框架方面,已有一些进展,称为 InfiCoEvalChain\[5 (https://arxiv.org/html/2608.07762#bib.bib5)\]。零知识机器学习(zkLLM)不同于常规基准测试,它允许提供方证明使用了特定模型架构生成输出,而无需泄露权重;这可以防止模型替换,即实验室可能使用更大的模型来获得更好的结果\[6 (https://arxiv.org/html/2608.07762#bib.bib6),23 (https://arxiv.org/html/2608.07762#bib.bib23)\]。此外,一个日益严重的问题是,模型试图迎合对方并最终相互趋同,却偏离了事实真相\[7 (https://arxiv.org/html/2608.07762#bib.bib7)\]。该领域的另一项进展是一篇论文,它利用区块链并通过 MCP 来验证来自外部数据的内容,确保数据完整性不受损害,且模型不会产生幻觉\[8 (https://arxiv.org/html/2608.07762#bib.bib8)\]。一篇论文声称,政治偏见确实存在,但尚未得到深入研究。因此,该论文的作者提出了一种方法来衡量这些政治偏见。他们没有向模型提出诸如“是左还是右”这类模糊问题,而是使用真实的议会数据,收集了各国议会中政治家的实际投票,每次投票都有不同党派的明确立场。然后,模型被给予相同的动议,并被要求判断某个特定政党会如何投票。再将此与该党派的实际投票进行比较\[10 (https://arxiv.org/html/2608.07762#bib.bib10)\]。最后,一篇发表在《自然》期刊上的文章发现,美国模型在进步价值观方面存在显著差异,而面向国际和面向国内的中国模型之间也存在分歧。通过考察这项研究,我们可以说 LLM 确实反映了其创建者的世界观\[12 (https://arxiv.org/html/2608.07762#bib.bib12)\]。另一项研究采用了一种稍有不同的方法,旨在观察物理情境中的功能性代码执行。作者对 ChatGPT 3.5、Gemini 1.5 Pro 和 Claude 3.5 Sonnet 进行了比较评估,要求它们将自然语言提示转换为可执行的 Java 命令(用于机器人课程),并转换为 3D 坐标系。他们设计了一个专为人机交互(HRI)定制的函数通过/失败单元测试范式。结果相当令人惊讶:Claude 达到了 95% 的高成功率,Gemini 达到了 60%,而 ChatGPT 表现最差,仅为 20%,原因在于空间推理的持续失败以及无法维持长程上下文\[18 (https://arxiv.org/html/2608.07762#bib.bib18)\]。相关工作摘要请参见参考文献部分之后。
## 3 方法
通过量化身份感知偏差(即匿名与身份揭示评分之间的差值),我们的实验旨在证明盲评不仅仅是程序上的偏好,而是研究完整性所必需的。如果模型身份的揭示会引发统计上显著的分数变化——即使只是在特定领域——那么当前依赖未经核实的非盲评估的做法就不够可靠。这一实证发现为我们提出的基于区块链的提交-揭示协议提供了核心动力,该协议将基准测试分数的复评责任从人工评估者转移到密码学协议上。
为了观察身份揭示如何影响 LLM 之间的同侪评估,我们构建了一个包含不同主题的问题集,涵盖事实类、推理类、政治敏感类和基于偏好的问题。我们使用了代表不同开发者生态系统、架构谱系和规模范式的模型,包括 GPT OSS 120B\[15 (https://arxiv.org/html/2608.07762#bib.bib15)\]、Llama 3.3 70B\[17 (https://arxiv.org/html/2608.07762#bib.bib17)\]、GLM 5.1\[21 (https://arxiv.org/html/2608.07762#bib.bib21)\]、Qwen3 32B\[20 (https://arxiv.org/html/2608.07762#bib.bib20)\]、DeepSeek V4 Pro\[16 (https://arxiv.org/html/2608.07762#bib.bib16)\]、Mistral Large 3\[24 (https://arxiv.org/html/2608.07762#bib.bib24)\]和 Sarvam M\[25 (https://arxiv.org/html/2608.07762#bib.bib25)\],对三个主要模型(DeepSeek V4 Pro、GPT OSS 120B、Sarvam M)生成的基线响应进行评分。其他模型(包括用于生成主要响应的模型,但只有当答案不是来自它们自身时才参与,例如 GPT OSS 在回答时不允许对自己的响应进行评分,以防止自我偏见)被要求对这些模型的响应进行评分。我们在两种设置下对问题进行评分:匿名模式和透明模式,在透明模式下验证器会被告知哪个模型最初回答了该问题。我们在每次会话开始时刷新/清除聊天中先前测试过的问题记忆,这样模型就没有先前上下文,不知道之前被问过什么样的问题、自己站在哪一边,也不知道自己给出过什么响应。
### 3.1 系统架构
参见图 1:系统架构图。如图 1 (https://arxiv.org/html/2608.07762#S3.F1) 所示,我们包含以下阶段:
- •阶段 I:我们使用自定义生成的问题库获取主要模型的响应。
- •阶段 II:我们将它们存储在 PostgreSQL 数据库中,以确保评分和结果的变化并非来自响应本身,而仅仅是模型评分和身份揭示造成的。
- •阶段 III:我们在两种条件下对响应进行评分,一种是匿名的,另一种是透明的,以观察身份揭示如何影响共识评分。
- •阶段 IV:我们对收到的结果进行分析,并进行数学压力测试,如配对 t 检验。
- •阶段 V:我们提出解决方案,包含三个步骤:提交阶段、分数锁定和揭示阶段。
## 4 实验
我们的最终问题集包含 58 个问题,涵盖两大类别。事实类(29 个问题)涵盖地理、科学、数学、压力推理测试和技术等子类别。主观类(29 个问题)由两个子类别组成:政治类和基于偏好类的问题。
参见图 2:NVIDIA 游乐场,我们在此进行实验;刷新后上下文不会恢复,因此我们每次都有一个新的会话。对于政治敏感问题,GPT OSS 120B 和 DeepSeek V4 Pro 的推理参数设置为低,所有三个模型(GPT OSS 120B、DeepSeek V4 Pro 和 Sarvam M)的温度设置为 0.5。在这里,我们承认不同运行模式下 n 次运行可能会改变立场,但我们选取了相互矛盾的答案,以观察在观点不一致且模型身份被揭示时模型会如何反应。在实验早期阶段,这些政治敏感问题被单独分类和分析。我们报告了在子类别层面(我们观察到统计显著性)的发现,并报告了合并后的“政治”类别的总体发现,这让我们有更大的样本量。
## 5 数学
IdentityGap\(IG\)=SnA−SnT\\mathrm\{Identity\\ Gap\\ \(IG\)\}=S\_\{n\}^\{A\}\-S\_\{n\}^\{T\}\(1\)
设SnA−SnTS\_\{n\}^\{A\}\-S\_\{n\}^\{T\}表示第 n 次配对观测中,裁判在匿名和透明条件下给出的分数。单个 n 代表一个唯一问题,裁判模型在两种条件下(匿名和透明)评估了候选模型的响应。我们将底层响应存储在数据库中,因此它是一个常数。这有助于我们确保任何分数变化都直接源于身份揭示,而非响应质量。
我们还设置了一个对照组,以确定身份偏见是否也出现在有事实答案的问题上。对于对照组,问题取自科学、数学、社会科学和压力推理类问题等多个领域。我们将这些类别合并为一个主要类别,称为事实类问题,因为它们有确定性答案。这里,GPT OSS 的推理参数设置为中等(默认参数)(特别是压力推理问题子类别设置为高),DeepSeek V4 Pro 设置为无(压力推理问题设置为最大)。对照组中所有被要求回答这些问题的模型的温度均设置为 1。
为了验证观察到的身份差距的统计显著性,我们采用了配对 t 检验。该检验专门用于盲评与身份揭示的情形。这有助于我们计算 p 值,它表明观察到的评分变化纯粹由噪声或随机选择引起的概率。统计严谨性使我们能够检验 LLM 偏见的客观梯度。通过比较各类别之间的 p 值,我们可以证明这种身份偏差何时出现。
## 6 实验分析
我们从两个粒度报告结果:一是原始子类别层面(在早期分析阶段观察到显著效应),二是合并后的“政治”类别(将其汇总以获得更大的样本量和更高的统计功效)。
### 6.1 当前发现
我们发现,身份揭示产生的影响因问题类别和验证器来源而异。在客观事实问题上,差距可以忽略不计。在地缘政治敏感的芯片战争内容上,研究发现某些验证器(GLM 5.1 和 Qwen3 32B)给出了偏相似文章
TrustLDM:语言扩散模型可信度基准测试
介绍TrustLDM,一个全面评估语言扩散模型安全性、隐私性和公平性的基准测试,揭示其对齐行为在恶意后上下文环境下会退化。提出自动评估框架TrustLDM-Auto,用于识别脆弱配置。
基准并非铁板一块:面向LLM评估的样本级审计与编排
本文提出了一种以数据集为中心的元评估框架,在五个潜在维度上对LLM基准进行样本级审计,揭示其内部异质性,并支持基于标准的基准子集组合,以实现针对性的模型评估。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
大语言模型可信性无训练方法的系统研究
一项系统性研究,评估了改进大语言模型可信性的无训练方法,将方法分为输入、内部和输出级干预,同时分析可信性、实用性和鲁棒性之间的权衡。
评估盲点:大语言模型基准覆盖的体视学理论
本文运用体视学理论分析大语言模型基准,揭示当前排行榜仅测量3-5个独立维度,产生的几何盲点主导统计噪声。文章提供了基准覆盖的理论界限,并提出一个用于高效基准选择的子模算法。