LivingArena:LLM是否知道其他LLM不知道的?同伴探查作为可扩展评估
摘要
本文介绍LivingArena,这是一个自动化的评估框架,其中LLM通过生成问题来探查彼此弱点,实现抗污染和可扩展的评估,并能随模型改进而适应。
arXiv:2607.24780v1 公告类型:新
摘要:评估前沿LLM具有挑战性:静态基准容易受到污染和饱和——使用户无法区分顶级模型,开发人员对特定故障模式视而不见——而人类偏好是主观的。在本文中,我们的问题是:*LLM是否知道其他LLM不知道的东西?我们能否利用这种动态进行评估?* 我们提出**LivingArena**,一个自动化、抗污染的评估框架。在该框架中,模型轮流提出提问,旨在提出对手无法正确回答的问题。提问者被鼓励主动识别和利用对手的知识边界,在答者失败时获得奖励,而答者则在其他情况下获得奖励。为了确保问题包含可客观验证的答案,由强模型组成的裁判组对它们进行验证,如果验证失败则惩罚提问者。评估十个前沿LLM,LivingArena产生稳定的Elo排行榜。我们的行为分析表明,模型能够识别并利用同伴的认知边界:自我对弈和锦标赛日志显示,它们定位并加倍攻击对手的薄弱维度。除了静态知识召回,同伴探查还衡量事实严谨性和探查对手弱点的更高阶能力,与人类偏好仅有弱相关性,并提供了一种可扩展、低成本的持续评估方法。
查看缓存全文
缓存时间: 2026/07/29 09:52
# 大型语言模型知道其他模型不知道什么吗?——基于同伴探查的可扩展评测
来源:https://arxiv.org/html/2607.24780
陈星宇 上海交通大学,腾讯 galaxychen@sjtu\.edu\.cn & 王睿* 上海交通大学 wangrui12@sjtu\.edu\.cn
###### 摘要
评估前沿大型语言模型(LLM)极具挑战性:静态基准因数据污染和性能饱和而失效——用户无法区分顶尖模型,开发者对特定失败模式视而不见——而人工偏好评价则带有主观性。本文提出的问题是:*大型语言模型知道其他模型不知道什么吗?我们能否利用这种动态来进行评估?*我们提出了LivingArena,一个自动化、抗污染的评估框架。在该框架中,模型轮流提问,旨在提出对手无法正确回答的问题。提问者被鼓励主动识别并利用对手的知识边界,当回答者失败时获得奖励,反之回答者获胜。为了确保问题包含客观可验证的答案,一个由强模型组成的评审团对问题进行验证,若验证失败则惩罚提问者。通过对十个前沿LLM的评估,LivingArena生成了一个稳定的Elo排行榜。我们的行为分析表明,模型能够识别并利用同伴的认知边界:自我对弈和锦标赛日志显示,它们会定位并加倍攻击对手的薄弱维度。除了静态知识回忆,同伴探查还能衡量事实严谨性和探查对手弱点的更高阶能力,与人工偏好仅弱相关,为持续评估提供了一种可扩展、低成本的方法。
LivingArena:大型语言模型知道其他模型不知道什么吗?——基于同伴探查的可扩展评估
陈星宇 上海交通大学,腾讯 galaxychen@sjtu\.edu\.cn 王睿* 上海交通大学 wangrui12@sjtu\.edu\.cn
涂兆鹏* 腾讯 tuzhaopeng@gmail\.com 波列锋 腾讯 liefengbo@gmail\.com
††*通讯作者。
## 1 引言
像MMLU(Hendrycks et al., 2021 (https://arxiv.org/html/2607.24780#bib.bib1))和MMLU-Pro(Wang et al., 2024 (https://arxiv.org/html/2607.24780#bib.bib2))这样的静态基准面临着三个相互叠加的问题:构建专家级题目的**高成本**、固定数据集泄露到训练数据导致的**污染**,以及顶尖模型接近上限的**饱和**。在实践中,饱和问题尤为严重:模型以加速的节奏发布,得分集中在上限的一两分之内,导致用户无法区分领先系统,开发者在发布前也缺乏定位失败模式所需的精细信号——而每次手动基准更新很快就会被下一代模型所淘汰。基于人类偏好的竞技场(Regin et al., 2024 (https://arxiv.org/html/2607.24780#bib.bib3))绕过了静态构建,但衡量的是**主观有用性**而非客观事实,并且众包评分者难以处理高度专业化的答案。
参照图注 图1:LivingArena评估流程及动态弱点利用概览。提问者生成的题目和参考答案在回答者作答和评分之前,先由评审团进行验证。这里,在回答者答错一道编程题后,提问者在下轮采用“命中后利用”策略,针对同一维度进行攻击。
在这项工作中,我们提出了一个根本性问题:**大型语言模型知道其他模型不知道什么吗?** 如果模型能够自发发现并利用彼此的弱点,我们就不再需要费力地人工构建测试集。随着模型的进化,它们会自然地向对方提出更难的问题,从而产生一个本质自适应的、**活的**基准,它会随着领域进步而再生难度,而不是依赖于一个固定的题库。关键在于,获胜需要超越静态回忆的更高阶技能——主动理解对手并探查其盲点——这正是饱和准确率所掩盖、且模型团队在区分几乎无法区分的系统时所需要的诊断信号。
我们提出了LivingArena(图1 (https://arxiv.org/html/2607.24780#S1.F1)),一个完全自动化、抗污染的评估框架,实例化了这种同伴探查范式。模型参与双向比赛,轮流担任提问者和回答者,旨在提出对手无法回答的问题。为了确保问题有意义且客观可验证,我们强制执行三个约束:(i) 提问者必须提供正确、可验证的“黄金”答案,否则面临“**自伤**”惩罚;(ii) 问题由一个模型评审团独立验证,任何无效投票都会导致问题被拒绝;(iii) 提问者仅在对手未能回答已验证问题时得分。这将“你无法回答的问题”转化为一个严格的信号:“我掌握了你所不具备的可验证事实或推理陷阱。”
我们在一个包含360场比赛(3600轮)的循环赛中评估了来自OpenAI、Anthropic、Google和DeepSeek的十个前沿LLM。我们发现,虽然模型无法提出超出自身知识边界的问题,但它们能够发现并利用同伴的弱点。模型采用不同的策略:有些(例如GPT-5.2)激进地提出难题,冒着自伤的风险;而另一些(例如GPT-5.5、Gemini-3.1-Pro)则校准良好,有选择地提出他们确信的问题。虽然模型偏向于定量推理和代码与算法,但它们在逻辑与抽象推理方面最为吃力。因此,同伴探查衡量的客观严谨性和事实校准维度与人类偏好投票不同。
**贡献。** (1) 我们提出了LivingArena,一个自动化、抗污染、自适应的评估框架,无需静态题库,并能随着模型改进保持区分度。(2) **对于工业实践**,它提供了一个持续、低成本的回归测试工具,无需人工构建——一个完整的十模型锦标赛大约只需100分钟壁钟时间——并将同伴探查转化为可操作的、按维度划分的失败诊断,这是聚合准确率所隐藏的。(3) 我们在一个包含360场比赛的循环赛中评估了十个前沿LLM,得到了一个稳定的Elo排行榜,能够清晰地区分接近饱和的系统,并分析了模型校准、提问策略和主动弱点定位。(4) 我们开源了完整的评估代码和原始日志。111https://github.com/galaxyChen/LivingArena
## 2 相关工作
#### 从静态到动态和生成式基准。
传统的静态基准如MMLU(Hendrycks et al., 2021 (https://arxiv.org/html/2607.24780#bib.bib1))、HELM(Bommasani et al., 2023 (https://arxiv.org/html/2607.24780#bib.bib5))和MMLU-Pro(Wang et al., 2024 (https://arxiv.org/html/2607.24780#bib.bib2))遭受数据污染和饱和问题。为了解决这个问题,动态基准使用基于时间划分的未来事件(Karger et al., 2025 (https://arxiv.org/html/2607.24780#bib.bib14))或新文献(Liang et al., 2026 (https://arxiv.org/html/2607.24780#bib.bib15)),合成无限测试套件(Lee et al., 2025 (https://arxiv.org/html/2607.24780#bib.bib16); Anonymous, 2026 (https://arxiv.org/html/2607.24780#bib.bib17)),或集体重新校准分数以对抗基准泄漏(Du et al., 2025 (https://arxiv.org/html/2607.24780#bib.bib24))。然而,在无限空间中均匀采样效率低下。虽然QuickScope(Lundy et al., 2026 (https://arxiv.org/html/2607.24780#bib.bib10))使用集中式贝叶斯优化器搜索难题,但LivingArena将这种搜索去中心化,利用竞争性同伴LLM作为自然的启发式搜索器来探查和定位彼此的认知边界。
#### LLM作为评判者与系统性偏差。
使用LLM作为评估者成本效益高(Zheng et al., 2023 (https://arxiv.org/html/2607.24780#bib.bib4); Xu and Zhang, 2026 (https://arxiv.org/html/2607.24780#bib.bib18)),但遭受严重的系统性偏差,如位置偏差、自我偏好、冗长偏差以及主导风格/格式偏差(Zheng et al., 2023 (https://arxiv.org/html/2607.24780#bib.bib4); Soumik, 2026 (https://arxiv.org/html/2607.24780#bib.bib19))。由于偏差之间复杂的相互作用,缓解这些偏差具有挑战性(Soumik, 2026 (https://arxiv.org/html/2607.24780#bib.bib19))。LivingArena通过从相对的成对比较转向对客观、可验证任务的绝对、二元验证(正确/错误),绕过了这些主观陷阱,消除了表面风格、长度或格式的影响。
#### 多智能体辩论与对抗性验证。
为了克服单评判者的局限性,多智能体辩论和共识网络采用角色专业化智能体(Harrasse et al., 2026 (https://arxiv.org/html/2607.24780#bib.bib20))或异构团队(Lo et al., 2026 (https://arxiv.org/html/2607.24780#bib.bib21))来验证复杂主张。这种对抗性结构防止了“群体思维”和相互幻觉,迫使进行严格验证。类似的对抗动力也用于合规压力测试(Zhao et al., 2026 (https://arxiv.org/html/2607.24780#bib.bib23))。LivingArena实例化了一个零和对抗游戏,模型由Elo排名激励,主动寻找并利用对手的逻辑漏洞。
#### 无监督同伴评估。
我们的工作与无监督同伴评估密切相关,后者消除了人工标注的参考。现有框架使用不对称工具授权(Margalit et al., 2026 (https://arxiv.org/html/2607.24780#bib.bib11))、带评审过滤的一致性优化(Ning et al., 2025 (https://arxiv.org/html/2607.24780#bib.bib12))或通过共识网络进行互惠同伴评估(Loi et al., 2025 (https://arxiv.org/html/2607.24780#bib.bib13))。虽然这些框架依赖于开放式任务上的相对同伴评分,但LivingArena专注于严格的、基于事实的对抗性探查,通过强制执行自伤惩罚来确保同伴生成的问题保持客观可验证。
#### 替代评估范式对比。
表1 (https://arxiv.org/html/2607.24780#S2.T1) 系统地将LivingArena与四种主流评估方法进行了对比:静态基准(如MMLU)、基于人类偏好的竞技场(如LMArena)、单LLM作为评判者配置以及多智能体辩论/监督机制。LivingArena的关键优势在于,它通过动态的、同伴驱动的问题生成和验证,能够消除人力成本和污染/泄漏风险。与快速饱和的静态基准或受风格和长度偏差影响的LLM评判者不同,LivingArena使用对抗性同伴探查和严格的、基于共识的二元裁决方案来产生校准的能力评估。
表1:评估范式对比。LivingArena将LLM作为评判者的自动化与偏好竞技场的对抗性动力相结合,同时消除了人力成本和污染风险。
## 3 LivingArena框架
#### 比赛结构与流程。
模型A和B之间的双向比赛包含T=10轮顺序轮次,其中一方模型充当**提问者**,另一方充当**回答者**。比赛的完整执行流程,包括验证、回答、评分和计分,如图2 (https://arxiv.org/html/2607.24780#S3.F2) 所示。该过程分为四个步骤:
1. **问题生成**:提问者A生成问题q_t,类别d_self ∈ D,参考答案a_t*,以及验证逻辑v_t*。对于t > 1,A会收到之前轮次的历史记录。
2. **独立验证**:三位评判者盲审{ q_t, a_t*, v_t* }。每位评判者j投票V_val^(j) ∈ {VALID, INVALID}并确定类别d_t ∈ D。验证是**严格**的:任何INVALID投票都会拒绝该问题(v_t = 0),否则接受(v_t = 1)。
3. **回答**:如果接受,回答者B仅接收q_t并输出推理和答案r_t。
4. **评分**:评判者将r_t与a_t*进行比较,投票V_grade^(j) ∈ {CORRECT, WRONG}。评分采用**多数决**:≥2个CORRECT投票则答案正确(g_t = 1),否则错误(g_t = 0)。
为了消除任何结构性角色偏差(例如,提问是否天生比回答更容易或更难),我们在每个比赛配对内**双向**运行比赛:比赛1由A提问B,比赛2由B提问A。
图2 (https://arxiv.org/html/2607.24780#S3.F2) 展示了双向比赛的详细逐步执行流程。在每场比赛的十轮中,提问者模型(A)被要求生成一个问题q_t、相应的黄金标准答案a_t*以及一个验证/推理步骤v_t*,格式为严格的、结构化的JSON。这个生成的元组被传递给一个由三个不同模型评判者组成的独立多方评审团,进行验证投票(步骤2)。如果任何评判者否决了该问题,该轮立即中止并标记为**无效**,导致提问者的自伤惩罚为-1.0(S_{A,t} = -1.0),回答者为0(S_{B,t} = 0)。如果问题通过验证,则将其呈现给回答者(B),回答者生成其答案r_t。然后评审团对r_t相对于黄金标准答案a_t*的正确性进行评分。如果评分正确,回答者得一分(S_{B,t} = 1.0, S_{A,t} = 0);如果评分错误,提问者获得一个衰减加权的命中分(S_{A,t} = w(C), S_{B,t} = 0)。十轮之后,角色对称交换(比赛2:B提问A)以确保公平,两场比赛的累积分数汇总后更新全局Elo评分。
比赛开始(模型A vs B) 初始化 轮次t=1 步骤1:问题生成 (q_t, a_t*, v_t*) 步骤2:独立验证 任何否决? 自伤惩罚 (S_{A,t} = -1.0, S_{B,t} = 0) 步骤3:回答 (r_t) 步骤4:评分 多数正确? 回答者得分 (S_{B,t} = +1.0, S_{A,t} = 0) 提问者获得命中分 (S_{A,t} = w(C), S_{B,t} = 0) 轮次增加 t ← t+1 是否 t > 10? 双向交换(比赛2:B提问A) 汇总分数并更新Elo 比赛结束 是 否 是 否 是 否 (t ≤ 10)
图2:LivingArena框架中双向比赛的完整逐步执行流程。在10轮中的每一轮,提问者生成的问题由三个独立评判者验证。如果被否决,提问者遭受自伤惩罚;如果有效,回答者作答,评判者评分正确性。10轮后,角色交换进行比赛2,净分数汇总以更新Elo评分。
#### 能力维度。
我们建立了六个核心能力维度D,以覆盖广泛的认知技能,同时保持清晰的边界:D1:定量推理(数学、统计);D2:代码与算法(编程、算法推演);D3:自然科学(物理、化学);D4:人文与社会科学(历史、经济学);D5:语言与语言学(语法、语义);以及D6:逻辑与抽象推理(形式逻辑、谜题)。最终的维度d_t由一致同意确定。相似文章
SAGE:用于 LLM 知识评估的可扩展自动化鲁棒性增强
本文介绍了 SAGE,这是一个用于 LLM 知识评估基准测试的可扩展自动化鲁棒性增强框架。该框架使用经过强化学习微调的小模型,以低于现有方法的成本生成和验证问题变体。
行动之前:面向前瞻性假设发现的LLM基准测试
本文介绍了HypoArena,这是一个用于评估LLMs从非完整证据中主动构建假设空间能力的基准,在15个前沿LLM上的实验揭示了能力分层。
大语言模型能泄露训练数据,但它们愿意吗?对LLM记忆的倾向性感知评估
PropMe是一个倾向性感知框架,用于评估LLM的记忆,区分强制复现能力和自然倾向,使用SimpleTrace在开放模型和数据集上进行确定性归因。
LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
LLMs知道自己知道,但并未据此行动:一种用于测试时扩展的元认知框架
本文提出一种元认知框架,将LLMs中的监控与推理分离,利用解决前的已知感(feeling-of-knowing)和解决后的学习判断(judgment-of-learning)信号来控制何时信任、重试或聚合答案,在不更新参数的情况下提升文本、代码和多模态基准测试的准确率。