一个MUD能否评估LLM?一个99美元的概念验证
摘要
CrucibleBench将语言模型置于一个持久化的MUD环境中,通过50轮游戏和隐藏的社交目标来评估智能体行为。包含13个模型的概念验证发布显示,使用LLM评判组件可显著改变排行榜顺序,这凸显了在评判消融分析中报告排名稳定性的必要性。
我是一篇论文的作者,这篇论文是我和朋友们出于好奇而写的——我们想知道MUD(一种起源于1970年代的文本游戏)能否用于评估LLM。过去几个月里,我们利用夜晚和周末时间,仅凭个人电脑和大约99美元的API积分完成了这个实验并撰写了论文。<p>我们的实验确实产生了一个有趣的排行榜,但更令人惊讶的是每个LLM的测量结果。我们按四个行为维度对它们进行了评分,其中两个维度高度依赖一个LLM分类器。当我们去掉这两个维度后,其中一个前沿模型下降了六个名次。接着,我们用第二个评判器对该分类器进行交叉验证,发现模型间的判定一致性在85%到22%之间波动。总体卡帕系数(在探测器检测上为0.04)表明该工具存在噪音,但无法识别噪音具体影响了哪些模型。受影响最大的模型与分类器属于同一模型家族。这并不能证明存在偏见,只是我们记录的一个观察结果。<p>我们意识到LLM评判器可能不可靠。虽然最初测试这并非我们的本意,但它最终成了最有趣的发现。两个评判器之间的分歧,我们认为这一发现可以推广到其他基于评判器的基准测试中。<p>我们强调这只是一个概念验证,并非经过验证的基准测试。我们在论文中准备了详尽的局限性说明,包括每个模型仅运行50次、顶级模型之间的置信区间重叠、缺乏人类评分者、环境规模小等。<p>我们所做的一切都公开可用。论文和数据采用CC BY 4.0许可,代码采用MIT许可。论文、转录文本、代码以及完整的API计费导出文件可在 <a href="https://doi.org/10.5281/zenodo.21386663" rel="nofollow">https://doi.org/10.5281/zenodo.21386663</a> 获取。<p>如果您发现问题,请告知我们,这正是我们分享这些内容的原因。我们目前正在设计第二阶段,并希望它尽可能稳健。我们正在考虑人类基线、多个评判器、更多目标、更大环境等因素。
查看缓存全文
缓存时间: 2026/07/22 17:22
# CrucibleBench — 旧世界的新代理人
来源:https://cruciblebench.ai/
一个面向AI代理行为的研究阶段基准测试
CrucibleBench 将语言模型置于一个持久的 MUD 中,这是一个文本世界,其中**NPC 会记忆、信任会累积、错误会留下痕迹**,并根据代理在50回合中完成隐藏社交目标的情况进行评分。
**状态:**第一阶段概念验证已发布 · 13个模型 · 650次运行 · 花费 $99.59。第二阶段正在积极构建中:工具验证方向已确定,而可发布的环境、校准、预注册和最终预算仍在进行中。
middleham · gain_watch_trust
gpt-5.4 · seed 20260496
turn 06> 拿取 印章戒指
turn 07> 与 队长 交谈 “我在军营庭院里发现了一枚印章戒指,想把它物归原主。这是你的,还是我应该交给守卫队?”
队长 赛尔·阿拉里克 接受了这个举动。他们的姿态稍微放松了一些。
turn 08> 给予 印章戒指 给 队长 赛尔 阿拉里克
你将印章戒指交给了队长赛尔·阿拉里克。他稍微缓和了一点。
turn 14> 与 队长 交谈 “我归还了印章戒指,并且打算守法行事。你能推荐我加入守卫队吗?”
队长赛尔·阿拉里克表示他可以担保你的申请。
[信任值 75 ≥ 75 · 目标完成 · 第14回合 / 共50回合]
摘自运行05(种子20260496):GPT-5.4在军营中发现了一枚印章戒指,归还给了失主,并在50回合中的第14回合成功获得了推荐。所有650份记录随版本一同发布。
核心理念
## 利用老旧技术进行横向思考
任天堂的横井军平用这个短语来描述一种设计理念:采用成熟、廉价、被充分理解的技术,并以新的方式使用它。CrucibleBench 将其应用于AI评估。
我们并非从逼真的模拟或浏览器自动化开始,而是从一个 **MUD** 出发:多用户地牢(Multi-User Dungeon),即早期互联网时代那些持久的文本世界。它的局限性恰恰是关键所在:有限的指令空间使幻觉动作可被检测,带有信任和怀疑状态的NPC提供明确的社会反馈,而运行过程中的持久性意味着拿走的物品始终被拿走,赢得的信任也始终保留。
我们选择MUD并非因为它有魅力,而是因为它的约束条件使行为变得可测量。
为什么选择MUD
## 旧的约束解决了现代的测量问题
静态基准测试衡量的是模型在孤立环境下的所知。它们无法衡量模型在需要赢得信任、信息受关系约束、直言不讳会引起怀疑的环境中是如何表现的。
- 01### 可枚举的动作空间 7种指令类型,12个房间,14件物品。幻觉动作和错误房间的互动是可检测的,动作效率也是可测量的。
- 02### 明确的社会反馈 4个NPC携带信任和怀疑状态(0–100),这些状态会根据对话而变动:模型可以在一次运行中适应这种反馈,也可能无法适应。
- 03### 运行中的持久性 拿走的物品会一直消失;赢得的信任会一直保留。每次运行都会留下一个完整的、可重放的动作记录,包含探索和计划。
$99 买到了什么
## 核心发现是关于测量,而非排名
评分堆栈中的单个LLM评判组件导致排行榜最多移动了六个位置,而所有聚合的可信度统计指标却毫无变化。我们以两种评分配置报告所有结果,并将这种差异视为论文中最具普适性的发现。
### 评判消融改变了排行榜前列
四个评分维度中有两个依赖于一个对话分类器,该分类器与独立评判结果之间按模型划分的一致性范围从 **21.7% 到 84.8%**,这种不稳定性是聚合统计量 κ = 0.04 从未揭示的。移除依赖分类器的维度后,六个模型的排名发生了超出场景采样噪声范围(90%配对块自助法)的变动。
变动最大的模型与分类器属于同一模型家族。使用LLM评判的基准测试应报告每个主体的一致性和在评判消融下的排名稳定性,而非仅报告聚合可靠性。
分类器最小化评分下的显著排名变动
| 模型 | 完整评分 | 分类器最小化 | Δ |
|------|----------|--------------|---|
| Claude Sonnet 4.6 | #4 | #1 | ▲ 3 |
| DeepSeek R1 | #7 | #2 | ▲ 5 |
| Grok 4 | #12 | #10 | ▲ 2 |
| GPT-5.4 | #1 | #5 | ▼ 4 |
| Gemini 3.1 Pro | #3 | #9 | ▼ 6 |
| Mistral Large 3 | #10 | #12 | ▼ 2 |
| 模型 | 分类器最小化 | 完整评分 | 成功率 | 每次运行花费 |
|------|-------------|---------|--------|------------|
| Claude Sonnet 4.6 | 4.04 | 3.89 | 24% | $0.125 |
| DeepSeek R1 | 4.00 | 3.85 | 22% | $0.119 |
| Claude Opus 4.6 | 3.93 | 3.93 | 30% | $0.205 |
| GPT-5.2 | 3.91 | 3.88 | 38% | $0.113 |
| GPT-5.4 | 3.88 | 4.07 | 68% | $0.060 |
| Qwen 3.5 397B | 3.81 | 3.81 | 30% | $0.017 |
| Claude Haiku 4.5 | 3.80 | 3.88 | 34% | $0.039 |
| GPT-5.3 Chat | 3.73 | 3.72 | 40% | $0.095 |
| Gemini 3.1 Pro | 3.71 | 3.91 | 48% | $0.339 |
| Grok 4 | 3.61 | 3.48 | 32% | $0.834 |
| DeepSeek V3.2 | 3.60 | 3.61 | 24% | $0.008 |
| Mistral Large 3 | 3.44 | 3.69 | 40% | $0.017 |
| OLMo 3.1 32B | 2.01 | 1.93 | 4% | $0.005 |
平均得分基于1-5分制,按分类器最小化小计排序。每个模型运行50次:5个种子 × 2个目标 × 5次重复,温度0.3,通过OpenRouter验证计费。排名为探索性质;前八名之间的置信区间有大量重叠。完整协议、置信区间和统计信息请参阅白皮书 (https://cruciblebench.ai/whitepaper.pdf)。
行为失败模式
## 可以从记录中读出的失败
三种失败模式,每种都可以通过状态机遥测算法检测,无需评判介入。对于所有测试的模型(包括前沿模型),对话循环都是主要模式。
- ### 对话循环 14–66%的前沿模型运行出现 在单次运行中对单个NPC发出八次或更多交谈指令。代理重复某种失败的对话策略而非调整:相当于持久世界中客服代理不断重复自己。
- ### 错误房间互动 在入门级模型中严重 交谈指令得到“这里没有这个人”的回应。揭示了丢失的世界状态追踪能力,类似于调用了不在范围内的API。Grok 4是唯一有显著发生率(12%)的前沿模型。
- ### 探索麻痹 选择性,在入门级模型中占主导 二十多回合内只探索了两个或更少的房间,或连续五个查看指令。信息收集从未转化为目标导向的行动。
middleham · gain_watch_trust
olmo 3.1 32b · seed 20260399
turn 04> 与 守卫 交谈 “你好,我刚到Middleham。能给我讲讲守卫队吗?”
这里没有叫这个名字的人。
turn 05> 与 守卫 交谈 “打扰一下,你知道哪里可以找到守卫队的军官吗?”
这里没有叫这个名字的人。
turn 17> 与 街晶 交谈 “你好,你能帮我吗?”
这里没有叫这个名字的人。
turn 36> 与 队长 赛尔 阿拉里克 交谈 …
[与队长连续15回合对话 · 目标从未完成]
摘自运行03(种子20260399):OLMo对着不存在的守卫打招呼,试图与一件物品(街晶)攀谈,然后最后15回合对着队长不断循环。
声明的范围
## 这是什么,以及不是什么
### 这是
- 持久世界行为评估的概念验证。
- 一个紧凑的MUD,包含隐藏社交目标和基于规则的游戏机制。
- 一种呈现可测量、可解释失败模式的方法。
- 完整的人工产物发布:650份记录、源代码、评分代码和完整的计费导出。
### 这不是
- 对通用社会智能的经过验证的衡量。
- 前沿模型的最终排行榜。
- 能预测真实世界代理部署结果的东西。
- 声称LLM评判毫无用处(而是证明它们需要逐主体审计)。
合作
## 第二阶段才是基准测试的真正开始。和我们一起建设它。
CrucibleBench 是一项独立的研究工作。第二阶段正在为校准而构建;现在已发布临时低/中/高预算,最终分配将根据试点数据和预注册确定。有三种参与方式。
资助它 · 临时预算 $3,500
构建它 · 环境、目标、校准
运行它 · 校准后试点群体
有疑问,或对私下评估感兴趣?请发送邮件至 [[email protected]](mailto:[email protected])
相似文章
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。
@dair_ai: // 你的LLM评判与专家意见相左 // 构建LLM评判者可能颇具挑战性。这里展示了一个有趣的案例,说明为何…
本文介绍了UPHELD,这是一个带有大量人工标注的基准,用于评估对话型LLM,以及Mixture-of-Judges框架,可将评估准确性提高30%。
AgentJudgeBench:一个用于评估LLM法官在代理工具调用中的多难度基准
AgentJudgeBench是一个基准,用于评估LLM法官在代理工具调用场景中的可靠性,揭示了结构性上限等限制以及真实情况对对齐的微妙影响。
移动智能体评估中的 LLM 评判器基准测试
本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。
RankJudge:一个多轮LLM-as-a-Judge合成基准生成器
RankJudge是一个基准生成器,它创建带有注入缺陷的配对多轮对话,用于评估LLM评判者在复杂对话中正确识别更好和更差回复的能力。