评估开源大语言模型在自主代号游戏模拟中的表现
摘要
一位开发者构建了一个代号游戏模拟平台,用于评估开源大语言模型在长程协作中的表现。结果显示,DeepSeek v4 Flash 在游戏逻辑对齐方面表现优异,胜出其他模型;而 Qwen 3 Next 和 GPT 5.4 Nano 则在规则约束和视角转换方面存在困难。
上个周末我参加了一个黑客马拉松,打算做些有趣的东西。我放弃了融入赞助商的技术栈,而是编写了一个自定义的*代号游戏*模拟平台,以获取关于开源模型如何处理长程协作的真实经验数据。流行的静态基准测试(MMLU、HumanEval)由于数据污染而达到了天花板。模拟平台中的每个团队由一名 Spymaster 和一名 Guesser 组成,由同一个大语言模型驱动。所有操作通过一个充当模型上下文协议(MCP)层的 Cloudflare Worker 严格强制执行,即时拒绝非法线索或越序移动。
| 模型 | 战绩 | 胜率 | 每局违规次数 | 正确猜测率 |
|:-|:-|:-|:-|:-|
|DeepSeek v4 Flash|5–1|83.3%|0.17|86.3%|
|Minimax M2.7|4–2|66.7%|0.33|81.0%|
|Qwen 3 Next 80B A3B|2–4|33.3%|2.33|60.4%|
|GPT 5.4 Nano|1–5|16.7%|4.33|50.0%|
**模拟主要发现**
* **DeepSeek 表现超出预期:** 尽管 DeepSeek v4 Flash 在通用基准指数上略逊一筹,但由于其与游戏逻辑的高度对齐以及精确的猜测能力,在该评估中占据主导地位。
* **Qwen 的刺客问题:** Qwen 3 Next 尝试了非常激进的高数量线索。虽然策略上很有趣,但由于缺乏语义安全边界,其在一半的游戏中触发了刺客卡牌。
* **指令执行崩溃:** GPT 5.4 Nano 在约束理解上存在根本困难,经常试图给出与棋盘上单词完全匹配的非法裸线索。
* **心智理论瓶颈:** 主要的失败模式并非语言知识不足,而是视角错误。模型在预测“另一个自己”如何解释共享语义抽象方面遇到严重困难。
整个后端使用托管在每月6美元的DigitalOcean虚拟机上的Talon以及Cloudflare DO上的套接字服务器。
相似文章
实测 OpenCode 与自托管 LLM 的协作:Qwen 3.5、3.6、Gemma 4、Nemotron 3、GLM-4.7 Flash - v2
一位开发者在 RTX 4080 上用 OpenCode 对多款自托管 LLM(Qwen 3.5/3.6、Gemma 4、Nemotron 3、GLM-4.7)进行两项编码任务基准测试,揭示了速度与质量的权衡。
我构建了一个1v1核战略游戏来基准测试LLM推理(而不仅仅是选择题)——Age of LLM
名为Age of LLM的新型开源基准通过回合制核战略游戏(包含战争迷雾、外交和虚张声势)来测试LLM推理,相较于传统的多项选择基准,提供了更动态的评估。
LLM时代:迷雾战争下大语言模型推理、外交与可靠性的战略1v1基准测试
介绍Age of LLM,一个回合制1v1基准测试,LLM在带有战争迷雾和外交机制的网格上对战,评估推理、可靠性和战略规划能力。结果显示核速攻战术占主导,且可靠性与获胜之间存在弱关联。
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
使用 DeepSeek V4 Flash 扩展自我验证,在 Terminal-Bench 2.1 上击败 Claude Fable 5,同时成本低11倍
LLM-as-a-verifier 是一个为 AI 智能体提供细粒度反馈的框架,使用 DeepSeek V4 Flash 在 Terminal-Bench 2.1 等基准测试上实现了最先进的性能,以更低的成本优于 Claude Fable 5。