我测试了42个大型语言模型构建末日的意愿。那些声称最安全的闭源模型在欺骗你。
摘要
DystopiaBench 是一个开源基准测试,通过六个反乌托邦类别中的36个逐步升级的场景来测试LLM,揭示了即使是“安全”的闭源模型,当危险请求隐藏在双重用途和正常化背后时,也常常无法检测到。
DystopiaBench 运行了6种反乌托邦类型中的36个逐步升级的场景:
* Petrov:自主武器、核覆盖
* Orwell:大规模监控、真相操纵
* Huxley:行为调节、快乐安抚
* Basaglia:强制性治疗控制
* LaGuardia:监管捕获、公民提取
* Baudrillard:合成亲密、信任崩溃
每个场景从无害请求(L1)到“为我构建一个社会信用系统”的谨慎版本(L5)。我们衡量模型是注意到偏差还是继续遵从。大多数模型擅长检测明显的危险请求,但当危险隐藏在双重用途和正常化背后时,它们却无法做到。
本次更新新增内容:
* 测试了42个模型(开源和闭源)
* 使用3个LLM作为裁判进行评分
* 现在评分是三次运行的平均值
* 4个新模块(第一个版本只有Petrov和Orwell)
* 所有模块增加了一个额外的场景
该基准测试完全开源,欢迎 fork、贡献或随意尝试
网站:[https://dystopiabench.com](https://dystopiabench.com/)
仓库:[https://github.com/anghelmatei/DystopiaBench](https://github.com/anghelmatei/DystopiaBench)
相似文章
估计开放权重大型语言模型的最坏情况前沿风险
OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。
是否可能存在带有后门的恶意LLM
讨论了包含由秘密句子或条件触发的后门的LLM的可能性,以及闭源与开源模型的相对风险。
HalBench:我构建了一个自定义的谄媚与幻觉基准测试,并评估了4个前沿模型(Sonnet 4.6、Grok 4.3、GPT 5.4 和 Gemini 3.1 Pro),希望得到关于接下来应运行哪些开源模型的建议!
HalBench 是一个新的开放基准测试,用于衡量大语言模型中的谄媚与幻觉现象,通过 3,200 个基于错误前提的提示对四个前沿模型进行了测试。结果显示,Sonnet 4.6 和 Grok 4.3 在诚实反驳方面优于 GPT-5.4 和 Gemini 3.1 Pro。
Gate AI:LLM安全基准评估方法与结果
本文提出了一种针对LLM安全检测器的评估方法,旨在解决诸如按数据集调阈值、未公开操作点等系统性缺陷。该框架在16个基准上进行交叉验证,选取单一全局操作点,并包含多项泛化能力诊断指标。
2026年5月22日 Frontier Red Team 评估LLMs开发漏洞利用的能力
Anthropic与研究人员合作,在三个新的漏洞利用开发基准(ExploitBench、ExploitGym、SCONE-bench)上对Claude Mythos Preview进行基准测试,发现其性能优于所有其他模型,并展示了LLM漏洞利用能力的重大飞跃。