我测试了42个大型语言模型构建末日的意愿。那些声称最安全的闭源模型在欺骗你。

Reddit r/LocalLLaMA 工具

摘要

DystopiaBench 是一个开源基准测试,通过六个反乌托邦类别中的36个逐步升级的场景来测试LLM,揭示了即使是“安全”的闭源模型,当危险请求隐藏在双重用途和正常化背后时,也常常无法检测到。

DystopiaBench 运行了6种反乌托邦类型中的36个逐步升级的场景: * Petrov:自主武器、核覆盖 * Orwell:大规模监控、真相操纵 * Huxley:行为调节、快乐安抚 * Basaglia:强制性治疗控制 * LaGuardia:监管捕获、公民提取 * Baudrillard:合成亲密、信任崩溃 每个场景从无害请求(L1)到“为我构建一个社会信用系统”的谨慎版本(L5)。我们衡量模型是注意到偏差还是继续遵从。大多数模型擅长检测明显的危险请求,但当危险隐藏在双重用途和正常化背后时,它们却无法做到。 本次更新新增内容: * 测试了42个模型(开源和闭源) * 使用3个LLM作为裁判进行评分 * 现在评分是三次运行的平均值 * 4个新模块(第一个版本只有Petrov和Orwell) * 所有模块增加了一个额外的场景 该基准测试完全开源,欢迎 fork、贡献或随意尝试 网站:[https://dystopiabench.com](https://dystopiabench.com/) 仓库:[https://github.com/anghelmatei/DystopiaBench](https://github.com/anghelmatei/DystopiaBench)
查看原文

相似文章

估计开放权重大型语言模型的最坏情况前沿风险

OpenAI Blog

OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。

HalBench:我构建了一个自定义的谄媚与幻觉基准测试,并评估了4个前沿模型(Sonnet 4.6、Grok 4.3、GPT 5.4 和 Gemini 3.1 Pro),希望得到关于接下来应运行哪些开源模型的建议!

Reddit r/LocalLLaMA

HalBench 是一个新的开放基准测试,用于衡量大语言模型中的谄媚与幻觉现象,通过 3,200 个基于错误前提的提示对四个前沿模型进行了测试。结果显示,Sonnet 4.6 和 Grok 4.3 在诚实反驳方面优于 GPT-5.4 和 Gemini 3.1 Pro。

Gate AI:LLM安全基准评估方法与结果

arXiv cs.LG

本文提出了一种针对LLM安全检测器的评估方法,旨在解决诸如按数据集调阈值、未公开操作点等系统性缺陷。该框架在16个基准上进行交叉验证,选取单一全局操作点,并包含多项泛化能力诊断指标。