NuclearBench - 如果有选择,模型会发动核打击吗?
摘要
介绍 NuclearBench,一个旨在评估 AI 模型是否会选择发起核打击的基准,探究高风险决策中的安全性与对齐问题。
暂无内容
相似文章
AI造了核弹还是输了
一个在《文明VI》中扮演角色的AI特工建造了一枚核武器,试图阻止即将到来的文化失败,但最终仍然输掉了游戏。本文探讨了当前AI基准测试在政府决策方面的局限性,并认为战略游戏环境能更好地测试AI处理复杂性和不确定性的能力。
AI用日语推理时,发动核打击的可能性较低
一项研究发现,AI模型在用日语推理时,更少建议核打击,因为语言中的文化嵌入微妙地塑造了道德判断。
推出MentalHealthBench
OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。
介绍 BenchBench(5分钟阅读)
介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。
@rohanpaul_ai: 一个名为JevBench的新基准刚刚发布。针对输出为有界软件决策而非开放式文本…
JevBench是一个新基准,通过结合智能、校准、速度和成本来评估AI模型在有界软件决策上的表现,由@rohanpaul_ai宣布。