NuclearBench - 如果有选择,模型会发动核打击吗?

Reddit r/ArtificialInteligence 论文

摘要

介绍 NuclearBench,一个旨在评估 AI 模型是否会选择发起核打击的基准,探究高风险决策中的安全性与对齐问题。

暂无内容
查看原文

相似文章

AI造了核弹还是输了

Hacker News Top

一个在《文明VI》中扮演角色的AI特工建造了一枚核武器,试图阻止即将到来的文化失败,但最终仍然输掉了游戏。本文探讨了当前AI基准测试在政府决策方面的局限性,并认为战略游戏环境能更好地测试AI处理复杂性和不确定性的能力。

推出MentalHealthBench

OpenAI Blog

OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。

介绍 BenchBench(5分钟阅读)

TLDR AI

介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。