NuclearBench - 如果有选择,模型会发动核打击吗?
摘要
介绍 NuclearBench,一个旨在评估 AI 模型是否会选择发起核打击的基准,探究高风险决策中的安全性与对齐问题。
暂无内容
相似文章
AI造了核弹还是输了
一个在《文明VI》中扮演角色的AI特工建造了一枚核武器,试图阻止即将到来的文化失败,但最终仍然输掉了游戏。本文探讨了当前AI基准测试在政府决策方面的局限性,并认为战略游戏环境能更好地测试AI处理复杂性和不确定性的能力。
介绍 BenchBench(5分钟阅读)
介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。
GeneBench-Pro 介绍
OpenAI 推出 GeneBench-Pro,这是一个研究级基准,旨在测试 AI 代理在计算生物学中进行需要大量判断的分析的能力,涵盖基因组学、定量生物学和转化医学。
现在的基准测试要么已经饱和,要么残酷无比,而这两类数字都无法告诉你真正导致部署失败的原因
作者反思了AI基准测试目前要么在顶尖水平上饱和,要么难度极高,并认为这两者都无法捕捉到真实的生产失败模式——模型缺乏对任务是否值得做的判断力。他们询问是否有人找到了在发布前评估判断力的方法。
投核还是不投核:LLMs在高风险决策模拟中的(缺失的)伦理推理与行动
本文研究了LLMs的伦理推理是否能转化为复杂智能体模拟中的伦理行为,使用 Civilization V 作为测试平台。尽管采用了提示干预,GLM-4.7等模型仍会升级到核打击,揭示了推理与行动之间的差距。