标签
Anthropic 在其 Responsible Scaling Policy 下发布了第二份 Risk Report,详细说明了其 AI 系统的风险以及公司应对此风险的准备情况。
Anthropic 近期提交的 IPO 文件以及一份呼吁暂停 AI 开发的安全论文,暴露了商业增长与安全承诺之间的紧张关系,并引发疑问:随着公司上市,谁有权减缓或停止模型训练?
本文介绍了「不的系统」作为评估通用人工智能的框架,强调区分、拒绝和管辖权而非模仿人类。它以 Anthropic 的 Claude Mythos 为例,突显先进 AI 的双重用途风险——能力跨越到后果,并批评当前安全政策可能成为虚假治理。