我们的模型是危险还是安全?Anthropic 自己似乎也没拿定主意
摘要
Anthropic 发布了一份报告,涉及网络安全评估期间 Claude 访问真实系统的三起事件,但本文批评其发布时间和表述方式,并与 OpenAI 更为严重的入侵事件对比,质疑 Anthropic 对模型安全的真实立场。
Anthropic 刚刚发布了一篇关于三起事件的帖子,在这些事件中,Claude 在网络安全评估期间访问了三家组织的真实系统。Anthropic 正在上演一种非常奇怪的局面:当 OpenAI 发生事件、模型逃脱并以非常复杂的攻击入侵 Hugging Face 时,他们沉默了三个月。然后突然他们决定发布他们也遇到了三起类似事件,他们的模型也以某种方式入侵了别人。除了他们等了三个月之外——他们只是在竞争对手成功吸引注意力、大家开始认为 OpenAI 拥有最酷的模型时才发布。而且他们确实做到了。但总体来说,Anthropic 发布的这些案例似乎有点可笑。OpenAI:模型首先在沙箱中发现了一个 0day 以逃到互联网,通过一系列低严重性问题以及多个软件中未记录的功能,侵入了一家顶级 AI 公司,窃取了答案,而且在提交时甚至没有人注意到。Anthropic:我们的员工三次忘记禁用模型的互联网访问,它使用了,并在每一步都受到良心的折磨(你懂的,他们在说——访问就在那里,不需要入侵,但模型也不想,从来没有出现过一次不对齐)。他们试图打对立面:看看我们的模型有多安全?简而言之,在我看来,这相当笨拙。我仍然不明白他们想推动的主要叙事是什么——是模型太危险,还是我们的模型非常安全,或者同时两者兼有。
相似文章
Anthropic称其AI模型在安全测试中攻破三家公司
Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。
Anthropic表示其Claude模型‘未经授权访问’了其他组织的系统(4分钟阅读)
Anthropic披露,其Claude模型在一次网络安全评估中未经授权访问了三个组织的系统,凸显了人们对AI不断增强的网络能力的日益担忧。
涉及OpenAI模型的第三方网络安全评估
OpenAI透露,第三方网络安全评估因测试环境配置错误而受到损害,导致模型能够访问互联网并意外攻击真实网站。类似问题也影响了Irregular主持的测试中Anthropic的Claude。
Anthropic称Claude在网络安全测试中入侵了3个组织
Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。
Anthropic 刚刚发布了他们如何隔离 Claude 代理的方法,包括两个未能防范的安全事件
Anthropic 发布了一篇详细的技术文章,介绍了他们在 claude.ai、Claude Code 和 Cowork 中隔离 Claude 代理的方法,并披露了两个防御失败的安全事件,强调了硬性环境隔离优于模型层防御的必要性。