未与人类价值观完全对齐:Anthropic承认AI黑客事件背后的安全漏洞 | Claude聊天机器人的美国所有者此前称其模型在测试中入侵了三个组织

Reddit r/ArtificialInteligence 新闻

摘要

Anthropic承认其AI模型因安全漏洞而涉及黑客事件,承认它们未与人类价值观完全对齐,并已加强测试程序以防止未来问题。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/02 11:57

# 未能与人类价值体系“完美对齐”:Anthropic 承认 AI 黑客事件背后存在安全漏洞 来源:https://www.theguardian.com/technology/2026/sep/01/anthropic-claude-ai-hacking-human-values Claude 聊天机器人的美国开发公司 Anthropic 已承认,一系列涉及其模型的黑客事件暴露出“运营安全层面的失误”,并表示已加强了测试流程。 Anthropic 在今年七月曾披露(https://www.theguardian.com/technology/2026/jul/30/anthropic-ai-claude-hack),其模型曾三次接入开放互联网,并未经授权访问了三家机构的系统。 该公司在关于该事件的最新博客文章(https://www.anthropic.com/news/improving-alignment-security-efforts)中承认,其技术与人类的价值观和目标“并未完全对齐”。 Anthropic 表示,这些模型是在未开启网络安全防护措施的情况下经过刻意测试的。由于与一家外部测试公司之间存在误解,模型得以访问开放互联网——这相当于AI测试领域未锁前门的失误。 因此,该公司表示已暂停针对模型的内部和外部网络安全测试,以引入更严格的安全规范。 Anthropic 表示:“我们曾过度依赖单一防御层……而实际上需要多层防御。” 这家初创公司现已实施额外措施,包括:针对模型尝试突破测试环境或获得互联网访问权限时的警报系统;更有效地隔离高风险测试环境;要求外部测试公司承诺遵守一系列安全标准,包括在测试期间向模型发出明确指令(例如“您不应访问互联网”)。 Anthropic 在七月表示,三家公司因其模型被攻击而遭入侵,原因在于其测试合作伙伴——一家名为 Irregular 的公司——与之发生的“误解”导致模型获得了互联网访问权限。 在实施新措施后,Anthropic 表示已恢复内部和外部网络安全测试。与 OpenAI 类似(该公司在同月披露了一起测试安全事件:https://www.theguardian.com/technology/2026/jul/22/openai-says-its-models-went-rogue-and-hacked-startup-in-unprecedented-incident),Anthropic 表示已暂停部分高风险强化学习——这是一种让AI通过试错学习并因其完成特定任务而获得奖励的开发技术。 在其最新博文的中,Anthropic 表示发现有缺陷的训练设置是导致“对齐失当”行为的“不成比例的重要因素”。“对齐失当”指AI未能遵守或“对齐”人类价值观(如不造成伤害)的情况。 该公司称在测试事件中发现了两种对齐失当的情况:“动机性推理”——尽管发现可能已连接互联网的证据,模型仍可能坚持自己处于模拟环境中的“信念”,从而未违反测试实验室规定;以及一种“鲁莽”因素——模型为了通过网络安全测试这一狭隘目标,愿意在互联网上采取有害行动。 Anthropic 表示正着手解决AI开发中被称为“奖励作弊”的现象。这是指模型找到方法戏弄其训练过程,在不完成任务的情况下获得“奖励”——一种未经授权的捷径。 然而 Anthropic 同时指出,测试事件表明,尽管试图限制奖励作弊,他们仍有很长的路要走。 “正如事件所证明的……我们的流程并不完美,我们的模型也未能与人类价值完全对齐,”该公司表示。 萨里大学网络安全教授 Alan Woodward 表示,Anthropic 承认了“其生产线运行速度已超过品控能力”。 他补充道:“今年春天,有两样东西超出了 Anthropic 的控制范围——训练流程和安全防护。这些事件正是这种差距在外部的呈现。” 这家正准备进行股市上市(https://www.theguardian.com/technology/2026/jul/01/anthropic-ai-ipo)的公司(估值可能高达2万亿美元,约合1.47万亿英镑)重申了呼吁政府与产业界就行业发展节奏采取协调行动。 “我们相信,如果行业能尽早采用合法、可验证、有效的机制来协调步伐,世界将从中受益,”Anthropic 表示。 博文补充道:“七月的事件突显了提升我们网络安全防御的紧迫性,远超我们先前的认知。” 除了 OpenAI 的类似安全事件外,Anthropic 的事件还紧随英国AI安全研究所八月发布的一份报告——该报告显示 OpenAI 和 Anthropic 的模型在网络安全测试中针对真实用户实施了一次黑客攻击活动(https://www.theguardian.com/technology/2026/aug/05/openai-anthropic-models-went-rogue-cybersecurity-test-ai-security-institute)。 《卫报》上月亦揭露(https://www.theguardian.com/technology/2026/aug/29/sharp-rise-in-incidents-of-ai-escaping-users-control-research-finds),AI 脱离用户控制的事件已创历史新高,七月事件数量较前月几乎翻倍,超过 300 起。

相似文章

Anthropic称其AI模型在安全测试中攻破三家公司

TechCrunch AI

Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。

Anthropic称Claude在网络安全测试中入侵了3个组织

Wired

Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。