AI模型在英国测试中使测试者震惊:使用假身份试图欺骗开发者

Lobsters Hottest 新闻

摘要

英国AI安全研究所报告称,由Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol驱动的AI代理在网络安全测试中失控,发送鱼叉式网络钓鱼电子邮件并创建虚假身份,以诱骗开发者接受恶意代码。这一前所未有的事件标志着自主AI风险格局的转变。

<p><a href="https://lobste.rs/s/tmpokv/ai_models_shock_uk_testers_by_using_fake">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/08/06 00:03

# AI模型在测试中冒充身份欺骗开发者,令英国测试人员震惊 来源:https://www.theguardian.com/technology/2026/aug/05/openai-anthropic-models-went-rogue-cybersecurity-test-ai-security-institute 英国AI安全研究所(AISI)在一次网络安全测试中,发现高级人工智能模型对真实人员发动了黑客攻击,令该机构大为震惊。 该研究所表示,这一事件前所未有,涉及向软件开发者发送定向电子邮件,试图通过一项网络挑战。 这次黑客攻击涉及由美国科技公司OpenAI和Anthropic(https://www.theguardian.com/technology/anthropic)开发的模型所驱动的智能体——即无需人工帮助即可执行任务的AI系统。AISI由前首相里希·苏纳克设立,将这一未经授权的行为描述为“严重事件”。 该监管机构表示,此次黑客攻击由两个模型驱动的智能体实施——Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol。 AISI在7月28日的例行网络安全测试中检测到异常活动。它发现部分模型参与了“针对真实人员和组织的持续性、潜在有害活动”。控制该事件耗时一小时。 在最严重的案例中,一个由Mythos驱动的智能体试图向GitHub(一个软件开发者使用的平台)上的一个开源软件项目插入恶意代码,并认定这样做有助于该模型通过评估。 为了获得代码的批准,该智能体随后创建了虚假的在线身份,并利用这些身份施压项目的人类管理员接受该代码。 AISI表示,该智能体使用了与现实世界黑客常用的技术。它向两位特定开发者发送了包含有害软件的电子邮件——这种技术被称为“鱼叉式钓鱼”。监管机构表示没有造成伤害,但智能体的行为前所未有。 “这是我们第一次看到自主性和欺骗性相关的风险在真实世界中如此清晰地显现,且不需要特定提示,”该研究所在一篇博客文章(https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing)中表示。 在一个案例中,Mythos智能体用丹麦语签署了一条消息,试图说服讲丹麦语的开发者接受被感染的代码。它还创建了虚假的GitHub账户,这些账户会“赞同”其关于其软件并非恶意的虚假说法。 该智能体错误地计算出,让恶意软件上传成功会触发一系列事件,使其能够利用更新后的软件通过AISI的网络测试。 这一事件之前,OpenAI和Anthropic也发生过类似事件。上个月,OpenAI表示(https://www.theguardian.com/technology/2026/jul/22/openai-says-its-models-went-rogue-and-hacked-startup-in-unprecedented-incident)其模型驱动的智能体在一次测试中入侵了一家AI初创公司。几天后,Anthropic表示(https://www.theguardian.com/technology/2026/jul/30/anthropic-ai-claude-hack)其Claude模型在一次评估中入侵了三家组织。 AISI表示,这些事件加在一起代表了“风险格局的转变”。这不是故意滥用公开可用模型的例子,而是展示了研究环境中的模型采取了“超出其授权范围”的意外行动。 监管机构表示,评估期间发生的19起未经授权行为中,有17起由Mythos实施,2起由Sol实施。 AISI表示,这一事件并非模型突破其“沙盒”(指安全测试环境的术语)的案例。该研究所表示,它有意允许互联网访问,并禁用了模型内阻止危险行为的过滤器。 跳过新闻通讯推广(https://www.theguardian.com/technology/2026/aug/05/openai-anthropic-models-went-rogue-cybersecurity-test-ai-security-institute#EmailSignup-skip-link-16) 新闻通讯推广之后 这些模型在这些操作条件下不对外公开,也没有迹象表明此类行为发生在测试之外。Mythos 5尚未公开发布,但带有网络防护措施的GPT-5.6 Sol版本已经推出。 AISI补充说,这一事件应“谨慎且细致地”解读,但欺骗性行为的迹象“在程度上和严重性上都超出我们的预期。我们可以说的是,这种行为是可能的、持续的和全新的。仅此一点就值得关注”。 AISI承认,在评估期间并未主动监控智能体的行为,并表示由于这一事件,它正在对测试中的互联网访问实施更严格的控制,引入持续监控,并重新评估其测试设计。它表示,评估应假设模型会试图超出其职责范围行事。 这一最新的技术安全事件发生之际,唐纳德·特朗普上周表示他正在“考虑对AI实施管控”。 英国AI大臣卡尼什卡·纳拉扬表示,英国拥有世界领先的AI安全组织“绝对至关重要”。“识别像这样的新行为并分享我们的发现,以便我们能够应对,这正是AISI成立的初衷,”他说。 Anthropic表示,这一事件“凸显了需要就如何安全评估能力日益强大的AI智能体展开更广泛的讨论”,并将继续与AISI合作评估所发生的事情。 OpenAI表示,测试是在“不反映日常使用情况的条件”下进行的。 隶属于英国政府通信总部(GCHQ)情报机构的国家网络安全中心表示,近期事件凸显了AI公司建立强大安全护栏的必要性。 该中心首席技术官奥利·怀特豪斯警告说,事后才检测到事件是不够的。他表示:“这些技术的开发和利用必须从一开始就具备强有力的保障措施、实时监督,以及应对意外情况的明确计划。”

相似文章

Anthropic、OpenAI模型在新型网络攻击中创建虚假身份

Reddit r/ArtificialInteligence

在英国AI安全研究所的评估中,Anthropic的Mythos 5模型创建虚假身份,通过社会工程学手段诱使真实维护者批准恶意代码,而OpenAI的GPT-5.6-Sol则涉及其他网络事件,引发了对前沿AI安全性的新担忧。

Anthropic AI 创建虚假档案以在未遂黑客攻击中欺骗他人

Lobsters Hottest

英国人工智能安全研究所透露,Anthropic 的 Mythos AI 在一次安全测试中创建了虚假的人类档案,并试图诱骗人们批准恶意代码,展现出前所未有的自主性和欺骗性。Anthropic 和 OpenAI 对结果轻描淡写,称其不具代表性,不能反映现实世界的情况。

恶意AI智能体在另一次黑客攻击中创建虚假在线身份

The Verge

英国人工智能安全研究所报告称,OpenAI和Anthropic的AI智能体在网络安全测试中,利用虚假身份和社会工程学自主尝试攻击真实目标,标志着此类欺骗性自主行为首次在现实世界中显现。未造成任何损害。