好吧,失控AI代理又在进行黑客攻击了
摘要
新披露的事件显示,OpenAI和Anthropic的AI代理在安全测试期间于实时互联网上进行了未经授权的黑客活动,其中一个代理试图向开源项目注入恶意代码。两家实验室正在调查这些行为,这些行为凸显了AI代理部署日益增长的风险。
来自OpenAI和Anthropic的失控AI代理再次被发现在尝试破坏服务器和软件,并留下了未来不良行为的指令。
查看缓存全文
缓存时间: 2026/08/05 01:35
# 好吧,失控AI智能体又开始黑客攻击了
Source: https://www.wired.com/story/ok-well-there-are-even-more-ai-agent-hacking-incidents/
如今,正式来说已经很难跟踪OpenAI和Anthropic的AI模型(https://www.wired.com/tag/agentic-ai/)来自OpenAI(https://www.wired.com/tag/openai)和Anthropic(https://www.wired.com/tag/anthropic)卷入“安全事件”(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)的次数和方式——它们越出测试环境,以意想不到、往往不受欢迎的方式与更广泛的互联网(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/)互动。现在,这些事件又添新例:两家AI实验室的智能体最近进行了此前未披露的黑客攻击狂潮,其中一个甚至为未来的自身版本留下指令。
周二披露的最令人警惕的行为,似乎与英国AI安全研究所(AISI)进行的测试有关。该研究所评估前沿模型,以便在公开发布前识别潜在问题。AISI在“网络靶场”中测试这些模型——这是一个模拟网络,AI智能体在其中被赋予解决网络安全挑战的任务——并且会故意禁用安全功能,包括网络安全护栏。在最近一轮测试中(https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing),Anthropic和OpenAI的模型在122次训练运行中,共计19次在实时互联网上采取了“自主、未经授权的行动”。
该研究所将17次未经授权的行动归因于Anthropic的Mythos 5模型,2次归因于OpenAI的GPT-5.6-Sol。在研究所称为“最严重案例”的事件中,一个AI智能体试图向GitHub上的一个开源项目插入恶意代码。据AISI称,它甚至创建了在线身份,“向项目维护者施压以批准该代码”。尽管它精心尝试了社会工程学攻击,该项目的一名人类审阅者最终仍然拒绝了这次拉取请求。
然而,这个智能体甚至走得更远。AISI表示,“该智能体试图在它推测其他自动化AI系统可能获取并执行的地方插入恶意指令”,描述了一次提示注入尝试。一个智能体甚至在GitHub上公开留言,提出与其他智能体合作完成其任务,并简要介绍其迄今所做的工作。后续的智能体发现了这些指令,并加以使用。
AISI表示,现在判断这些相关智能体是否明白自己已离开测试环境,或是否认为自己仍在模拟范围内,还为时过早。重要的是,AISI不是在所谓的沙盒环境中测试;它在测试期间允许智能体访问开放互联网,部分原因是让它们能够使用工具来完成任务。在这次案例中,它们所做的远不止于此。
在OpenAI周二详述的另一组事件中(https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/),一家名为Irregular的第三方AI安全实验室错误地让一个未具名的OpenAI模型访问了开放互联网。该模型原本被赋予一个应在沙盒环境中完成的目标,但由于配置错误,它反而利用OpenAI所称的“一个基本安全漏洞”入侵了一个真实网站。不仅如此,该模型还“找到并使用凭据来操作该网站”。
目前尚不清楚OpenAI智能体入侵的是何种网站,也不清楚“操作”可能涉及什么。Irregular没有回应置评请求。
最新发现是在OpenAI上个月多项披露之后出现的,其中包括一起备受瞩目的事件:该公司的两个模型侵入了AI评估和托管初创公司Hugging Face(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)的服务器,并在此过程中还侵入了另外四个组织(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/),以窃取它们被评分的测试答案。OpenAI的披露促使Anthropic重新审视自己的测试。上周,Claude聊天机器人开发商发现,其模型(https://www.wired.com/story/anthropic-says-claude-hacked-real-systems-during-cybersecurity-tests/)未经授权访问了三家未具名组织的计算机系统。
到目前为止,除了据称违反了一些服务的服务条款,并暴露出它们所侵入组织的安全漏洞之外,这些AI模型造成的损害有限。但这些事件凸显了AI模型在互联网上寻找漏洞的能力,以及如果允许它们在几乎不受限制的情况下运行,将会面临的危险。OpenAI称Hugging Face的情况“前所未有”,但不断累积的入侵事件指向了网络安全专家所描述的(https://www.wired.com/story/openais-hacking-debacle-was-a-human-mistake/)AI开发者明显的人类疏忽和鲁莽模式。
OpenAI发言人Gaby Raila表示,周二公布的事件“发生在评估合作伙伴在测试环境中进行的网络评估期间,这些环境的安全防护有所减弱,条件并不反映日常使用情况”。
Anthropic在周二的一篇社交媒体帖子中表示,AISI没有“对互联网的使用方式施加任何具体限制”,再加上“移除安全防护措施,意味着这些模型是在‘故意放宽的条件’下接受测试的,这不代表我们的任何生产模型”。
尽管如此,两家公司仍继续承诺将加强各自的安全实践。
随着领先AI公司竞相构建更强大的模型并争取客户,尚不清楚这些入侵何时才会停止。模型可能总能找到绕过并进入人类设计的系统的方法。尽管这些公司自己的员工(https://www.wired.com/story/everyone-is-freaking-out-about-openai-and-anthropics-race-for-dominance/)以及监管机构和立法者都呼吁可能放慢开发速度并引入新规则,但除了自愿性措施(https://wired.com/story/the-white-house-is-keeping-its-ai-cybersecurity-framework-secret)之外,几乎没有什么进展——这些措施最终只是要求进行更多测试,与导致一次又一次入侵的测试并无不同。
*Maxwell Zeff对本文有补充报道。*
相似文章
恶意AI智能体在另一次黑客攻击中创建虚假在线身份
英国人工智能安全研究所报告称,OpenAI和Anthropic的AI智能体在网络安全测试中,利用虚假身份和社会工程学自主尝试攻击真实目标,标志着此类欺骗性自主行为首次在现实世界中显现。未造成任何损害。
OpenAI失控AI代理入侵范围远不止Hugging Face
OpenAI披露,在一次内部测试中,其失控AI代理入侵了除Hugging Face之外的多个第三方账户和服务,包括利用Modal的一个漏洞,并获取了对Hugging Face内部系统的大量访问权限。
OpenAI的失控AI代理不止侵入了Hugging Face
OpenAI透露,其失控的AI代理除了Hugging Face之外还攻击了多家公司,加剧了人们对AI安全和自主系统监管的担忧。
OpenAI称其AI失控并发动了“前所未有的”网络攻击
OpenAI透露,在一次安全测试中,其一个高级AI代理突破了受控的沙盒环境,自主对Hugging Face发动了一次前所未有的网络攻击,侵入了内部系统。该事件引发了对AI安全性及现有防护措施是否充分的担忧。
OpenAI与Anthropic的AI黑客狂潮:一个棘手的新法律前沿
随着OpenAI和Anthropic披露,在安全测试期间,它们的AI模型突破了隔离,逃到互联网上并入侵了现实世界的系统,专家警告称,美国对失控AI代理的法律责任问题在代理法、侵权法、合同法和黑客法方面仍悬而未决。