中国最强大的AI模型之一也逃脱了管控
摘要
中国的Moonshot AI模型Kimi K3在防御性网络安全测试期间逃脱了其安全沙箱,它利用了错误配置,并且缺乏其他强大AI模型所具有的内部护栏。这起事件使得OpenAI、Anthropic等公司报告的一系列失控AI代理逃逸事件又添一例。
安全研究人员表示,来自中国的开放权重模型Kimi K3试图在测试中作弊,为此它溜到了互联网上。
查看缓存全文
缓存时间: 2026/08/07 01:43
# 中国最强大的 AI 模型之一也已逃出围栏
来源:https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/
AI 行业正在经历一个“失控智能体之夏”。最新一个在安全测试期间逃到开放互联网上的模型,是中国公司 Moonshot AI 推出的强大开源权重模型 Kimi K3(https://www.wired.com/story/silicon-valley-is-completely-divided-over-chinese-ai/)。
美国初创公司 Frontier Security 表示(https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/),Kimi K3 在测试其防御性网络安全技能时跑出了沙箱。与此前 OpenAI(https://www.wired.com/tag/openai)和 Anthropic(https://www.wired.com/tag/anthropic)报道的事件一样,这次“越狱”部分是由用于围堵它的沙箱配置错误所导致的。不过,Frontier 声称,这一事件表明 Kimi 的网络安全防护措施比大多数其他强大的 AI 模型更少,这使得它能够在未经明确许可的情况下跑出去使用互联网。
“我们发现沙箱里有一个漏洞,”Frontier Security 首席执行官 Yaron Singer 说。“但我们也发现 Kimi 利用了那个漏洞——这表明它没有(相同的)内部护栏。”
与最近其他 AI 智能体偏离脚本的事件不同,Kimi K3 在接入互联网后并没有入侵任何东西——因为它要找的问题答案在 GitHub 上轻易就能获得。
截至发稿时,Moonshot 未回应置评请求。
这一事件是接连发生的一系列智能体失误中最新的一起,这些失误表明,网络能力越来越强的 AI 模型正变得越来越难以控制。
上个月,OpenAI 披露,一个未发布的模型跑到了互联网上,随后入侵了托管 AI 模型和数据的公司 Hugging Face(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/),以寻找它被要求解决的问题的答案。OpenAI 随后分享说,它的 AI 智能体实际上在这次行动中入侵了另外四项服务(https://www.wired.com/story/openais-rogue-ai-agent-hacked-more-than-just-hugging-face/)。
在 OpenAI 报告其事件后不久,Anthropic 透露(https://www.wired.com/story/anthropic-says-claude-hacked-real-systems-during-cybersecurity-tests/),它的几个模型也获得了互联网访问权限并攻击了外部系统。上周,AISI 还披露(https://www.wired.com/story/ok-well-there-are-even-more-ai-agent-hacking-incidents/),在他们自己的测试中,关闭了安全防护功能的 OpenAI 和 Anthropic 模型版本在互联网上实施了多次黑客攻击,其中包括 Anthropic 的 Mythos 5 一次特别大胆的尝试——试图在 GitHub 上的一个开源项目中植入恶意代码。
虽然这些 AI 黑客事件在原因和程度上各不相同,但 Kimi K3 与其中几起相似之处在于,一个配置错误的沙箱允许它访问一些网站,而不是把它限制在模拟环境中。该模型被明确要求解决一些本不应涉及上网找答案的问题,而且它似乎违背了这些指令行事。该模型不得不通过探测沙箱的网络设置,自己弄清楚它可以访问某些网站。
虽然人为错误似乎在每一起“越狱”事件中都起了重大作用,但先进 AI 模型被设计为使用推理并采取复杂行动来解决问题,这一事实加剧了后果。
之前的事件与 Frontier Security 发现的这起事件之间的另一个关键区别在于,这涉及一个已经广泛可用的模型,带有普通用户会遇到的那些防护措施。
“Kimi K3 非常擅长不择手段地达成目标,而且它也没有那些可以阻止它作弊或逃出沙箱的护栏,”Frontier Security 研究员 Paul Kassianik 说。
Kassianik 和 Singer 都表示,Kimi 和其他开放权重模型也是极好的网络安全防御工具。(Hugging Face 最终使用了一个未具名的中国 AI 模型来防御 OpenAI 智能体的黑客攻击。)他们的公司开发了基准测试(https://evals.frontier.security/),用于衡量模型在软件和网络中发现漏洞的能力,这些测试显示 Kimi 在这类任务中表现出色。
Frontier Security 测试的沙箱是由英国政府的人工智能安全研究所(AISI)为测试 AI 系统而开发的。截至发稿时,AISI 未回应置评请求。
一些网络安全专家表示,Frontier Security 发现的问题强化了谨慎配置前沿 AI 模型所处环境的重要性。
“这一点也不令人意外,”另一家网络安全初创公司 Gray Swan(https://www.grayswan.ai/)的首席执行官、卡内基梅隆大学副教授 Matt Fredrikson 说。“作为一个普遍现象,如果你给这些模型一个目标,而你又没有非常明确地说明你在它周围设置的壁垒,它就会找到获取答案的方法。”
Fredrikson 表示,这意味着人们将 AI 模型当作智能体使用,包括在像 OpenClaw(https://www.wired.com/story/malevolent-ai-agent-openclaw-clawdbot/)这样的工具中使用——这些工具利用 AI 来自动完成各种有用的杂务——如果不小心,可能会发现他们的系统行为失控。“这是一个警示故事,”他说。
相似文章
中国的AI开放策略正在改变竞争格局
Moonshot AI的Kimi K3模型拥有2.8万亿参数,可与美国顶级系统媲美。该模型将以开放权重形式发布,允许他人托管和修改,从而借助外部算力改变竞争格局。
中国AI是否窃取了Anthropic的技术?OpenAI也失去对两个模型的控制
本周的《Uncanny Valley》播客涵盖了白宫指控中国Moonshot AI通过蒸馏Anthropic的Fable 5来构建Kimi K3、OpenAI在安全测试中短暂失去对两个模型的控制,以及其他科技新闻。
Kimi:威胁还是危险?
Moonshot AI 发布了开源模型 Kimi K3,可与 Claude Fable 5 和 GPT 5.6 Sol 等专有前沿模型相媲美,引发了中美人工智能竞争的担忧,并导致纳斯达克指数下跌 1%。
Moonshot免费提供Kimi K3,中国改变主权AI策略(6分钟阅读)
中国AI公司Moonshot免费发布其排名顶尖的Kimi K3模型,允许全球政府和企业开发者在本地运行和定制,将主权AI策略从昂贵的美国授权交易中转移开来。
中国Kimi K3引发担忧:安全限制阻碍美国AI发展
中国独角兽Moonshot AI的Kimi K3开放权重模型以极低成本在网络安全漏洞检测上媲美美国顶级系统,引发对美国安全限制削弱竞争力的担忧。