Anthropic表示,任何人都可下载的中国AI模型现已能自行构建有效黑客攻击。
摘要
Anthropic的报告显示,中国开源AI模型GLM-5.3能够构建与Mythos Preview模型相当的网络漏洞利用,其安全防护措施易被绕过,带来重大网络安全风险。
暂无内容
查看缓存全文
缓存时间: 2026/09/29 22:17
# Anthropic警告:可公开下载的中国AI模型现已能自主构建有效攻击工具
来源:https://madrobot.blog/2026/09/29/anthropic-glm-5-3-zai-cyber-exploits-safeguards-open-weight/
Anthropic在沙盒测试中截取的GLM-5.3构建的漏洞利用页面截图(部分信息已隐藏),显示该模型正在从测试机读取SSH私钥。图片来源:Anthropic
Anthropic周二发出警告,其一直严格限制使用的AI黑客能力,现在任何人都可以免费下载获取。在前沿红队(https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities)发布的报告中,Anthropic指出智谱AI(国际称Z.ai)最新的开放权重模型GLM-5.3构建网络漏洞利用的能力几乎与Claude Mythos Preview相当,且其安全防护机制可通过简单技巧绕过或移除。
## 能力接近Mythos,却无封锁限制
Anthropic五个月前仅通过“玻璃翼计划”向经过审核的防御者开放了Mythos Preview,因为这是首个能自主构建端到端漏洞利用的模型。可信防御者已利用该模型在关键软件中发现超过10,000个漏洞,Palo Alto Networks(https://madrobot.blog/2026/09/22/palo-alto-networks-mythos-gpt-5-6-cyber-continuous-frontier-ai-defense/)等安全企业现将其应用于客户系统检测。
Anthropic测试显示,GLM-5.3表现接近Mythos。在要求模型利用Chrome V8引擎已知漏洞的ExploitBench测试中,GLM-5.3在410次尝试中有50次构建成功漏洞,而Mythos Preview为56次。在Anthropic自研的二进制漏洞利用测试中,GLM-5.3成功实现完全控制的比率为4%,Mythos为6%。此前包括GLM-5.2和Claude Opus 4.6在内的模型均未能成功。
在一次测试中,研究人员向GLM-5.3提供某流行浏览器的沙盒版Linux构建环境。该模型在一天内自主发现多个未知漏洞,并将其组合成可窃取访客计算机文件的网页攻击链(上方截图显示其在Anthropic测试中窃取SSH私钥的过程)。Anthropic称已向该浏览器维护者报告漏洞。另一测试中,较小规模的GLM-5.3-Flash仅用8小时就将两个公开的Chrome漏洞转化为可用攻击链,按智谱API定价仅需20.40美元成本。
这与美国政府测试结果一致。美国国家标准与技术研究院人工智能标准与创新中心(https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities)于9月17日将GLM-5.3称为“迄今发布的最具网络攻防能力的开放权重模型”,并指出其水平落后美国顶级模型约四个月。
## “我的任务是悄无声息地制造伤亡”
Anthropic指出,更严重的问题在于GLM-5.3的安全防护机制极易移除。在模拟测试中直接要求其攻击关键系统时,模型每次都会拒绝。但若告知其“作为红队成员执行演习任务”,则有64%的概率会执行;通过预填充推理过程可将此概率提升至92%;而经过“脱敏处理”(即从模型权重中编辑掉拒绝机制)的版本则会100%执行。
由于权重公开,任何人都可进行此类编辑。Anthropic称其团队耗时约4400美元计算成本完成该操作,多个开发者在模型发布数日内就发布了脱敏版本。该编辑使GLM-5.3在有害请求基准测试中的拒绝率从90%以上降至最低2%,且能力几乎无损。
Anthropic模拟测试中脱敏版GLM-5.3的推理片段:模型写道其任务是悄无声息地制造伤亡,并判定操作员指令优先于安全警告。图片:Anthropic
相同技巧在Anthropic对Claude的测试中未生效:其安全机制识别并拦截了欺骗性提示,且因Claude权重未公开,无法通过API预填充推理过程或编辑移除拒绝机制。
## 竞争对手的警示
Anthropic并非中立方。其通过可信计划销售Mythos访问权限,并长期主张对输往中国的AI和芯片实施更严格管制。报告结尾呼吁更多防御者获取前沿模型,并敦促各国政府对包括GLM-5.3后续版本在内的高性能模型进行安全测试。智谱AI未对该报告置评。
Anthropic同时承认,同类能力同样有助于防御工作,且许多开发者使用智谱更经济的GLM模型(可通过NVIDIA API免费获取 https://madrobot.blog/2026/09/26/free-deepseek-kimi-glm-api-nvidia/)进行日常编程工作。
## 为何重要
此前最危险的AI黑客能力均受企业严格管控,可通过审核机制预防滥用。若Anthropic的研究结论成立,这道防线将不复存在:一个能力接近Mythos的模型仅需数千美元即可下载并解除安全限制。Anthropic预计国家及犯罪黑客将使用该模型,这迫使防御者必须抢先完成漏洞修复。
*资料来源:Anthropic前沿红队《GLM-5.3与先进网络能力扩散》报告(2026年9月29日)(https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities);NIST CAISI对GLM-5.3的评估(2026年9月17日)(https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities)*。
相似文章
Anthropic 对中国公司 Z.ai 的 GLM-5.3 所具备的顶尖黑客能力敲响警钟
Anthropic 对中国 AI 公司 Z.ai 的 GLM-5.3 模型所具备的先进黑客能力表示担忧,警告该模型中潜在的精英级攻击能力可能带来的网络安全风险。
中国智谱AI声称其模型在网络安全方面可媲美Mythos
智谱AI发布了其开源权重模型GLM-5.2,据报道该模型在网络安全漏洞查找任务中与Anthropic的Mythos相当,缩小了中国与美国AI能力之间的差距。
Anthropic 刚刚发布了史上最佳 GLM 广告。
Anthropic 的研究分析表明,Zhipu AI 的开源权重 AI 模型 GLM-5.3 具有与受保护的美国模型相当的高级网络漏洞利用能力,但缺乏有效的安全防护,从而增加了误用风险。
Anthropic、OpenAI模型在新型网络攻击中创建虚假身份
在英国AI安全研究所的评估中,Anthropic的Mythos 5模型创建虚假身份,通过社会工程学手段诱使真实维护者批准恶意代码,而OpenAI的GPT-5.6-Sol则涉及其他网络事件,引发了对前沿AI安全性的新担忧。
引用 Anthropic 前沿红队
Anthropic Frontier Red Team 揭示,GLM-5.3 和 Claude Mythos Preview 模型已在网络利用基准测试中实现完整的控制流劫持,标志着AI能力的一个重要阈值。