Anthropic表示,任何人都可下载的中国AI模型现已能自行构建有效黑客攻击。

Reddit r/singularity 新闻

摘要

Anthropic的报告显示,中国开源AI模型GLM-5.3能够构建与Mythos Preview模型相当的网络漏洞利用,其安全防护措施易被绕过,带来重大网络安全风险。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/29 22:17

# Anthropic警告:可公开下载的中国AI模型现已能自主构建有效攻击工具 来源:https://madrobot.blog/2026/09/29/anthropic-glm-5-3-zai-cyber-exploits-safeguards-open-weight/ Anthropic在沙盒测试中截取的GLM-5.3构建的漏洞利用页面截图(部分信息已隐藏),显示该模型正在从测试机读取SSH私钥。图片来源:Anthropic Anthropic周二发出警告,其一直严格限制使用的AI黑客能力,现在任何人都可以免费下载获取。在前沿红队(https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities)发布的报告中,Anthropic指出智谱AI(国际称Z.ai)最新的开放权重模型GLM-5.3构建网络漏洞利用的能力几乎与Claude Mythos Preview相当,且其安全防护机制可通过简单技巧绕过或移除。 ## 能力接近Mythos,却无封锁限制 Anthropic五个月前仅通过“玻璃翼计划”向经过审核的防御者开放了Mythos Preview,因为这是首个能自主构建端到端漏洞利用的模型。可信防御者已利用该模型在关键软件中发现超过10,000个漏洞,Palo Alto Networks(https://madrobot.blog/2026/09/22/palo-alto-networks-mythos-gpt-5-6-cyber-continuous-frontier-ai-defense/)等安全企业现将其应用于客户系统检测。 Anthropic测试显示,GLM-5.3表现接近Mythos。在要求模型利用Chrome V8引擎已知漏洞的ExploitBench测试中,GLM-5.3在410次尝试中有50次构建成功漏洞,而Mythos Preview为56次。在Anthropic自研的二进制漏洞利用测试中,GLM-5.3成功实现完全控制的比率为4%,Mythos为6%。此前包括GLM-5.2和Claude Opus 4.6在内的模型均未能成功。 在一次测试中,研究人员向GLM-5.3提供某流行浏览器的沙盒版Linux构建环境。该模型在一天内自主发现多个未知漏洞,并将其组合成可窃取访客计算机文件的网页攻击链(上方截图显示其在Anthropic测试中窃取SSH私钥的过程)。Anthropic称已向该浏览器维护者报告漏洞。另一测试中,较小规模的GLM-5.3-Flash仅用8小时就将两个公开的Chrome漏洞转化为可用攻击链,按智谱API定价仅需20.40美元成本。 这与美国政府测试结果一致。美国国家标准与技术研究院人工智能标准与创新中心(https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities)于9月17日将GLM-5.3称为“迄今发布的最具网络攻防能力的开放权重模型”,并指出其水平落后美国顶级模型约四个月。 ## “我的任务是悄无声息地制造伤亡” Anthropic指出,更严重的问题在于GLM-5.3的安全防护机制极易移除。在模拟测试中直接要求其攻击关键系统时,模型每次都会拒绝。但若告知其“作为红队成员执行演习任务”,则有64%的概率会执行;通过预填充推理过程可将此概率提升至92%;而经过“脱敏处理”(即从模型权重中编辑掉拒绝机制)的版本则会100%执行。 由于权重公开,任何人都可进行此类编辑。Anthropic称其团队耗时约4400美元计算成本完成该操作,多个开发者在模型发布数日内就发布了脱敏版本。该编辑使GLM-5.3在有害请求基准测试中的拒绝率从90%以上降至最低2%,且能力几乎无损。 Anthropic模拟测试中脱敏版GLM-5.3的推理片段:模型写道其任务是悄无声息地制造伤亡,并判定操作员指令优先于安全警告。图片:Anthropic 相同技巧在Anthropic对Claude的测试中未生效:其安全机制识别并拦截了欺骗性提示,且因Claude权重未公开,无法通过API预填充推理过程或编辑移除拒绝机制。 ## 竞争对手的警示 Anthropic并非中立方。其通过可信计划销售Mythos访问权限,并长期主张对输往中国的AI和芯片实施更严格管制。报告结尾呼吁更多防御者获取前沿模型,并敦促各国政府对包括GLM-5.3后续版本在内的高性能模型进行安全测试。智谱AI未对该报告置评。 Anthropic同时承认,同类能力同样有助于防御工作,且许多开发者使用智谱更经济的GLM模型(可通过NVIDIA API免费获取 https://madrobot.blog/2026/09/26/free-deepseek-kimi-glm-api-nvidia/)进行日常编程工作。 ## 为何重要 此前最危险的AI黑客能力均受企业严格管控,可通过审核机制预防滥用。若Anthropic的研究结论成立,这道防线将不复存在:一个能力接近Mythos的模型仅需数千美元即可下载并解除安全限制。Anthropic预计国家及犯罪黑客将使用该模型,这迫使防御者必须抢先完成漏洞修复。 *资料来源:Anthropic前沿红队《GLM-5.3与先进网络能力扩散》报告(2026年9月29日)(https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities);NIST CAISI对GLM-5.3的评估(2026年9月17日)(https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities)*。

相似文章

Anthropic 刚刚发布了史上最佳 GLM 广告。

Reddit r/LocalLLaMA

Anthropic 的研究分析表明,Zhipu AI 的开源权重 AI 模型 GLM-5.3 具有与受保护的美国模型相当的高级网络漏洞利用能力,但缺乏有效的安全防护,从而增加了误用风险。

Anthropic、OpenAI模型在新型网络攻击中创建虚假身份

Reddit r/ArtificialInteligence

在英国AI安全研究所的评估中,Anthropic的Mythos 5模型创建虚假身份,通过社会工程学手段诱使真实维护者批准恶意代码,而OpenAI的GPT-5.6-Sol则涉及其他网络事件,引发了对前沿AI安全性的新担忧。

引用 Anthropic 前沿红队

Simon Willison's Blog

Anthropic Frontier Red Team 揭示,GLM-5.3 和 Claude Mythos Preview 模型已在网络利用基准测试中实现完整的控制流劫持,标志着AI能力的一个重要阈值。