开放权重AI模型正在逼近前沿水平,安全差距依然存在。
摘要
SaferAI的一份报告发现,来自中国Z.ai的开放权重模型GLM-5.2正在缩小与领先前沿模型的能力差距,但在危险的网络和生物安全测试中失败,凸显了开放权重模型日益扩大的安全差距。
SaferAI的一份新报告发现,Z.ai的开放权重模型GLM-5.2接近前沿AI能力,但缺乏关键的安全缓解措施,这再次引发担忧:强大的开放模型可能超越治理和保障措施。
查看缓存全文
缓存时间: 2026/08/04 22:47
# 开放权重AI模型正迎头赶上前沿水平,安全差距依然存在 | TechCrunch
来源:https://techcrunch.com/2026/08/04/open-weight-ai-models-are-catching-up-to-the-frontier-the-safety-gap-remains/
随着政策制定者争论如何监管日益强大的AI系统——如OpenAI的GPT\-5\.6 Sol和Anthropic的Mythos——一款中国的开放权重模型已缩小了与行业领先者之间的差距。
根据AI安全非营利组织SaferAI的一份新报告(https://www.safer-ai.org/research/glm-5-2-evaluation-report),中国Z\.ai公司的开放权重AI模型GLM\-5\.2在网络与生物能力方面仅落后OpenAI的GPT\-5\.5和Anthropic的Claude Opus 4\.7几个月。但前沿能力与安全实践之间的鸿沟正在扩大。
根据SaferAI通过Z\.ai公共API进行的评估,GLM\-5\.2在面对所有给出的攻击性网络或双重用途生物学任务时均未拒绝。相比之下,Claude Opus 4\.7“拒绝得如此一致,以至于SaferAI根本无法在其上完成CyberGym测试。”(CyberGym是一个评估网络安全能力的基准。OpenAI在上个月Hugging Face遭到入侵(https://techcrunch.com/2026/07/21/openai-says-hugging-face-was-breached-by-its-pre-release-models/)之前的评估中使用了该基准。)
这让人强烈想起一些批评者多年来的警告:开放权重AI模型可能将高能力AI交到潜在攻击者手中,而一旦权重被下载,就无法再监管他们如何使用这项技术。随着开放权重模型迅速逼近世界领先AI系统的能力,争论正从“它们能否竞争”转向“它们发布后社会如何管理风险”。
“能力的前沿并不是风险的前沿,因此我们必须同时考虑缓解措施的状况,才能恰当评估风险,”SaferAI执行董事Henry Papadatos对TechCrunch表示。
尽管Z\.ai可以对其托管的API应用安全措施,但一旦有人在自有硬件上运行权重,这些保护就变得无法强制执行——他们可以移除或修改任何安全防护、对模型进行微调,或更改系统提示词。
OpenAI和Anthropic等前沿开发者通常依赖分类器、拒绝训练和API级控制等防护措施,以限制危险的网络与生物辅助能力。
这些措施远非万无一失:越狱经常能绕过已部署模型上的防护。AI安全非营利组织Far\.ai在前沿模型(如xAI的Grok 4\.5和Google DeepMind的Gemini 3\.1 Pro)中发现了数百种通用越狱(https://leaderboard.far.ai/)——即被定义为可重复使用的密钥,能在大多数有害请求上成功。根据该报告,当攻击者组合多种操纵技术——包括角色扮演、冒充权威、伪造对话历史和后续提示词——来放大模型防御中的弱点时,越狱就会成功。
但适用于封闭模型的防护措施在开放权重模型上完全不起作用,因为后者被设计为可在任何基础设施上运行,搭配任何防护措施——或完全没有防护。
“目标显然应该是让好的能力——安全的能力——对任何人开放,然后我们尝试消除坏的能力,即使是在开源的方式下也是如此,”Papadatos说。
Papadatos提到的一种可能有帮助的技术叫作“预训练数据过滤”,即AI公司从训练数据中移除攻击性网络安全信息,然后在经过筛选的数据集上训练模型。
一些研究(https://alignment.anthropic.com/2025/pretraining-data-filtering/?utm)表明,这可以在不损害整体模型性能的情况下减少危险生物知识(https://arxiv.org/abs/2508.06601#:~:text=In%20this%20paper%2C%20we%20investigate,as%20a%20more%20tamper%2Dresistant%20safeguard。)。然而,对于网络安全而言,数据过滤的可行性要低得多。
很难训练一个擅长编码但不擅长黑客行为的通用模型。由于编码已成为AI最大的赚钱领域,开发者们在寻找限制滥用方法的同时,也面临着不断提升这些能力的压力。
正因如此,前沿开发者越来越多地依赖其他缓解措施。一种方法是有选择地限制模型提供的网络安全协助类型。例如,根据Anthropic Opus 5的系统卡(https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf),该模型可以搜索未编译源代码中的漏洞,但不能搜索编译后软件中的漏洞。理由是这会让Opus 5更难被用于攻击性目的。
其他措施包括严格的部署前安全评估、发布风险评估,以及如果系统被认为过于危险则扣留模型权重。
就GLM\-5\.2而言,SaferAI表示Z\.ai没有为该模型发布安全框架、部署前测试承诺或风险评估。TechCrunch已询问Z\.ai是否在发布前进行了内部或第三方前沿安全评估,但未收到回复。
中国领导人已越来越多地承认先进AI的风险。在上个月的世界人工智能大会上,中国国家主席习近平强调了(https://www.nytimes.com/2026/07/17/business/xi-jinping-china-ai.html?eafs_enabled=false)开放权重模型的重要性,同时强调确保AI始终处于严格的人类控制之下的必要性。
在斯坦福网络政策中心研究中国AI政策的Graham Webster告诉TechCrunch,中国有完善的法律法规来管理AI,但这些规则历来侧重于政治敏感内容、错误信息和社会稳定,而不是诸如攻击性网络能力和生物滥用等灾难性AI风险。
“美国AI思想家总体上比中国社群更关注这种存在性灾难\[观念\],”Webster说,并补充说许多中国政策研究者认为,如果真的会出现新的前沿风险,美国公司很可能会首先遇到。
“中国体制有信心他们能控制这些技术在中国境内的使用,”Webster继续说道。“在中国上网是以真实身份进行的,公司可以被追究责任,用户可以被追究责任。”
Webster推测,模型提供商用于拒绝涉及某些政治话题的同一机制,有可能被调整用来确保模型拒绝完成攻击性网络攻击,或不会产生不良生物工程结果。他补充说,由于中国公司倾向于在幕后与监管机构协调,因此很难知道他们在发布前进行了哪些内部测试。
开放权重AI的倡导者认为,发布权重对网络安全很重要,因为它能让公司防御攻击——Hugging Face曾依靠GLM\-5\.2抵御OpenAI的入侵——而且如果知道即将面临的威胁,就能更好地为未来做准备。
“帮助阻止AI驱动网络攻击的同一套系统,如今每天都能帮助防御数百万次网络攻击,同时帮助我们识别并修复漏洞,赶在攻击者利用之前,”Hugging Face首席执行官Clem Delangue本周在一篇社交媒体帖子(https://x.com/ClementDelangue/status/2083908468285620415)中表示。
Papadatos表示,这种好处往往被夸大了,而且并不意味着“我们应该开源危险的能力”。
“在我看来,关键点在于我们不应该接受危险能力被任何地方的任何人轻易获取,”他说,并强调他认为行业应该努力只让“好的能力”容易被获取。“默认情况下,攻击者采用新工具的速度快于防御者。例如,勒索软件团伙可以在一周内改变他们的方法。而医院做不到。”
*当您通过我们文章中的链接购买商品时,我们可能会赚取少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
相似文章
开放权重已跻身前沿
探讨开放权重AI模型如何进步到前沿级能力,标志着AI格局的转变。
GLM-5.2 是开放代理的一次重大变革
Z.ai 发布了 GLM-5.2,一个开放权重的 AI 模型,代表着开放代理的一次重大变革,具有强劲的基准测试表现和社区热度,使其成为唯一能与 OpenAI 和 Anthropic 的顶级封闭模型竞争的开放模型。
开源权重模型并非通过抄袭来追赶闭源模型,它们之所以胜出,是因为整个AI堆栈正在悄然模块化
本文认为,开源权重AI模型追赶闭源模型并非通过蒸馏技术,而是得益于AI堆栈的模块化——稳定的接口(Transformer架构、兼容OpenAI的推理API、智能体框架)使得创新能在整个生态系统中迅速扩散,在缩小能力差距的同时保持巨大的价格优势,最终可能导致前沿AI的商品化。
GLM-5.2 是 Artificial Analysis 上新的领先开源权重模型
智谱AI的GLM-5.2已成为Artificial Analysis Intelligence Index上新的领先开源权重模型,得分为51,超越了MiniMax-M3和DeepSeek V4 Pro等竞争对手。该模型拥有744B总参数、40B活跃参数、MIT许可证和1M上下文窗口。
Anthropic 与中文开放权重 AI 的争论
Alex Karp 认为,对企业来说,真正的 AI 安全意味着对数据和模型权重的控制,并批评 Anthropic 通过推出与客户竞争的产品来捕获下游价值的策略。文章将开放权重模型之争定位为商业问题而非安全问题。