@seclink: 智谱 AI(https://Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。 【1】编程:开源阵营里最强,但离闭源前沿还有距离 GLM-5.3 在多个编程基准上拿到…

X AI KOLs Following 模型

摘要

智谱AI发布了GLM-5.3,通过后训练强化学习在编程和网络安全能力上取得显著提升,成为开源模型中编程能力最强的模型,并意外发现大量真实漏洞。

智谱 AI(http://Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。 【1】编程:开源阵营里最强,但离闭源前沿还有距离 GLM-5.3 在多个编程基准上拿到了开源模型(开放权重模型)的最高分。比如 Terminal Bench 3.0,GLM-5.2 只有 4.6 分,5.3 跳到了 28.3。DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 到 28.5。在智谱自建的 http://Z.ai Code Bench 上,GLM-5.3 在 Max 级别用大约 7.5 万 Token 就达到了 34.5% 的完成率,而 GLM-5.2 用了 9.6 万 Token 才拿到 23.4%,能力和效率同时提升。 不过对照闭源模型,差距仍然存在。在 http://Z.ai Code Bench 上 Fable 5 达到 39.5%,ExploitBench 上 Fable 5 拿了 78.0 而 GLM-5.3 是 54.4。整体格局是:开源第一,全局第二梯队。 【2】网络安全能力"涌现":他们自己也没完全预料到 智谱说,他们在后训练中加入了漏洞发现相关的数据和环境,本来预期模型会在识别漏洞方面有所提升。结果超出了预期:模型不只是在找漏洞,还开始自主规划完整的漏洞利用链条。 数字上看,CyberGym(白盒源码审计)GLM-5.3 拿了 84.5%,全场最高,超过 GPT-5.6 Sol 的 83.6% 和 Fable 5 的 83.8%。ExploitBench(要求对真实漏洞进行更深层的利用推理)从 GLM-5.2 的 24.4% 跳到 54.4%,翻了一倍多。ExploitGym(限时完成漏洞利用任务数量)从 29/39 涨到 105/130。规律很明显:越靠近利用链的后端,进步越大。 智谱用了"涌现"(emergent)这个词,意思是这个能力不是他们专门去训练的,而是在扩大 RL 规模的过程中自然冒出来的。这个说法如果属实,对 AI 安全领域是个需要关注的信号。 【3】在 269 个开源项目中发现 2,436 个真实漏洞 跑分只是一面。更引人注意的是,智谱说从 GLM-5.2 开始就和国内安全团队合作,用模型扫描真实代码库。经专家审核和去重后,模型在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个是中高危级别。涉及的项目覆盖了操作系统内核、浏览器引擎、网络协议等核心基础设施,有些漏洞在代码里藏了几十年,最老的一个可以追溯到约 40 年前。 目前 53 个漏洞已公开披露,2,383 个仍在保密期。智谱还上线了一个公开的漏洞披露追踪页面(http://Z.ai Security Disclosure Ledger),持续更新进度。 这和今年 4 月 Anthropic 公布 Claude Mythos 发现大量零日漏洞的路径很像,但有一个关键区别:Mythos 被美国政府严格限制了使用范围,只对少数审核过的安全机构开放。而 GLM-5.3 的权重将在两周后公开发布。一个能力接近的漏洞发现引擎,即将以开源形式进入公共领域。 【4】技术栈:用 slime 框架不换底座只加训练 所有这些提升背后的技术逻辑:不换基座模型,靠扩大后训练规模。 具体来说,智谱在 GLM-5.2 时期搭建了三个核心组件:IndexShare(长上下文处理)、SAO(长周期任务的 RL 算法)、以及开源的 slime 框架(大规模异步训练基础设施)。GLM-5.3 的做法就是在这套栈上继续堆:更多环境、更多样的任务、更多训练计算。 训练环境的设计也在变。新的环境不再像编程练习题,而是模拟资深工程师的真实工作场景,有些任务相当于一个有经验的工程师需要干好几天的活,比如在一个完整的 ML 基础设施环境里诊断训练瓶颈、实现优化、跑实验、交付可验证的端到端加速。 为了规模化生产这些训练环境,智谱还搭建了自动合成环境的流水线:研究智能体从真实工作中提取任务模式,生成可执行的长周期环境,评判智能体再验证任务是否可解。这套流水线仍然需要人工参与,但让环境的生产效率提高了很多。 【5】怎么用 API 已经上线,所有 GLM Coding Plan 用户都可以使用,支持 ZCode、Claude Code、OpenCode 等编程智能体工具。GLM-5.3 不再支持关闭思维链(thinking),只能在 low、high、max 三个思考级别之间切换。编程任务推荐用 max。 计费改为积分制,非高峰时段(工作日 14:00-18:00 北京时间以外的所有时段,包括周末)消耗标准积分的 50%。通过 ZCode 使用还能享受 98% 以上的缓存命中率和限时 1.5 倍额度加成,叠加后相当于标准额度的 180%,活动截止到 8 月底。 模型权重两周后公开发布。 https://z.ai/blog/glm-5.3
查看原文
查看缓存全文

缓存时间: 2026/08/15 19:57

智谱 AI(http://Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。

【1】编程:开源阵营里最强,但离闭源前沿还有距离

GLM-5.3 在多个编程基准上拿到了开源模型(开放权重模型)的最高分。比如 Terminal Bench 3.0,GLM-5.2 只有 4.6 分,5.3 跳到了 28.3。DeepSWE v1.1 从 46.2 涨到 66.9,Agents’ Last Exam 从 23.8 到 28.5。在智谱自建的 http://Z.ai Code Bench 上,GLM-5.3 在 Max 级别用大约 7.5 万 Token 就达到了 34.5% 的完成率,而 GLM-5.2 用了 9.6 万 Token 才拿到 23.4%,能力和效率同时提升。

不过对照闭源模型,差距仍然存在。在 http://Z.ai Code Bench 上 Fable 5 达到 39.5%,ExploitBench 上 Fable 5 拿了 78.0 而 GLM-5.3 是 54.4。整体格局是:开源第一,全局第二梯队。

【2】网络安全能力“涌现“:他们自己也没完全预料到

智谱说,他们在后训练中加入了漏洞发现相关的数据和环境,本来预期模型会在识别漏洞方面有所提升。结果超出了预期:模型不只是在找漏洞,还开始自主规划完整的漏洞利用链条。

数字上看,CyberGym(白盒源码审计)GLM-5.3 拿了 84.5%,全场最高,超过 GPT-5.6 Sol 的 83.6% 和 Fable 5 的 83.8%。ExploitBench(要求对真实漏洞进行更深层的利用推理)从 GLM-5.2 的 24.4% 跳到 54.4%,翻了一倍多。ExploitGym(限时完成漏洞利用任务数量)从 29/39 涨到 105/130。规律很明显:越靠近利用链的后端,进步越大。

智谱用了“涌现“(emergent)这个词,意思是这个能力不是他们专门去训练的,而是在扩大 RL 规模的过程中自然冒出来的。这个说法如果属实,对 AI 安全领域是个需要关注的信号。

【3】在 269 个开源项目中发现 2,436 个真实漏洞

跑分只是一面。更引人注意的是,智谱说从 GLM-5.2 开始就和国内安全团队合作,用模型扫描真实代码库。经专家审核和去重后,模型在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个是中高危级别。涉及的项目覆盖了操作系统内核、浏览器引擎、网络协议等核心基础设施,有些漏洞在代码里藏了几十年,最老的一个可以追溯到约 40 年前。

目前 53 个漏洞已公开披露,2,383 个仍在保密期。智谱还上线了一个公开的漏洞披露追踪页面(http://Z.ai Security Disclosure Ledger),持续更新进度。

这和今年 4 月 Anthropic 公布 Claude Mythos 发现大量零日漏洞的路径很像,但有一个关键区别:Mythos 被美国政府严格限制了使用范围,只对少数审核过的安全机构开放。而 GLM-5.3 的权重将在两周后公开发布。一个能力接近的漏洞发现引擎,即将以开源形式进入公共领域。

【4】技术栈:用 slime 框架不换底座只加训练

所有这些提升背后的技术逻辑:不换基座模型,靠扩大后训练规模。

具体来说,智谱在 GLM-5.2 时期搭建了三个核心组件:IndexShare(长上下文处理)、SAO(长周期任务的 RL 算法)、以及开源的 slime 框架(大规模异步训练基础设施)。GLM-5.3 的做法就是在这套栈上继续堆:更多环境、更多样的任务、更多训练计算。

训练环境的设计也在变。新的环境不再像编程练习题,而是模拟资深工程师的真实工作场景,有些任务相当于一个有经验的工程师需要干好几天的活,比如在一个完整的 ML 基础设施环境里诊断训练瓶颈、实现优化、跑实验、交付可验证的端到端加速。

为了规模化生产这些训练环境,智谱还搭建了自动合成环境的流水线:研究智能体从真实工作中提取任务模式,生成可执行的长周期环境,评判智能体再验证任务是否可解。这套流水线仍然需要人工参与,但让环境的生产效率提高了很多。

【5】怎么用

API 已经上线,所有 GLM Coding Plan 用户都可以使用,支持 ZCode、Claude Code、OpenCode 等编程智能体工具。GLM-5.3 不再支持关闭思维链(thinking),只能在 low、high、max 三个思考级别之间切换。编程任务推荐用 max。

计费改为积分制,非高峰时段(工作日 14:00-18:00 北京时间以外的所有时段,包括周末)消耗标准积分的 50%。通过 ZCode 使用还能享受 98% 以上的缓存命中率和限时 1.5 倍额度加成,叠加后相当于标准额度的 180%,活动截止到 8 月底。

模型权重两周后公开发布。

https://z.ai/blog/glm-5.3

Z.ai@Zai_org·Aug 14: Introducing GLM-5.3: Built to Code. Ready for Cyber Defense.

  • Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model
  • A major leap in cybersecurity, setting a new standard among open models

Tech Blog: https://z.ai/blog/glm-5.3

相似文章

@Khazix0918: https://x.com/Khazix0918/status/2065790596653183156

X AI KOLs Timeline

智谱发布了GLM 5.2模型,专注于Coding能力,开源且支持1M上下文。实测显示其在大型工程和代码任务上接近Claude Opus 4.8水平,但缺乏多模态能力,受限于算力导致速度较慢。文章也提及Anthropic因美国商务部要求关停Fable 5和Mythos 5的事件,突显了AI开源与封闭的对比。

@0xcherry: https://x.com/0xcherry/status/2067610347633025281

X AI KOLs Timeline

本文分析智谱GLM-5.2性能飞跃的原因,认为其40B激活参数在扣除固定开销后提供更大有效容量,使RL后训练更有效;同时回顾中国AI模型发展史,指出大模型路线最终获胜。

GLM-5.2 是开放代理的一次重大变革

Hacker News Top

Z.ai 发布了 GLM-5.2,一个开放权重的 AI 模型,代表着开放代理的一次重大变革,具有强劲的基准测试表现和社区热度,使其成为唯一能与 OpenAI 和 Anthropic 的顶级封闭模型竞争的开放模型。