GLM-5.3:中国实验室如何跟上前沿步伐(11分钟阅读)

TLDR AI 模型

摘要

Z.ai的GLM-5.3模型展示了卓越的基准测试性能,超越了像Kimi K3这样的大型模型,并与前沿模型相媲美,突显了中国AI实验室在训练后效率方面的进步。

Z.ai的发布周期可能只需几天,而OpenAI或Anthropic则需要数月。尽管OpenAI和Anthropic可能拥有更好的内部模型,但这些公司往往需要数月时间才能向公众发布模型。Z.ai可能比美国同行更注重公共基准测试,但与GLM-5.3相比,它并没有过度追求基准测试优化以至于过于明显。RL产业在中国正蓬勃发展,很大程度上是由美国数据公司向中国模型实验室销售推动的。
查看原文
查看缓存全文

缓存时间: 2026/08/17 15:29

# GLM-5.3:中国实验室如何保持与前沿并进 来源:https://www.interconnects.ai/p/glm-53-how-chinese-labs-keep-stride ##### 备注:因我正在旅行,无法为本文制作语音播报。编辑——在发送邮件后,我增加了关于中国数据产业的第5点。 今日,Z.ai宣布(https://z.ai/blog/glm-5.3)推出其GLM-5.3模型,目前仅在编码计划中可用,即将开放API访问,并于两周后在Hugging Face上线(开放权重)。该模型表现卓越,分数提升幅度令人惊叹。在多项基准测试中,该模型已超越月之暗面的Kimi K3,在某些测试中甚至超越了Claude Fable 5或GPT-5.6-Sol。 [](https://substackcdn.com/image/fetch/$s_!_6Y2!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F49ade27f-0d84-40f3-840a-3c919e0bb8af_4239x2504.webp) 以下是更完整的对比: [](https://substackcdn.com/image/fetch/$s_!UnJZ!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F8cf91f6a-1a91-49b9-b220-f3324f2d90b4_1782x1558.png) 这使得该模型在代理编码基准测试中基本处于前沿水平,且参数仅约7500亿——仅为Kimi K3的三分之一!Z.ai的博文相当直接,并以一句大胆的陈述开篇: > 我们为GLM-5.3所做的仅仅是扩展后训练。 GLM-5.3与GLM-5.2采用相同的基础模型,但大幅扩展了后训练。简单来说,相较于作为预训练杰作的Kimi,Z.ai似乎在后训练方面更具优势。此版本发布后,引发了许多讨论:中国如何能保持如此强劲的追赶势头?如此小巧的模型如何能匹配美国领先的公开模型?这些结果真实吗? 最简单的解释是Z.ai非常擅长其所在领域——值得回想的是,在业内,他们研究这类模型的历史几乎比任何人都长。以下是GLM模型的简史。 - **智谱AI成立**——2019年 - **GLM**(通用语言模型)——2021年3月(https://arxiv.org/abs/2103.10360)——由**THUDM**(清华大学数据挖掘/知识工程组)发布。权重(https://huggingface.co/zai-org/glm-10b) - **GLM-130B**——2022年8月(https://arxiv.org/abs/2210.02414)——扩展版本。GLM-130B至GLM-4的技术报告(https://arxiv.org/abs/2406.12793)——权重(https://huggingface.co/THUDM/glm-130b) - **ChatGLM**——2023年3月14日(https://university.chatglm.cn/blog)——首个聊天版本。权重(https://huggingface.co/zai-org/chatglm-6b) - **ChatGLM2**——2023年6月25日(https://university.chatglm.cn/blog)——权重(https://huggingface.co/zai-org/chatglm2-6b) - **ChatGLM3**——2023年10月27日(https://arxiv.org/abs/2406.12793)——权重(https://huggingface.co/zai-org/chatglm3-6b) - **GLM-4**——2024年1月16日(https://www.zhipuai.cn/zh/news/8)——重新品牌化为仅GLM;开放权重的GLM-4-9B于六月推出。权重(https://huggingface.co/zai-org/glm-4-9b) - **GLM-5**——2026年2月11日(https://www.zhipuai.cn/zh/research/154)——最新主要版本。权重(https://huggingface.co/zai-org/GLM-5) 今年6月22日发布的GLM 5.2是一次重大事件(https://www.interconnects.ai/p/glm-52-is-the-step-change-for-open)——发布数周后,我经常从相识的AI研究人员那里听到,他们仍在使用该模型,因其速度(有些人在内部集群上部署模型以获得比公开版本更快的速度)和简洁性(作为没有回滚等功能的模型,在构建前沿AI系统时更方便)。GLM-5.2整体上经受住了炒作的考验。 我自己也曾经历类似的否定,思考“他们如何能持续做到这点?模型肯定没有看起来那么好。”美国公司在资源上拥有如此巨大的领先优势,却似乎无法拉开能力差距,这有点令人费解。常见的答案是知识蒸馏,我已就此撰文详述(https://www.interconnects.ai/p/the-distillation-panic 和 https://www.interconnects.ai/p/how-much-does-distillation-really),但我认为这不是主要因素。此外,最近有一篇论文(https://arxiv.org/abs/2608.09867)展示了从前沿模型中提取推理痕迹的简单方法——这正是中国实验室可能大规模使用的那种技术。我困惑的是,美国的实验室为何没有更快地修补这种行为;相反,他们却向政府寻求政策帮助。这在我看来不合逻辑。 Z.ai的博客直截了当,与强化学习主导的训练体系相符。他们表示使用了“更多环境、更多样化的任务,并在这些任务上投入了更多计算资源进行训练”。人们无法简单地“蒸馏”强化学习环境、大规模运行它们的基础设施或有效混合它们的算法。 那么,如果不是蒸馏,中国实验室是如何做到的?他们是否在“基准测试最大化”?对“基准测试最大化”的一个公认定义是让模型专注于测试集,导致其实际表现与纸面分数显著不同。其决定因素更多是宏观层面的,而非技术细节(是的,技术细节确实重要,但实验室之间更难区分): 1. **Z.ai的发布时间可能仅需几天,而非像OpenAI或Anthropic那样需要数月。** OpenAI和Anthropic很可能拥有远优于Z.ai和月之暗面的内部模型。然而,这些美国公司往往需要数月时间才向公众发布模型(https://www.theguardian.com/technology/2026/aug/08/openai-astra-security-concerns),这在前沿领域的采用决策中极大地抬高了中国实验室的地位。简单来说——中国实验室利用了美国实验室发布前测试的所有时间来持续提升基准测试表现(SpaceXAI可能更接近中国实验室的情况)。鉴于进展速度如此之快,这可能是中国实验室保持前沿地位的最大决定性因素。迄今为止,这对美国实验室在经济上仍是可接受的,因为它们的模型需求依然巨大。随着构建大语言模型的实验室内部模型自我改进循环的加速,如果这些反馈循环需要用户数据,这种更快的发布周期可能极大地有利于中国实验室,使其产品在下一个显著优越的模型出现、削弱其需求之前,拥有更长的生命周期。这些显然是业内许多人担忧的竞赛动态。如此多的实验室在顶尖能力范围内构建前沿模型,很难看出这种情况会在短期内减弱。 2. **是的,Z.ai可能比OpenAI或Anthropic更关注公开基准测试。** 这些基准测试,例如在人工智能分析智能指数或类似聚合平台上获得高分,对其股价有非常直接的影响。在许多方面,他们需要这样做以继续融资并维持团队士气,因为作为与美国巨头匹敌的奋斗者,这是一个极佳的故事。微妙的基准测试最大化并非源于绝望或任何类似压力。这已成为众多实验室的行业标准。许多公司的数据获取策略是购买他们落后的基准测试所需的数据。 3. **Z.ai的基准测试最大化并未到导致GLM-5.3“过拟合”的程度**(至少并非有意如此,且他们会进行检查)。目前,每个实验室都在应对扩展强化学习过程中的难题。尽管基准测试分数惊人,但Anthropic的Opus 5和Sonnet 5模型声誉褒贬不一。业内每个人都面临同样的境地,因此有些模型权重比其他更容易使用,但他们在发布博客中的基准测试分数是真实的。 4. **GLM-5.3可能比Claude Fable或GPT Sol更为专业化。** GPT-5.2发布时,在代理编码之外的领域评价不一。同时,OpenAI和Anthropic支持着拥有无数模型用例的大型企业。这是处于采用曲线早期阶段的公司的一项优势——你可以针对最有价值的用例。在后训练阶段,关注更少的内容会使得最终模型的组装变得*容易*得多。我有点夸大其词了,因为据报道,Z.ai凭借强大的本地部署业务已达到10亿美元的年经常性收入(https://www.bloomberg.com/news/articles/2026-07-17/z-ai-set-to-be-first-china-ai-firm-with-1-billion-annual-sales)。同样,旗舰GLM模型一直不具备视觉能力。仅支持文本无疑有助于Z.ai获得更具竞争力的分数,但这却是一个竞争更激烈的领域。另一方面,则是像Inkling-Small(https://thinkingmachines.ai/news/inkling-small/)这样的模型,被设计为全能模式。 5. (新增)**中国的强化学习数据产业正在兴起**。我们追踪的许多消息来源(https://seanzcai.substack.com/p/state-of-data-july-2026)和传闻都提到,中国的数据产业正在兴起——很大程度上是由美国数据公司向中国模型实验室销售驱动的。这可能表现为中国实验室购买许多与美国前沿实验室相同的强化学习环境,并更早发布下游经过强化学习的模型。我们对这一市场的规模和影响仍存在较大的不确定性,但它无疑正变得越来越重要。 6. **Z.ai是一家极其娴熟的大语言模型机构——很可能比OpenAI/Anthropic的计算效率高得多。** 这一点需要重复。这些人在他们所做的事情上非常出色。该公司与清华大学关系非常密切,而清华大学拥有许多顶尖的中国计算机科学家。这个丰富、渴求的人才库是他们成功的核心,就像任何西方同行一样。根据我对清华大学的访问。 总的来说,他们执行GLM系列模型的策略似乎非常出色。祝贺发布!权重发布后,我期待进行更多扩展测试(我倾向于使用像Fireworks或Baseten这样的美国开放权重推理服务)。 留言评论 (https://www.interconnects.ai/p/glm-53-how-chinese-labs-keep-stride/comments) 这是迈向强大网络能力在整个经济中不可避免扩散的又一步。Z.ai承认了这一点,并表示(https://x.com/Zai_org/status/2088280509474320693): > GLM-5.3是我们迄今为止在网络安全任务方面最强大的模型。它在漏洞发现、漏洞利用分析和复杂多步安全任务方面带来了显著提升。这些能力可以帮助防御者更早地识别弱点、验证风险并加速修复。它们也创造了明显的双重用途风险。因此,我们采取分阶段发布的方法。选定的合作伙伴将首先在受控环境中评估GLM-5.3。更广泛的访问和API可用性将随后推出。一旦完成必要的安全评估和发布准备,我们将发布GLM-5.3的完整模型权重。 他们继续承认,他们通过请求分类器和思维链监控(在模型对齐之上)来监控其平台上的推理。魔鬼在于细节,目前尚不清楚每个AI实验室在这一点上的执行水平如何。能力的扩散取决于最低标准。 归根结底,当真正的开放权重即将来临时,这种安全性几乎无关紧要。如果不是GLM-5.3,也会是另一个模型。具备这些能力的模型规模随时间推移正在缩小,变得更容易修改和部署(可能无需安全措施)。Z.ai做了一些正确的事情,包括推动更多漏洞发现和主动管理,但任何单个公司都远不足以独自应对这一切。 我们需要政府或行业联盟主导的工业规模指导,立即为所有软件的这一转变做好准备。

相似文章

GLM-5.2 是开放代理的一次重大变革

Hacker News Top

Z.ai 发布了 GLM-5.2,一个开放权重的 AI 模型,代表着开放代理的一次重大变革,具有强劲的基准测试表现和社区热度,使其成为唯一能与 OpenAI 和 Anthropic 的顶级封闭模型竞争的开放模型。

GLM-5.2 可能是目前最强大的纯文本开放权重大语言模型

Simon Willison's Blog

中国AI实验室Z.ai发布了GLM-5.2,这是一个拥有7530亿参数的开放权重大语言模型,支持100万token的上下文窗口,采用MIT许可证。该模型在Artificial Analysis Intelligence Index上获得最高分,并在Code Arena WebDev排行榜上排名第二。

zai-org/GLM-5.1

Hugging Face Models Trending

GLM-5.1 是一款新一代旗舰AI模型,针对代理工程进行了优化,编码能力显著增强,在SWE-Bench Pro上达到了最先进性能,并通过扩展迭代和工具使用展示了卓越的长周期任务处理能力。