@rohanpaul_ai: Zhipu创始人Tang Jie的精彩文章。AI扩展正在超越参数增长。“有多少参数?”正变得……
摘要
Zhipu创始人Tang Jie讨论了AI扩展如何超越参数数量,涵盖训练数据、每次前向传播的计算量以及后训练等因素,并以GLM-5.3为例。
查看缓存全文
缓存时间: 2026/08/20 15:11
智谱创始人唐杰的精彩文章。
AI的扩展正逐步超越参数规模的单纯增长。
“模型有多少参数?”正逐渐成为描述模型能力的一个薄弱指标。
如今的模型扩展拥有多个独立调节维度:参数量、训练数据规模、单次前向传播的计算量以及后训练阶段。
计算资源的最佳分配方式取决于模型需要承担的任务及其使用频率。
“总参数量似乎只在某个阈值内重要——只要足以容纳世界模型,之后的额外能力提升将来自其他维度的扩展:单次前向传播的有效深度,尤其是后训练阶段。”
“当推理被纳入优化目标,最优解会指向那些训练周期更长的小型模型。”
GLM-5.3正是唐杰的实践案例:与GLM-5.2相比,基础模型、架构设计、总参数量及激活参数量均保持不变,但通过延长一个月的长上下文场景训练与强化学习,实现了性能跃升。
jietang (@jietang): 关于扩展规律的思考
扩展,但绝非仅限参数扩展。如今每次模型发布都会引发同样的问题:参数量是多少?这个问题本身已无法独立解答。参数规模只有结合另外三个要素才有意义——数据总量、
相似文章
@rohanpaul_ai: 据The Information报道,继DeepSeek之后,智谱AI也在探索定制ASIC,因其GLM-5.2的使用量据报道增长了27倍…
智谱AI正在继DeepSeek之后探索定制ASIC,因为GLM-5.2的使用量在一周内增长了27倍,凸显了中国AI行业向大规模推理专用硬件的转变。
@kimmonismus: 天哪:智谱AI创始人(GLM-5.2)唐杰表示,我们正走在通往AGI的清晰道路上,并且“AI将开始学习什么是…
智谱AI创始人唐杰概述了AGI和AI自我意识的愿景,认为自主智能体社会、AI训练AI以及自我进化将导向意识和ASI。
全球安全辩论加剧,智谱创始人支持开源AI
全球安全辩论加剧及中国可能限制模型访问之际,智谱创始人唐杰在内部备忘录中为开源AI辩护,并公开发布GLM-5.2。
Z.ai 建造了一个千兆瓦级人工智能数据中心(3分钟阅读)
Z.ai 完成了一个完全由中国制造芯片供电的千兆瓦数据中心,扩大了用于训练其先进 GLM 模型的计算基础设施。
@0xcherry: https://x.com/0xcherry/status/2067610347633025281
本文分析智谱GLM-5.2性能飞跃的原因,认为其40B激活参数在扣除固定开销后提供更大有效容量,使RL后训练更有效;同时回顾中国AI模型发展史,指出大模型路线最终获胜。