@rohanpaul_ai: Zhipu创始人Tang Jie的精彩文章。AI扩展正在超越参数增长。“有多少参数?”正变得……

X AI KOLs Following 新闻

摘要

Zhipu创始人Tang Jie讨论了AI扩展如何超越参数数量,涵盖训练数据、每次前向传播的计算量以及后训练等因素,并以GLM-5.3为例。

Zhipu创始人Tang Jie的精彩文章。 AI扩展正在超越参数增长。 “有多少参数?”正逐渐成为描述模型能力的一种薄弱方式。 模型扩展现在有几个独立的调节因素:参数、训练数据、每次前向传播的计算量和后训练。 下一个计算单元的最佳投入位置取决于模型需要做什么以及它将被使用的频率。 “总参数似乎在一个阈值内很重要——足以容纳世界——之后,额外的能力来自其他方面的扩展:每次前向传播的有效深度,尤其是后训练。” “将推理纳入目标,最优解就会转向训练时间更长的小模型。” GLM-5.3是Tang的实施示例:与GLM-5.2具有相同的基座、架构、总参数和激活参数,但在长期环境和RL上多花了1个月时间。
查看原文
查看缓存全文

缓存时间: 2026/08/20 15:11

智谱创始人唐杰的精彩文章。

AI的扩展正逐步超越参数规模的单纯增长。

“模型有多少参数?”正逐渐成为描述模型能力的一个薄弱指标。

如今的模型扩展拥有多个独立调节维度:参数量、训练数据规模、单次前向传播的计算量以及后训练阶段。

计算资源的最佳分配方式取决于模型需要承担的任务及其使用频率。

“总参数量似乎只在某个阈值内重要——只要足以容纳世界模型,之后的额外能力提升将来自其他维度的扩展:单次前向传播的有效深度,尤其是后训练阶段。”

“当推理被纳入优化目标,最优解会指向那些训练周期更长的小型模型。”

GLM-5.3正是唐杰的实践案例:与GLM-5.2相比,基础模型、架构设计、总参数量及激活参数量均保持不变,但通过延长一个月的长上下文场景训练与强化学习,实现了性能跃升。

jietang (@jietang): 关于扩展规律的思考

扩展,但绝非仅限参数扩展。如今每次模型发布都会引发同样的问题:参数量是多少?这个问题本身已无法独立解答。参数规模只有结合另外三个要素才有意义——数据总量、

相似文章

@0xcherry: https://x.com/0xcherry/status/2067610347633025281

X AI KOLs Timeline

本文分析智谱GLM-5.2性能飞跃的原因,认为其40B激活参数在扣除固定开销后提供更大有效容量,使RL后训练更有效;同时回顾中国AI模型发展史,指出大模型路线最终获胜。