为什么缺乏新的100B-120B模型?
摘要
分析AI模型尺寸趋势,指出100-120B参数范围存在空白,近期发布主要聚焦于较小(25-35B)或较大(200B+)的模型。
GPT-OSS-120B 是该系列的首个模型,之后有 GLM-4.5-Air、Nemotron-3-Super、Qwen3.5-122B、Mistral-Small-4-119B。然而,所有这些模型至少已有3个月历史(GPT-OSS-120B 已10个月),而所有最新发布要么是25B-35B(Gemma4, Qwen3.6),要么是200B+(Step 3.5/3.7 Flash, DeepSeek-V4-Flash, MiniMax-M3, Nemotron-3-Ultra)。~120B MoE系列是否像70B/80B系列一样“消亡”了,还是说2026年下半年可能会有新发布?
相似文章
2023-2031年模型规模扩展(阅读时间21分钟)
一篇关于AI模型规模扩展趋势的分析,发布于LessWrong,时间跨度为2023年至2031年。
为什么微小模型(参数少于50M)或一群专门化的微模型在生产环境中如此罕见?
作者质疑为什么参数少于50M的微小AI模型或一群专门化的微模型在生产环境中很少被部署,推测原因可能是工具偏差或通用模型的便利性。
一个4b模型现在在网络研究上击败30b模型,原因不在于规模
来自Apodex家族的一个40亿参数开放模型在网页研究基准上优于300亿参数模型,这归因于精心构建的训练数据和自我验证技术,而非原始规模,表明AI能力发展趋向更民主化。
我们迫切需要一款80-160B的模型。统一内存设备市场需要更多模型。
作者认为,当前迫切需要80-160B参数范围的AI模型,以支持使用统一内存设备的用户(例如高内存的Apple/AMD系统),因为最近的模型对于他们的硬件来说要么太小,要么太大。
@LottoLabs: 对优秀小模型的需求非常大,看看下载量最高的Qwen模型吧,全部<9B
观察到对小AI模型的高需求,体现在Qwen系列9B参数以下模型的下载量上。