@nrehiew_: 给视觉学习者
摘要
一条推文描述了一个大型混合专家模型,总参数975B(活跃参数41B),在45T词元的多模态数据上训练而成,包含6个路由专家和2个共享专家,并与DeepSeek-V3进行了比较。
查看缓存全文
缓存时间: 2026/07/16 04:05
供视觉学习者参考 https://t.co/SNNv7jukLt
wh (@nrehiew_): 在MoE方面
975B参数,41B激活,使用45T多模态数据训练 激活参数比Dsv3多约10%,训练数据量是其3倍。
类似Dsv3,但采用6个路由专家、256个(总专家数?)和2个共享专家。2个共享专家的设计比较少见,通常为1个或0个。这也意味着参数规模有所增加。
相似文章
DeepSeek-V3 技术报告
DeepSeek-V3 是一个参数高效的混合专家(MoE)语言模型,总参数为 671B,在训练仅需 2.788M H800 GPU 小时的情况下,实现了与领先闭源模型相当的性能。
deepseek-ai/DeepSeek-V4-Flash-DSpark
DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。
@modal:DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B。结合混合压缩注意力机…
DeepSeek-V4-Flash 是一个 284B 参数的 MoE 模型,每 token 激活 13B 参数,采用混合压缩注意力机制,可降低 1M token 上下文的 KV 缓存需求。可使用 Modal 上的 SGLang 提供服务,在单个 B300 上实现快速解码。
deepseek-ai/DeepSeek-V4-Pro
DeepSeek 发布了 V4-Pro 和 V4-Flash,这些混合专家模型采用混合注意力机制和 Muon 优化器,支持百万 token 级上下文。
tencent/Hy3
腾讯发布了Hy3,这是一个295B参数的混合专家模型,拥有21B活跃参数,基于Apache 2.0许可证,性能优于相同规模模型,并能与参数规模大2-5倍的开源模型相抗衡。