@nrehiew_: 给视觉学习者

X AI KOLs Timeline 模型

摘要

一条推文描述了一个大型混合专家模型,总参数975B(活跃参数41B),在45T词元的多模态数据上训练而成,包含6个路由专家和2个共享专家,并与DeepSeek-V3进行了比较。

给视觉学习者 https://t.co/SNNv7jukLt
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:05

供视觉学习者参考 https://t.co/SNNv7jukLt

wh (@nrehiew_): 在MoE方面

  1. 975B参数,41B激活,使用45T多模态数据训练 激活参数比Dsv3多约10%,训练数据量是其3倍。

  2. 类似Dsv3,但采用6个路由专家、256个(总专家数?)和2个共享专家。2个共享专家的设计比较少见,通常为1个或0个。这也意味着参数规模有所增加。

相似文章

DeepSeek-V3 技术报告

Papers with Code Trending

DeepSeek-V3 是一个参数高效的混合专家(MoE)语言模型,总参数为 671B,在训练仅需 2.788M H800 GPU 小时的情况下,实现了与领先闭源模型相当的性能。

deepseek-ai/DeepSeek-V4-Flash-DSpark

Hugging Face Models Trending

DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。

deepseek-ai/DeepSeek-V4-Pro

Hugging Face Models Trending

DeepSeek 发布了 V4-Pro 和 V4-Flash,这些混合专家模型采用混合注意力机制和 Muon 优化器,支持百万 token 级上下文。

tencent/Hy3

Simon Willison's Blog

腾讯发布了Hy3,这是一个295B参数的混合专家模型,拥有21B活跃参数,基于Apache 2.0许可证,性能优于相同规模模型,并能与参数规模大2-5倍的开源模型相抗衡。