@AlmustyFX: 混合专家模型轻量级解决方案正日益成熟。Ling-3.0-tiny 总参数规模为7.9B…
摘要
Ling-3.0-tiny 采用混合专家模型架构,总参数7.9B,但每次运行仅激活1.3B参数,从而降低计算开销,使Mac上的本地执行更加流畅。
混合专家模型轻量级解决方案正日益成熟。Ling-3.0-tiny 的总参数规模为7.9B,但实际运行时仅激活1.3B有效参数,通过128个路由专家中选择8个参与计算。这显著降低了计算开销,提供了在Mac上本地流畅运行更大容量模型的潜力,这绝对值得期待。
相似文章
@AdinaYakup: Ling 3.0 tiny a 7.9B/1.3B hybrid reasoning MoE https://huggingface.co/inclusionAI/Ling-3.0-tiny…
InclusionAI introduces Ling-3.0-tiny, a 7.9B-parameter hybrid reasoning MoE model with only 1.3B active parameters per token, optimized for efficient local and edge deployment.
Inkling-Small(4分钟阅读)
Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。
中型MoE大语言模型
用户寻求中等规模的混合专家大语言模型(MoE)推荐(最高60B参数(float8)/110B参数(mxfp4)),列出了Qwen 3.5 35B、Gemma 4 A4B和Nemotron 3 Nano,并询问除此之外还有哪些小众选择。
@nicebabycat: https://x.com/nicebabycat/status/2091726637155103126
本文详细测试了Ling-3.0-tiny模型在Apple M5芯片Mac上的本地部署与性能,展示了在无独立显卡时以47 token/s的速度运行7.9B参数模型的可行性。
@runsonai: https://x.com/runsonai/status/2079919970209681734
详细对比了新开源权重混合专家模型 Laguna-S-2.1 与 Qwen 3.6-35B-A3B,突出了Laguna更大的活跃参数数量和长期关注焦点使其在扩展任务中表现更优,尽管速度较慢。