Ling 3.0 闪存/微型基础模型
摘要
InclusionAI 已开源 Ling-3.0 系列,该系列具有高效的语言模型,采用稀疏 MoE 架构和混合线性注意力,提供不同训练阶段的检查点,以支持研究和创新。
查看缓存全文
缓存时间: 2026/08/19 16:43
inclusionAI/Ling-3.0-flash-base · Hugging Face
来源:https://huggingface.co/inclusionAI/Ling-3.0-flash-base
🤗 Hugging Face (https://huggingface.co/inclusionAI) | 🤖 ModelScope (https://modelscope.cn/organization/inclusionAI) | 🐙 OpenRouter (https://openrouter.ai/inclusionai/ling-3.0-flash:free)
介绍
我们已开源 Ling-3.0 系列,这是我们迄今最高效的语言基础模型家族。为支持研究与社区驱动的创新,我们发布了训练过程中的检查点集合如下:
这些检查点对应训练过程的不同阶段:
- 预训练检查点已完成大规模预训练,但尚未进行中段训练、WSM 合并(或学习率衰减)或后训练。
- 中段训练检查点已完成中段训练,但尚未进行 WSM 合并(或学习率衰减)或后训练。
- 合并检查点在中段训练检查点基础上进行了 WSM (https://arxiv.org/abs/2507.17634) 合并(或学习率衰减),但尚未进行后训练。
发布这些检查点是为了支持持续预训练、微调和进一步研究。关于后训练模型,请参阅 Ling-3.0-tiny (https://huggingface.co/inclusionAI/Ling-3.0-tiny) 和 Ling-3.0-flash (https://huggingface.co/inclusionAI/Ling-3.0-flash)。
模型概述
核心特性
- 高度稀疏(1/64)的 MoE 架构: 包含 512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家。这使得模型具备广泛的能力,同时每个 token 仅激活 5.1B(非嵌入)参数;
- 原生混合线性注意力: Ling-3.0 系列从预训练开始便采用原生混合线性注意力架构,结合 KDA 与 Gated MLA,以实现长上下文输入的高效处理;
- 热身-稳定-合并(WSM)(https://arxiv.org/abs/2507.17634): 我们用加权检查点合并替代了传统学习率衰减。通过消除衰减阶段,我们的基础模型更适用于持续预训练和动态数据扩展,同时允许离线探索不同的衰减配置,无需为每种策略重复运行高成本实验;
- 无缝扩展: Ling-3.0-tiny-base 和 Ling-3.0-flash-base 共享相同的训练配方,使社区可以在 Ling-3.0-tiny-base 上先进行实验,然后将验证过的训练策略扩展到更大的 Ling-3.0-flash-base。
模型类型:基础模型(WSM 合并的最终检查点)
架构:混合线性 MoE
参数规模:总计 124B,激活 5.1B(非嵌入)
Transformer 层数:35 层 KDA + 7 层 Gated MLA(比例 5:1)
稠密层数量:2
路由专家数量:512
共享专家数量:1
激活专家数量:8
注意力头数:32
隐藏层大小:2560
专家中间层大小:768
稠密中间层大小:6144
词汇表大小:157,184
基础模型评估
为系统评估基础模型的能力,我们使用自建的综合基准测试套件,涵盖数学、编程、推理、多语言理解和长上下文理解等关键领域。预训练基础检查点(即 Ling-3.0-flash-base)的性能对比如下:
预期用途
推荐使用场景:
- 持续预训练
- 中段训练
- 用于领域适配的监督微调
- 偏好优化与强化学习后训练
- 蒸馏研究
- 长上下文与 MoE 系统研究
不建议直接用于:
- 直接的终端用户聊天部署
- 未经额外对齐与评估的安全关键应用
- 未经后训练和任务特定验证的生产环境
使用方法
有关微调示例,请参考我们的 ling-cookbook (https://github.com/inclusionAI/ling-cookbook/)。
常见问题
如有任何问题,请随时添加讨论。
许可证
此模型基于 MIT 许可证 发布。
相似文章
AntLing 已开源 6 个基础模型检查点,涵盖预训练、中期训练和 WSM 合并阶段,适用于 Ling-3.0-tiny 和 Ling-3.0-flash。
AntLing 已为 Ling-3.0-tiny 和 Ling-3.0-flash 开源六个基础模型检查点,涵盖预训练、中期训练和 WSM 合并阶段,为研究人员提供灵活的起点,并突出 WSM 和共享训练配方。
inclusionAI/Ling-3.0-flash · Hugging Face
inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数量124B,激活参数量5.1B,采用混合线性注意力架构(KDA+MLA)与稀疏MoE。其性能与上一代1T级模型 Ring-2.6-1T 相当或更优,同时计算效率大幅提升,并内置智能体与长上下文优化。
@NousResearch: Ling-3.0-flash,来自@AntLingAGI的新MoE模型,现已在Nous Portal上免费提供一周!拥有124B参数……
AntLingAGI发布Ling-3.0-flash,这是一款124B参数的MoE模型,其中5.1B参数为活跃参数,现已在Nous Portal上免费提供一周。它在许多基准测试中匹配甚至超越其1T旗舰模型,专为编码和工具使用等智能体工作负载而设计。
@AdinaYakup: Ling 3.0 tiny a 7.9B/1.3B hybrid reasoning MoE https://huggingface.co/inclusionAI/Ling-3.0-tiny…
InclusionAI introduces Ling-3.0-tiny, a 7.9B-parameter hybrid reasoning MoE model with only 1.3B active parameters per token, optimized for efficient local and edge deployment.
@AdinaYakup:Ling 3.0 flash 是来自 @AntLingAGI Ling 系列的原生混合线性推理模型,其核心是:强大的推理性能…
AntLingAGI 发布 Ling 3.0 flash,一个原生混合线性推理模型,总参数 124B,激活参数 5.1B,采用 MIT 许可证,声称以更少的计算量和更快的响应速度媲美 1T 参数的旗舰模型。