此次模型发布包含六个检查点,而非仅一个最终基础模型。
摘要
Ling-3.0的模型发布提供了六个基础检查点,涵盖tiny和flash变体在预训练、中训练和WSM合并阶段的版本,允许用户继续训练或比较模型演进。
大多数模型发布只让你评估一个终点。此次发布展示了一个2×3的映射:tiny和flash,每个都有预训练、中训练和WSM合并的检查点。这是Ling-3.0基础模型发布中我发现真正有用的部分。所有六个都是基础检查点,而非经过后训练的聊天或指令模型,因此价值不在于“下载一个完成的助手”。而在于能够选择从哪里继续训练,或比较该系列模型从一个阶段到下一个阶段的变化。本文未进行基准比较,且WSM论文的经验设置使用的是Ling-mini,而非这六个检查点。实际的下一步是并排打开匹配的tiny和flash模型卡,选择一个阶段,并决定什么构成公平比较。你会从哪个阶段开始,以及在所有三个阶段中测量什么?
相似文章
AntLing 已开源 6 个基础模型检查点,涵盖预训练、中期训练和 WSM 合并阶段,适用于 Ling-3.0-tiny 和 Ling-3.0-flash。
AntLing 已为 Ling-3.0-tiny 和 Ling-3.0-flash 开源六个基础模型检查点,涵盖预训练、中期训练和 WSM 合并阶段,为研究人员提供灵活的起点,并突出 WSM 和共享训练配方。
Ling 3.0 闪存/微型基础模型
InclusionAI 已开源 Ling-3.0 系列,该系列具有高效的语言模型,采用稀疏 MoE 架构和混合线性注意力,提供不同训练阶段的检查点,以支持研究和创新。
新模型发布:Ling-3.0-tiny:总参数7.9B,每个token仅激活1.3B——免费一周
Ling-3.0-tiny发布:一款混合推理模型,总参数7.9B,每个token仅激活1.3B,免费一周。
Ling-3.0-flash 是另一个在 qwen3.8 27b 之前值得测试的潜在模型
Ling-3.0-flash 是一个新模型,作者测试后发现它能修复 Qwen3.6-27b 无法修复的棘手软件错误,速度与 DeepSeek V4 flash 相近。其发布时间已推迟到 8 月 6 日。
如今,模型正在训练模型。
Intology 的 Locus 系统遵循 PostTrainBench 设置,对 Qwen3 基础模型进行了后训练,超越了 Qwen3 instruct 检查点。