此次模型发布包含六个检查点,而非仅一个最终基础模型。

Reddit r/ArtificialInteligence 模型

摘要

Ling-3.0的模型发布提供了六个基础检查点,涵盖tiny和flash变体在预训练、中训练和WSM合并阶段的版本,允许用户继续训练或比较模型演进。

大多数模型发布只让你评估一个终点。此次发布展示了一个2×3的映射:tiny和flash,每个都有预训练、中训练和WSM合并的检查点。这是Ling-3.0基础模型发布中我发现真正有用的部分。所有六个都是基础检查点,而非经过后训练的聊天或指令模型,因此价值不在于“下载一个完成的助手”。而在于能够选择从哪里继续训练,或比较该系列模型从一个阶段到下一个阶段的变化。本文未进行基准比较,且WSM论文的经验设置使用的是Ling-mini,而非这六个检查点。实际的下一步是并排打开匹配的tiny和flash模型卡,选择一个阶段,并决定什么构成公平比较。你会从哪个阶段开始,以及在所有三个阶段中测量什么?
查看原文

相似文章

Ling 3.0 闪存/微型基础模型

Reddit r/LocalLLaMA

InclusionAI 已开源 Ling-3.0 系列,该系列具有高效的语言模型,采用稀疏 MoE 架构和混合线性注意力,提供不同训练阶段的检查点,以支持研究和创新。

如今,模型正在训练模型。

Reddit r/singularity

Intology 的 Locus 系统遵循 PostTrainBench 设置,对 Qwen3 基础模型进行了后训练,超越了 Qwen3 instruct 检查点。