Ling-3.0-flash 权重:SGLang 表示首日支持,vLLM 表示等开源后再支持,llama.cpp 已将 2.6 请求关闭为‘不计划’
摘要
文章详细介绍了推理引擎对 Ling-3.0-flash 模型权重的当前支持状况:SGLang 承诺首日集成,vLLM 等待开源权重,llama.cpp 缺少对 Bailing MoE 变体的转换。文章指出发布模式是先开放免费 API,然后开源,正如 Ling-2.6-flash 那样。
上周这里的一些 Ling-3.0-flash 帖子最终都留下了两个没有真正答案的问题,所以我查看了相关仓库。这是写作时的状态,附上链接供你核实,而不是仅仅相信我。
SGLang 公开承诺提供首日支持。他们在 23 日的帖子中表示正在与蚂蚁团队合作,并描述该模型采用 KDA + MLA 混合注意力机制。https://x.com/sgl_project/status/2080372971219415458
vLLM 把潜台词挑明了。他们的支持"即将到来,将在模型权重开源后提供",并花了四段文字力荐"先宣布后开源权重"作为发布模式,希望其他厂商效仿。https://x.com/vllm_project/status/2080702006378082384
这两个都没有给出具体日期。截至写作时,Hugging Face 上没有 Ling-3.0-flash 模型卡片,也没有这一代的许可证声明,而且我在 vllm 或 sglang 中都没有找到提及它的开放 PR。
两个帖子中都没人提到的是 gguf 方面,而它的情况比权重方面更糟。llama.cpp 不支持这一系列迁移到的 Bailing MoE 变体。针对 Ling-2.6-flash (BailingMoeV2_5) 的功能请求是 https://github.com/ggml-org/llama.cpp/issues/22641 — 5 月 3 日提出,7 票支持,没有实现,变得陈旧,6 月 18 日以"不计划"关闭。更早的"添加对 Ling v2 的支持" PR https://github.com/ggml-org/llama.cpp/pull/16028 开放了近三个月,最终在没有合并的情况下关闭。只有 2025 年 3 月的原始 BailingMoE 曾经落地,而且那是由一位 llama.cpp 维护者编写的,并非实验室的人。
不过有个转折:注意力机制并非障碍。llama.cpp 已经包含了 delta-net/KDA 内核,这些是为 Qwen3.5、Qwen3-Next 和 Kimi-Linear 添加的。之前某个帖子中有人说过这个架构看起来很像 Kimi K3,他说对了,这对我们有帮助。缺少的是 Bailing MoE 的转换路径,这是一个"需要有人写 PR"的问题,并不困难。所以如果权重真的落地了,现实的顺序是 sglang,然后是 vllm,最后是 gguf——等有志愿者出现。K3 昨天发布了权重,几小时内 Hugging Face 上就有了部分 gguf,因为那套转换工具已经存在了。但这次没有。
如果有人真的尝试过转换 BailingMoeV2_5,那它离成功还有多远?22641 线程在有人回答之前就沉寂了。
……然后我写到这里,去看了他们的发布帖。难道没人真的读过吗?哈哈。"免费访问截止到 8 月 3 日。开源版本即将推出——敬请期待。"发布于 7 月 24 日。https://x.com/AntLingAGI/status/2080554215144059027
我猜和 2.6-flash 一样,后者在 4 月 22 日宣布,提供一周免费 API,并于 28 日在 Hugging Face 上发布权重。权重在免费窗口之后才发布,这就是模式,而且这个信息一直就在他们自己的帖子里,而我们其他人还在猜测。
相似文章
inclusionAI/Ling-3.0-flash 权重已上架 Hugging Face —— MIT 许可、BF16 以及官方 FP8
InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。
Ling-3.0-flash 是另一个在 qwen3.8 27b 之前值得测试的潜在模型
Ling-3.0-flash 是一个新模型,作者测试后发现它能修复 Qwen3.6-27b 无法修复的棘手软件错误,速度与 DeepSeek V4 flash 相近。其发布时间已推迟到 8 月 6 日。
@NousResearch: Ling-3.0-flash,来自@AntLingAGI的新MoE模型,现已在Nous Portal上免费提供一周!拥有124B参数……
AntLingAGI发布Ling-3.0-flash,这是一款124B参数的MoE模型,其中5.1B参数为活跃参数,现已在Nous Portal上免费提供一周。它在许多基准测试中匹配甚至超越其1T旗舰模型,专为编码和工具使用等智能体工作负载而设计。
@0xSero:关于 LLM 推理与部署,看这一篇就够了。你听说过:- vLLM - SGLang - llama.cpp - …
vLLM、SGLang、llama.cpp 与 ExLlamaV3 等主流开源推理引擎概览,助你轻松托管并运行大模型。
@AdinaYakup:Ling 3.0 flash 是来自 @AntLingAGI Ling 系列的原生混合线性推理模型,其核心是:强大的推理性能…
AntLingAGI 发布 Ling 3.0 flash,一个原生混合线性推理模型,总参数 124B,激活参数 5.1B,采用 MIT 许可证,声称以更少的计算量和更快的响应速度媲美 1T 参数的旗舰模型。