Ling-3.0-flash 权重:SGLang 表示首日支持,vLLM 表示等开源后再支持,llama.cpp 已将 2.6 请求关闭为‘不计划’

Reddit r/LocalLLaMA 模型

摘要

文章详细介绍了推理引擎对 Ling-3.0-flash 模型权重的当前支持状况:SGLang 承诺首日集成,vLLM 等待开源权重,llama.cpp 缺少对 Bailing MoE 变体的转换。文章指出发布模式是先开放免费 API,然后开源,正如 Ling-2.6-flash 那样。

上周这里的一些 Ling-3.0-flash 帖子最终都留下了两个没有真正答案的问题,所以我查看了相关仓库。这是写作时的状态,附上链接供你核实,而不是仅仅相信我。 SGLang 公开承诺提供首日支持。他们在 23 日的帖子中表示正在与蚂蚁团队合作,并描述该模型采用 KDA + MLA 混合注意力机制。https://x.com/sgl_project/status/2080372971219415458 vLLM 把潜台词挑明了。他们的支持"即将到来,将在模型权重开源后提供",并花了四段文字力荐"先宣布后开源权重"作为发布模式,希望其他厂商效仿。https://x.com/vllm_project/status/2080702006378082384 这两个都没有给出具体日期。截至写作时,Hugging Face 上没有 Ling-3.0-flash 模型卡片,也没有这一代的许可证声明,而且我在 vllm 或 sglang 中都没有找到提及它的开放 PR。 两个帖子中都没人提到的是 gguf 方面,而它的情况比权重方面更糟。llama.cpp 不支持这一系列迁移到的 Bailing MoE 变体。针对 Ling-2.6-flash (BailingMoeV2_5) 的功能请求是 https://github.com/ggml-org/llama.cpp/issues/22641 — 5 月 3 日提出,7 票支持,没有实现,变得陈旧,6 月 18 日以"不计划"关闭。更早的"添加对 Ling v2 的支持" PR https://github.com/ggml-org/llama.cpp/pull/16028 开放了近三个月,最终在没有合并的情况下关闭。只有 2025 年 3 月的原始 BailingMoE 曾经落地,而且那是由一位 llama.cpp 维护者编写的,并非实验室的人。 不过有个转折:注意力机制并非障碍。llama.cpp 已经包含了 delta-net/KDA 内核,这些是为 Qwen3.5、Qwen3-Next 和 Kimi-Linear 添加的。之前某个帖子中有人说过这个架构看起来很像 Kimi K3,他说对了,这对我们有帮助。缺少的是 Bailing MoE 的转换路径,这是一个"需要有人写 PR"的问题,并不困难。所以如果权重真的落地了,现实的顺序是 sglang,然后是 vllm,最后是 gguf——等有志愿者出现。K3 昨天发布了权重,几小时内 Hugging Face 上就有了部分 gguf,因为那套转换工具已经存在了。但这次没有。 如果有人真的尝试过转换 BailingMoeV2_5,那它离成功还有多远?22641 线程在有人回答之前就沉寂了。 ……然后我写到这里,去看了他们的发布帖。难道没人真的读过吗?哈哈。"免费访问截止到 8 月 3 日。开源版本即将推出——敬请期待。"发布于 7 月 24 日。https://x.com/AntLingAGI/status/2080554215144059027 我猜和 2.6-flash 一样,后者在 4 月 22 日宣布,提供一周免费 API,并于 28 日在 Hugging Face 上发布权重。权重在免费窗口之后才发布,这就是模式,而且这个信息一直就在他们自己的帖子里,而我们其他人还在猜测。
查看原文

相似文章