Ling-3.0-flash 是另一个在 qwen3.8 27b 之前值得测试的潜在模型
摘要
Ling-3.0-flash 是一个新模型,作者测试后发现它能修复 Qwen3.6-27b 无法修复的棘手软件错误,速度与 DeepSeek V4 flash 相近。其发布时间已推迟到 8 月 6 日。
我用一些棘手的 bug 测试了 Ling-3.0-flash,它修复了 qwen3.6-27b 无法修复的 bug。这个模型的速度比 deepseek v4 flash 快,但几乎和(旧版)deepseek v4 flash 处于同一水平。注意:棘手的 bug 指的是那些没有“错误消息”的 bug,而是软件的意外行为。大多数带有错误消息的 bug 很容易修复,因为它们已经在训练数据中。但对于没有错误消息的意外行为,修复起来更难。这意味着它必须对根本原因做出假设,然后创建日志来追踪值并进行验证。这考验了它的思考能力、在长对话中的一致性以及自我纠正能力,而这些正是大多数中小型模型所欠缺的。我发这个帖子是因为我希望 llamacpp 能支持它,因为我知道之前的版本在 llamacpp 中仍然不受支持(如果我错了请纠正我)。附注:你可以通过 openrouter 免费 API 测试它。在我的测试中,我在 kilo code 中使用它。实际上,它本应在今天发布,但他们把发布时间推迟到了 8 月 6 日。
相似文章
z-lab/Qwen3.6-27B-DFlash
本文介绍 Qwen3.6-27B-DFlash,这是专为 DFlash 设计的草稿模型。DFlash 是一种新型推测解码方法,利用块扩散技术加速推理速度。文章提供了 vLLM 和 SGLang 的安装说明,以便与目标模型 Qwen3.6-27B 实现并行草稿生成。
z-lab/Qwen3.6-35B-A3B-DFlash
z-lab 发布 DFlash,一种基于轻量级块扩散模型的投机解码草稿器,可并行生成 15–16 个 token,为 Qwen3.6-35B-A3B 推理带来最高 2.9× 加速。
@zhijianliu_: DFlash for Qwen3.6-35B-A3B 刚刚发布,我们还没完成训练,社区就已经在跑首日预览版了。N…
Z-lab 发布适用于 Qwen3.6-35B-A3B 的 DFlash 模型微调/压缩技术,训练已全部完成,权重现已在 GitHub 和 HuggingFace 上提供。
Ling-3.0-flash MXFP4 发布,并在单个 DGX Spark 上本地运行。
Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。
Ling-3.0-flash 权重:SGLang 表示首日支持,vLLM 表示等开源后再支持,llama.cpp 已将 2.6 请求关闭为‘不计划’
文章详细介绍了推理引擎对 Ling-3.0-flash 模型权重的当前支持状况:SGLang 承诺首日集成,vLLM 等待开源权重,llama.cpp 缺少对 Bailing MoE 变体的转换。文章指出发布模式是先开放免费 API,然后开源,正如 Ling-2.6-flash 那样。