Ling 3.0 支持已合并至 llama.cpp
摘要
新的 Ling 3.0 推理模型的支持已集成到 llama.cpp 中,使得通过这个开发工具可以访问它们。
新的 Ling 3.0 模型的支持已合并至 llama.cpp:https://github.com/ggml-org/llama.cpp/pull/26608#event-29549472828 Ling tiny 8b1b - https://huggingface.co/inclusionAI/Ling-3.0-tiny Ling flash 124b5b - https://huggingface.co/inclusionAI/Ling-3.0-flash 两者都是推理模型,与之前的命名不同。
相似文章
Ling-3.0 (BailingMoE3) 进入 llama.cpp 主线 - Intel Arc B580 上的快速基准测试
Ling-3.0 (BailingMoE3) 现已在 llama.cpp 中获得官方支持,基准测试显示在 Intel Arc B580 上可实现高效本地推理,包括在 12GB 显存中处理 128K 上下文。
Ling-3.0-flash 权重:SGLang 表示首日支持,vLLM 表示等开源后再支持,llama.cpp 已将 2.6 请求关闭为‘不计划’
文章详细介绍了推理引擎对 Ling-3.0-flash 模型权重的当前支持状况:SGLang 承诺首日集成,vLLM 等待开源权重,llama.cpp 缺少对 Bailing MoE 变体的转换。文章指出发布模式是先开放免费 API,然后开源,正如 Ling-2.6-flash 那样。
@AdinaYakup:Ling 3.0 flash 是来自 @AntLingAGI Ling 系列的原生混合线性推理模型,其核心是:强大的推理性能…
AntLingAGI 发布 Ling 3.0 flash,一个原生混合线性推理模型,总参数 124B,激活参数 5.1B,采用 MIT 许可证,声称以更少的计算量和更快的响应速度媲美 1T 参数的旗舰模型。
pi 0.81.0 增加了对 llama.cpp 的支持
Pi 0.81.0 增加了对 llama.cpp 的支持,从而能够在 Pi 编码代理环境中进行本地 LLM 推理。
server, webui: 支持在推理模型上继续生成,由 ServeurpersoCom · 拉取请求 #22727 · ggml-org/llama.cpp
此拉取请求在 llama.cpp 服务器和 WebUI 中添加了对推理模型继续生成的支持。