inclusionAI/Ling-3.0-flash 权重已上架 Hugging Face —— MIT 许可、BF16 以及官方 FP8

Reddit r/LocalLLaMA 模型

摘要

InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。

就在最后几分钟公开了,两个仓库都没设门禁。Ling-3.0-flash,BF16,24 个分片,约 255GB;Ling-3.0-flash-fp8,官方 FP8,约 128GB。总参数 127.5B,他们标称激活参数 5.1B。config.json 里最让我注意的是 512 个专家、每个 token 激活 8 个,这比这里发布的大多数模型都要细粒度得多。架构是 BailingMoeV3,model_type 为 bailing_hybrid,使用 custom_code,因此与 Ling-2.6-flash 同属一个家族。思考模式是聊天模板中的一个按请求开关,而不是单独的 SKU,并且默认开启。FP8 版本约 128GB 是我最关心的部分。上周这个帖子里有人猜测 Q8_0 大约是 135GB,结果还真差不多,只不过这个是官方版,而不是社区量化版,所以对于拥有大统一内存机器或多 GPU 设备的人来说,直接下载即可。有人知道 llama.cpp 现在是否已经支持 bailing_hybrid 了,还是目前只有 vllm 和 sglang 支持?这才是真正决定我今晚要不要清磁盘空间的因素。https://huggingface.co/inclusionAI/Ling-3.0-flash
查看原文

相似文章

inclusionAI/Ling-3.0-flash · Hugging Face

Reddit r/LocalLLaMA

inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数量124B,激活参数量5.1B,采用混合线性注意力架构(KDA+MLA)与稀疏MoE。其性能与上一代1T级模型 Ring-2.6-1T 相当或更优,同时计算效率大幅提升,并内置智能体与长上下文优化。