inclusionAI/Ling-3.0-flash 权重已上架 Hugging Face —— MIT 许可、BF16 以及官方 FP8
摘要
InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。
相似文章
inclusionAI/Ling-3.0-flash · Hugging Face
inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数量124B,激活参数量5.1B,采用混合线性注意力架构(KDA+MLA)与稀疏MoE。其性能与上一代1T级模型 Ring-2.6-1T 相当或更优,同时计算效率大幅提升,并内置智能体与长上下文优化。
@NousResearch: Ling-3.0-flash,来自@AntLingAGI的新MoE模型,现已在Nous Portal上免费提供一周!拥有124B参数……
AntLingAGI发布Ling-3.0-flash,这是一款124B参数的MoE模型,其中5.1B参数为活跃参数,现已在Nous Portal上免费提供一周。它在许多基准测试中匹配甚至超越其1T旗舰模型,专为编码和工具使用等智能体工作负载而设计。
@AntLingAGI:发布 Ling-2.6-flash,104B 总参、7.4B 激活的稀疏指令模型
Ling-2.6-flash 是 104B 总参/7.4B 激活的稀疏指令模型,专为 token 效率优化,可在智能体任务中降低成本、提升吞吐。
Ling-3.0-flash 权重:SGLang 表示首日支持,vLLM 表示等开源后再支持,llama.cpp 已将 2.6 请求关闭为‘不计划’
文章详细介绍了推理引擎对 Ling-3.0-flash 模型权重的当前支持状况:SGLang 承诺首日集成,vLLM 等待开源权重,llama.cpp 缺少对 Bailing MoE 变体的转换。文章指出发布模式是先开放免费 API,然后开源,正如 Ling-2.6-flash 那样。
@mr_r0b0t: 开放权重的大好一周!inclusionAI刚刚发布了LLaDA2.2-flash100B MoE扩散LLM,专为代理打造,莱文斯坦编辑(Levenshtein E…
inclusionAI发布了LLaDA2.2-flash,一个面向代理的100B MoE扩散LLM,具有莱文斯坦编辑(Levenshtein Editing)、128K上下文和高达2.3倍的吞吐量提升,在τ²-Bench和PinchBench等代理基准测试中取得了优异成绩,采用Apache 2.0许可证。