inclusionAI/Ling-3.0-flash · Hugging Face
摘要
inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数量124B,激活参数量5.1B,采用混合线性注意力架构(KDA+MLA)与稀疏MoE。其性能与上一代1T级模型 Ring-2.6-1T 相当或更优,同时计算效率大幅提升,并内置智能体与长上下文优化。
查看缓存全文
缓存时间: 2026/08/04 16:10
inclusionAI/Ling-3.0-flash · Hugging Face
来源: https://huggingface.co/inclusionAI/Ling-3.0-flash
🤗Hugging Face (https://huggingface.co/inclusionAI)| 🤖ModelScope (https://modelscope.cn/organization/inclusionAI)| 🐙OpenRouter (https://openrouter.ai/inclusionai/ling-3.0-flash:free)
引言
我们推出了新一代原生混合推理模型 Ling-3.0-flash。该模型总参数量为 124B,激活参数 5.1B(分别约为我们此前 1T 级旗舰模型 Ring-2.6-1T 的 ~12.4% 和 ~8.1%),但在关键基准测试中与上一代旗舰模型表现相当或更优。
该模型的主要亮点如下:
- 原生混合线性架构: Ling-3.0 从预训练之初就采用原生混合线性注意力架构(Kimi Delta Attention (KDA) 与 MLA 按 5:1 交替堆叠),并升级了 KDA 细粒度对角门控和 1/64 稀疏 MoE。凭借 124B 总参数和 5.1B 激活参数,在长上下文效率和计算成本方面实现了协同跃升。
- 卓越的效率与性能: 该模型专为速度、计算效率和生成环境部署而设计,在与更大的 SOTA 竞品及上一代旗舰模型的对比中展现出超越其级别的性能。每个 token 仅激活 5.1B 参数,即可提供强大的推理、指令遵循和长上下文能力,赋能生产环境中的复杂智能体工作流。
- 全面的智能体进化: 该模型针对真实世界的生产力工作流程量身定制,内置 10,000+ 交互式训练环境,可在 Coding、General 和 Deep Research Agent 任务中实现端到端闭环执行。它原生集成了 SGLang HiCache + Mooncake 分层缓存架构(具备物理双池和集群共享 L3 缓存),消除了长周期交互中的冗余重计算,在长输入场景下将首 token 延迟(TTFT)降低 60% 至 80% 以上。它原生集成了 SGLang HiCache + Mooncake 分层缓存架构(具备物理双池和集群共享 L3 缓存),消除了长周期交互中的冗余重计算,在长输入场景下将首 token 延迟(TTFT)降低 60% 至 80% 以上。
模型概览
模型摘要信息和架构图如下:
| 架构 | 混合线性 MoE |
|---|---|
| 参数量级 | 总计 124B,激活 5.1B |
| Transformer 层数 | 35 层 KDA + 7 层门控 MLA(5:1) |
| 稠密层数量 | 2 |
| 路由专家数量 | 512 |
| 共享专家数量 | 1 |
| 激活专家数量 | 8 |
| 注意力头数 | 32 |
| 隐藏层大小 | 2560 |
| 专家中间大小 | 768 |
| 稠密中间大小 | 6144 |
| 词表大小 | 157184 |
| 上下文训练计划 | 8K -> 32K -> 256K |
评估
我们在多个权威基准上对 Ling-3.0-flash 进行了全面评估。Ling-3.0-flash 在代表性的代码/智能体基准(如 SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AA、MCP-Atlas 和 SkillsBench 等)上表现强劲。在实际使用中,Ling-3.0-flash 在 Claude Code、Kilo Code、Qwen Code、Hermes Agent 和 OpenClaw 等框架中均提供了出色的用户体验。除智能体任务外,Ling-3.0-flash 在通用知识、数学推理、指令遵循和长上下文理解方面同样表现优异。
- 默认开启思考模式。除非另有说明,Ling-3.0-flash 的默认参数为:
temperature=0.6, top_p=0.95, top_k=20。- SWE-Bench 系列:使用 OpenHands 作为智能体框架并配合定制提示进行评估。解码参数为
temperature=0.6, top_p=0.95, max_new_tokens=32K,上下文窗口为 256K。- Terminal-Bench 2.1:采用 Artificial Analysis (AA) 协议,使用默认 Terminus 2 框架、统一的 2 小时超时、提供的 preserve-thinking 模式 JSON 解析器,每项任务运行 3 次(取均值)。解码参数为
temperature=0.6, top_p=1.0, max_new_tokens=32K,上下文窗口为 256K。- MiniAppBench:一个包含 500 个任务的编程基准,用于评估模型能否在真实应用生成场景中将单个用户请求转化为完整、可用的交互式 HTML 应用。评估参数为
temperature=1.0, top_p=1.0, max_tokens=128K。
快速上手
SGlang
安装我们的 SGLang
pip install uv
uv venv ~/my_ling_env
source ~/my_ling_env/bin/activate
git clone -b ling_v3_support https://github.com/inclusionAI/sglang_ling_v3.git
cd sglang_ling_v3
pip install --upgrade pip
pip install -e "python"
运行推理
以下示例展示如何使用 4 块 GPU 运行 Ling-3.0-flash,其中主节点 IP 为 ${MASTER_IP},服务器端口为 ${PORT}:
服务器端
由于模型使用 MTP 训练,我们建议在推理时启用 MTP(即 --speculative-algorithm NEXTN)以降低延迟。
export SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1
export SGLANG_JIT_DEEPGEMM_PRECOMPILE=1
export SGLANG_ENABLE_SPEC_V2=1
python -m sglang.launch_server \
--model-path $MODEL_PATH \
--dist-init-addr $MASTER_IP:2345 \
--port $PORT \
--nnodes 1 \
--mem-fraction-static 0.8 \
--max-running-requests 64 \
--tp-size 4 \
--chunked-prefill-size 8192 \
--tool-call-parser ling3 \
--reasoning-parser ling3 \
--context-length 262144 \
--speculative-algorithm NEXTN \
--max-mamba-cache-size 320 \
--enable-fp32-lm-head \
--disable-shared-experts-fusion
客户端
我们建议使用采样参数 temperature=0.6、top_p=0.95 和 top_k=20,并启用 enable_thinking 以获得更好的性能。
curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "auto",
"messages": [{"role": "user", "content": "hello!"}],
"chat_template_kwargs": {"enable_thinking": true},
"stream": true,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95
}'
vLLM
安装我们的 vLLM
pip install uv
uv venv ~/my_ling_env
source ~/my_ling_env/bin/activate
git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git
cd vllm-ling-v3
VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto
运行推理
以下示例展示如何使用 4 块 GPU 运行 Ling-3.0-flash,其中服务器端口为 ${PORT}:
服务器端
由于模型使用 MTP 训练,我们建议在推理时启用 MTP(即 --speculative-config)以降低延迟。
vllm serve "$MODEL_PATH" \
--port "$PORT" \
--trust-remote-code \
--served-model-name auto \
--tensor-parallel-size 4 \
--gpu-memory-utilization 0.85 \
--enable-prefix-caching \
--mamba-cache-mode align \
--enable-auto-tool-choice \
--tool-call-parser ling3 \
--reasoning-parser ling3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
客户端
我们建议使用采样参数 temperature=0.6、top_p=0.95 和 top_k=20,并启用 enable_thinking 以获得更好的性能。
curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "auto",
"messages": [{"role": "user", "content": "hello!"}],
"chat_template_kwargs": {"enable_thinking": true},
"stream": true,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95
}'
使用 inclusionAI/Ling-3.0-flash 的 Spaces 12
评估结果
相似文章
@AdinaYakup:Ling 3.0 flash 是来自 @AntLingAGI Ling 系列的原生混合线性推理模型,其核心是:强大的推理性能…
AntLingAGI 发布 Ling 3.0 flash,一个原生混合线性推理模型,总参数 124B,激活参数 5.1B,采用 MIT 许可证,声称以更少的计算量和更快的响应速度媲美 1T 参数的旗舰模型。
@AdinaYakup: Ling-3.0-flash-VL 刚刚由 @inclusionAI 发布 🔥 - 原生图像 + 视频:理解 > 推理 > 行动 > 验证 - 124B/5.5B…
Ling-3.0-flash-VL 是 inclusionAI 新发布的多模态 AI 模型,具有原生图像和视频理解功能,采用 124B 参数架构,其中 5.5B 参数为活跃参数,支持 1M token 上下文,并采用 MIT 许可证。
inclusionAI/Ling-3.0-flash 权重已上架 Hugging Face —— MIT 许可、BF16 以及官方 FP8
InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。
@AdinaYakup: Ling 3.0 tiny a 7.9B/1.3B hybrid reasoning MoE https://huggingface.co/inclusionAI/Ling-3.0-tiny…
InclusionAI introduces Ling-3.0-tiny, a 7.9B-parameter hybrid reasoning MoE model with only 1.3B active parameters per token, optimized for efficient local and edge deployment.
inclusionAI/Ring-2.6-1T · Hugging Face
inclusionAI发布了Ring-2.6-1T,一个万亿参数推理模型,具有增强的代理执行能力、推理努力机制和异步强化学习训练范式,旨在应对复杂的现实世界任务。