inclusionAI/Ling-3.0-flash · Hugging Face

Reddit r/LocalLLaMA 模型

摘要

inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数量124B,激活参数量5.1B,采用混合线性注意力架构(KDA+MLA)与稀疏MoE。其性能与上一代1T级模型 Ring-2.6-1T 相当或更优,同时计算效率大幅提升,并内置智能体与长上下文优化。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/04 16:10

inclusionAI/Ling-3.0-flash · Hugging Face

来源: https://huggingface.co/inclusionAI/Ling-3.0-flash

🤗Hugging Face (https://huggingface.co/inclusionAI)| 🤖ModelScope (https://modelscope.cn/organization/inclusionAI)| 🐙OpenRouter (https://openrouter.ai/inclusionai/ling-3.0-flash:free)

引言

我们推出了新一代原生混合推理模型 Ling-3.0-flash。该模型总参数量为 124B,激活参数 5.1B(分别约为我们此前 1T 级旗舰模型 Ring-2.6-1T 的 ~12.4% 和 ~8.1%),但在关键基准测试中与上一代旗舰模型表现相当或更优。

该模型的主要亮点如下:

  • 原生混合线性架构: Ling-3.0 从预训练之初就采用原生混合线性注意力架构(Kimi Delta Attention (KDA) 与 MLA 按 5:1 交替堆叠),并升级了 KDA 细粒度对角门控和 1/64 稀疏 MoE。凭借 124B 总参数和 5.1B 激活参数,在长上下文效率和计算成本方面实现了协同跃升。
  • 卓越的效率与性能: 该模型专为速度、计算效率和生成环境部署而设计,在与更大的 SOTA 竞品及上一代旗舰模型的对比中展现出超越其级别的性能。每个 token 仅激活 5.1B 参数,即可提供强大的推理、指令遵循和长上下文能力,赋能生产环境中的复杂智能体工作流。
  • 全面的智能体进化: 该模型针对真实世界的生产力工作流程量身定制,内置 10,000+ 交互式训练环境,可在 Coding、General 和 Deep Research Agent 任务中实现端到端闭环执行。它原生集成了 SGLang HiCache + Mooncake 分层缓存架构(具备物理双池和集群共享 L3 缓存),消除了长周期交互中的冗余重计算,在长输入场景下将首 token 延迟(TTFT)降低 60% 至 80% 以上。它原生集成了 SGLang HiCache + Mooncake 分层缓存架构(具备物理双池和集群共享 L3 缓存),消除了长周期交互中的冗余重计算,在长输入场景下将首 token 延迟(TTFT)降低 60% 至 80% 以上。

模型概览

模型摘要信息和架构图如下:

架构混合线性 MoE
参数量级总计 124B,激活 5.1B
Transformer 层数35 层 KDA + 7 层门控 MLA(5:1)
稠密层数量2
路由专家数量512
共享专家数量1
激活专家数量8
注意力头数32
隐藏层大小2560
专家中间大小768
稠密中间大小6144
词表大小157184
上下文训练计划8K -> 32K -> 256K

评估

我们在多个权威基准上对 Ling-3.0-flash 进行了全面评估。Ling-3.0-flash 在代表性的代码/智能体基准(如 SWE-Bench Pro、SWE-Bench Multilingual、Tau3-banking-AAMCP-AtlasSkillsBench 等)上表现强劲。在实际使用中,Ling-3.0-flash 在 Claude CodeKilo CodeQwen CodeHermes AgentOpenClaw 等框架中均提供了出色的用户体验。除智能体任务外,Ling-3.0-flash 在通用知识数学推理指令遵循长上下文理解方面同样表现优异。

  • 默认开启思考模式。除非另有说明,Ling-3.0-flash 的默认参数为:temperature=0.6, top_p=0.95, top_k=20
  • SWE-Bench 系列:使用 OpenHands 作为智能体框架并配合定制提示进行评估。解码参数为 temperature=0.6, top_p=0.95, max_new_tokens=32K,上下文窗口为 256K。
  • Terminal-Bench 2.1:采用 Artificial Analysis (AA) 协议,使用默认 Terminus 2 框架、统一的 2 小时超时、提供的 preserve-thinking 模式 JSON 解析器,每项任务运行 3 次(取均值)。解码参数为 temperature=0.6, top_p=1.0, max_new_tokens=32K,上下文窗口为 256K。
  • MiniAppBench:一个包含 500 个任务的编程基准,用于评估模型能否在真实应用生成场景中将单个用户请求转化为完整、可用的交互式 HTML 应用。评估参数为 temperature=1.0, top_p=1.0, max_tokens=128K

快速上手

SGlang

安装我们的 SGLang

pip install uv

uv venv ~/my_ling_env

source ~/my_ling_env/bin/activate

git clone -b ling_v3_support https://github.com/inclusionAI/sglang_ling_v3.git

cd sglang_ling_v3

pip install --upgrade pip

pip install -e "python"

运行推理

以下示例展示如何使用 4 块 GPU 运行 Ling-3.0-flash,其中主节点 IP 为 ${MASTER_IP},服务器端口为 ${PORT}

服务器端

由于模型使用 MTP 训练,我们建议在推理时启用 MTP(即 --speculative-algorithm NEXTN)以降低延迟。

export SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1
export SGLANG_JIT_DEEPGEMM_PRECOMPILE=1
export SGLANG_ENABLE_SPEC_V2=1
python -m sglang.launch_server \
    --model-path $MODEL_PATH \
    --dist-init-addr $MASTER_IP:2345 \
    --port $PORT \
    --nnodes 1 \
    --mem-fraction-static 0.8 \
    --max-running-requests 64 \
    --tp-size 4 \
    --chunked-prefill-size 8192 \
    --tool-call-parser ling3 \
    --reasoning-parser ling3 \
    --context-length 262144 \
    --speculative-algorithm NEXTN \
    --max-mamba-cache-size 320 \
    --enable-fp32-lm-head \
    --disable-shared-experts-fusion

客户端

我们建议使用采样参数 temperature=0.6top_p=0.95top_k=20,并启用 enable_thinking 以获得更好的性能。

curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "auto",
       "messages": [{"role": "user", "content": "hello!"}],
       "chat_template_kwargs": {"enable_thinking": true},
       "stream": true,
       "temperature": 0.6, 
       "top_k": 20,
       "top_p": 0.95
     }'

vLLM

安装我们的 vLLM

pip install uv

uv venv ~/my_ling_env

source ~/my_ling_env/bin/activate

git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git

cd vllm-ling-v3

VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto

运行推理

以下示例展示如何使用 4 块 GPU 运行 Ling-3.0-flash,其中服务器端口为 ${PORT}

服务器端

由于模型使用 MTP 训练,我们建议在推理时启用 MTP(即 --speculative-config)以降低延迟。

vllm serve "$MODEL_PATH" \
    --port "$PORT" \
    --trust-remote-code \
    --served-model-name auto \
    --tensor-parallel-size 4 \
    --gpu-memory-utilization 0.85 \
    --enable-prefix-caching \
    --mamba-cache-mode align \
    --enable-auto-tool-choice \
    --tool-call-parser ling3 \
    --reasoning-parser ling3 \
    --speculative-config '{"method":"mtp","num_speculative_tokens":3}'

客户端

我们建议使用采样参数 temperature=0.6top_p=0.95top_k=20,并启用 enable_thinking 以获得更好的性能。

curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "auto",
       "messages": [{"role": "user", "content": "hello!"}],
       "chat_template_kwargs": {"enable_thinking": true},
       "stream": true,
       "temperature": 0.6, 
       "top_k": 20,
       "top_p": 0.95
     }'

使用 inclusionAI/Ling-3.0-flash 的 Spaces 12

评估结果

相似文章

inclusionAI/Ring-2.6-1T · Hugging Face

Reddit r/LocalLLaMA

inclusionAI发布了Ring-2.6-1T,一个万亿参数推理模型,具有增强的代理执行能力、推理努力机制和异步强化学习训练范式,旨在应对复杂的现实世界任务。