Qwen/Qwen3.6-35B-A3B

Hugging Face Models Trending 模型

摘要

Qwen 发布 Qwen3.6-35B-A3B,一款开源权重的混合专家(MoE)模型,总参数量 35B,激活参数量 3B,在智能体编码和推理能力保持方面实现显著提升。

任务: image-text-to-text 标签: transformers, safetensors, qwen3_5_moe, image-text-to-text, conversational, license:apache-2.0, eval-results, endpoints_compatible, deploy:azure, region:us
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:57

Qwen/Qwen3.6-35B-A3B · Hugging Face 来源:https://huggingface.co/Qwen/Qwen3.6-35B-A3B Qwen Chat (https://chat.qwen.ai/) > 本仓库包含 Hugging Face Transformers 格式的后训练模型权重与配置文件。这些产物与 Hugging Face Transformers、vLLM、SGLang、KTransformers 等兼容。继二月发布 Qwen3.5 系列之后,我们很高兴分享首个开放权重的 Qwen3.6 变体。基于社区的直接反馈构建,Qwen3.6 优先关注稳定性与实际效用,为开发者提供更直观、响应更迅速且真正高效的编码体验。 ## https://huggingface.co/Qwen/Qwen3.6-35B-A3B#qwen36-highlightsQwen3.6 亮点 本次发布带来了重大升级,特别是在以下方面: - 智能体编码: 模型现在能够更流畅、更精确地处理前端工作流和仓库级推理。 - 思考保留: 我们引入了新的选项,可保留历史消息中的推理上下文,从而简化迭代开发并降低开销。 基准测试结果 (https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3.6/Figures/qwen3.6_35b_a3b_score.png) 更多详情请参阅我们的博客文章 Qwen3.6-35B-A3B (https://qwen.ai/blog?id=qwen3.6-35b-a3b)。 ## https://huggingface.co/Qwen/Qwen3.6-35B-A3B#model-overview模型概览 - 类型:带视觉编码器的因果语言模型 - 训练阶段:预训练与后训练 - 语言模型 - 参数量:总计 35B,激活 3B - 隐藏维度:2048 - 词嵌入:248320(填充后) - 层数:40 - 隐藏层布局:10 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) - Gated DeltaNet: - 线性注意力头数:V 为 32,QK 为 16 - 头维度:128 - Gated Attention: - 注意力头数:Q 为 16,KV 为 2 - 头维度:256 - 旋转位置编码维度:64 - 混合专家模型(MoE) - 专家数量:256 - 激活专家数量:8 个路由 + 1 个共享 - 专家中间维度:512 - LM 输出:248320(填充后) - MTP:多步训练 - 上下文长度:原生 262,144,可扩展至 1,010,000 个 token。 ## https://huggingface.co/Qwen/Qwen3.6-35B-A3B#benchmark-results基准测试结果 ### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#language语言 Qwen3.5-27BGemma4-31BQwen3.5-35BA3BGemma4-26BA4BQwen3.6-35BA3B编码智能体SWE-bench Verified75.052.070.017.473.4SWE-bench Multilingual69.351.760.317.367.2SWE-bench Pro51.235.744.613.849.5Terminal-Bench 2.041.642.940.534.251.5Claw-EvalAvg64.348.565.458.868.7Claw-EvalPass^346.225.051.028.050.0SkillsBenchAvg527.223.64.412.328.7QwenClawBench52.241.747.738.752.6NL2Repo27.315.520.511.629.4QwenWebBench1068119797811781397通用智能体TAU3-Bench68.467.568.959.067.2VITA-Bench41.843.029.136.935.6DeepPlanning22.624.022.816.225.9Tool Decathlon31.521.228.712.026.9MCPMark36.318.127.014.237.0MCP-Atlas68.457.262.450.062.8WideSearch66.435.259.138.360.1知识MMLU-Pro86.185.285.382.685.2MMLU-Redux93.293.793.392.793.3SuperGPQA65.665.763.461.464.7C-Eval90.582.690.282.590.0STEM 与推理GPQA85.584.384.282.386.0HLE24.319.522.48.721.4LiveCodeBench v680.780.074.677.180.4HMMT Feb 2592.088.789.091.790.7HMMT Nov 2589.887.589.287.589.1HMMT Feb 2684.377.278.779.083.6IMOAnswerBench79.974.576.874.378.9AIME2692.689.291.088.392.7* SWE-Bench 系列:内部智能体脚手架(bash + 文件编辑工具);temp=1.0,top_p=0.95,200K 上下文窗口。我们修正了 SWE-bench Pro 公开集中的一些有问题的任务,并在优化后的基准上评估所有基线。 * Terminal-Bench 2.0:Harbor/Terminus-2 框架;3 小时超时,32 CPU/48 GB RAM;temp=1.0,top_p=0.95,top_k=20,max_tokens=80K,256K 上下文;5 次运行平均。 * SkillsBench:通过 OpenCode 在 78 个任务上评估(自包含子集,排除 API 依赖任务);5 次运行平均。 * NL2Repo:其他通过 Claude Code 评估(temp=1.0,top_p=0.95,max_turns=900)。 * QwenClawBench:内部真实用户分布 Claw 智能体基准(即将开源);temp=0.6,256K 上下文。 * QwenWebBench:内部前端代码生成基准;双语(英/中),7 个类别(网页设计、Web 应用、游戏、SVG、数据可视化、动画和 3D);自动渲染 + 多模态评判(代码/视觉正确性);BT/Elo 评分系统。 * TAU3-Bench:我们使用官方用户模型(gpt-5.2,低推理强度)+ 默认 BM25 检索。 * VITA-Bench:子领域平均分;使用 claude-4-sonnet 作为评判器,因官方评判器(claude-3.7-sonnet)已不再可用。 * MCPMark:GitHub MCP v0.30.3;Playwright 响应截断至 32K token。 * MCP-Atlas:公开集分数;gemini-2.5-pro 评判器。 * AIME 26:我们使用完整的 AIME 2026(I & II),分数可能与 Qwen 3.5 说明不同。 ### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#vision-language视觉语言 Qwen3.5-27BClaude-Sonnet-4.5Gemma4-31BGemma4-26BA4BQwen3.5-35B-A3BQwen3.6-35B-A3BSTEM 与谜题MMMU82.379.680.478.481.481.7MMMU-Pro75.068.476.973.875.175.3Mathvista(mini)87.879.879.379.486.286.4ZEROBench_sub36.226.326.026.334.134.4通用 VQARealWorldQA83.770.372.372.284.185.3MMBenchEN-DEV-v1.192.688.390.989.091.592.8SimpleVQA56.057.652.952.258.358.9HallusionBench70.059.967.466.167.969.8文本识别与文档理解OmniDocBench1.588.985.880.174.489.389.9CharXiv(RQ)79.567.267.969.077.578.0CC-OCR81.068.175.774.580.781.9AI2D_TEST92.987.089.088.392.692.7空间智能RefCOCO(avg)90.9——89.292.0ODInW1341.1——42.650.8EmbSpatialBench84.571.8––83.184.3RefSpatialBench67.7——63.564.3视频理解VideoMME(w sub.)87.081.1––86.686.6VideoMME(w/o sub.)82.875.3––82.582.5VideoMMMU82.377.681.676.080.483.7MLVU85.972.8––85.686.2MVBench74.6——74.874.6LVBench73.6——71.471.4* 空单元格(–)表示分数不可用或不适用。 ## https://huggingface.co/Qwen/Qwen3.6-35B-A3B#quickstart快速开始 为简化集成,我们建议通过 API 使用 Qwen3.6。以下是通过 OpenAI 兼容 API 使用 Qwen3.6 的指南。 ### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#serving-qwen36部署 Qwen3.6 Qwen3.6 可通过 API 与主流推理框架进行部署。以下展示启动 Qwen3.6 模型 OpenAI 兼容 API 服务器的示例命令。 > 不同框架的推理效率和吞吐量差异显著。我们建议使用最新版本的框架以确保最佳性能和兼容性。对于生产工作负载或高吞吐量场景,强烈建议使用专用服务引擎,如 SGLang、KTransformers 或 vLLM。 > 模型默认上下文长度为 262,144 个 token。如果遇到内存不足(OOM)错误,可考虑减小上下文窗口。但由于 Qwen3.6 利用扩展上下文处理复杂任务,我们建议保持至少 128K token 的上下文长度以保留思考能力。 #### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#sglangSGLang SGLang (https://github.com/sgl-project/sglang) 是一个用于大型语言模型和视觉语言模型的快速服务框架。建议使用 sglang>=0.5.10 运行 Qwen3.6,可在新环境中通过以下命令安装: uv pip install sglang[all] 更多详情请参阅其文档 (https://docs.sglang.ai/get_started/install.html)。 以下命令将在 http://localhost:8000/v1 创建 API 端点: - 标准版本:以下命令可用于在 8 块 GPU 上使用张量并行创建最大上下文长度为 262,144 token 的 API 端点。 python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 - 工具使用:要支持工具使用,可以使用以下命令。 python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder - 多 Token 预测(MTP):以下命令推荐用于 MTP: python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 详细部署指南请参阅 SGLang Qwen3.5 Cookbook (https://lmsysorg.mintlify.app/cookbook/llm/Qwen/Qwen3.5)。 #### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#vllmvLLM vLLM (https://github.com/vllm-project/vllm) 是一个高吞吐量、内存高效的 LLM 推理和服务引擎。建议使用 vllm>=0.19.0 运行 Qwen3.6,可在新环境中通过以下命令安装: uv pip install vllm --torch-backend=auto 更多详情请参阅其文档 (https://docs.vllm.ai/en/stable/getting_started/installation/index.html)。 以下命令将在 http://localhost:8000/v1 创建 API 端点: - 标准版本:以下命令可用于在 8 块 GPU 上使用张量并行创建最大上下文长度为 262,144 token 的 API 端点。 vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 - 工具调用:要支持工具使用,可以使用以下命令。 vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder - 多 Token 预测(MTP):以下命令推荐用于 MTP: vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}' - 纯文本:以下命令跳过视觉编码器和多模态分析以释放额外 KV 缓存内存: vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --language-model-only 详细部署指南请参阅 vLLM Qwen3.5 Recipe (https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html)。 #### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#ktransformersKTransformers KTransformers (https://github.com/kvcache-ai/ktransformers) 是一个灵活的框架,用于通过 CPU-GPU 异构计算体验前沿的 LLM 推理优化。有关使用 KTransformers 运行 Qwen3.6,请参阅 KTransformers 部署指南 (https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md)。 #### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#hugging-face-transformersHugging Face Transformers Hugging Face Transformers 包含一个轻量级服务器,可用于快速测试和中等负载部署。Qwen3.6 需要最新的 transformers: pip install "transformers[serving]" 更多详情请参阅其文档 (https://huggingface.co/docs/transformers/main/serving)。 请确保同时安装了 torchvision 和 pillow。然后运行 transformers serve 以在 http://localhost:8000/v1 启动带有 API 端点的服务器;如有可用加速器,模型将自动放置其上: transformers serve Qwen/Qwen3.6-35B-A3B --port 8000 --continuous-batching ### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#using-qwen36-via-the-chat-completions-api通过 Chat Completions API 使用 Qwen3.6 Chat Completions API 可通过标准 HTTP 请求或 OpenAI SDK 访问。这里我们展示使用 OpenAI Python SDK 的示例。开始前,请确保已安装 SDK 并配置了 API 密钥和 API 基础 URL,例如: pip install -U openai # 按实际情况设置以下变量 export OPENAI_BASE_URL="http://localhost:8000/v1" export OPENAI_API_KEY="EMPTY" > 我们建议使用以下采样参数进行生成: - 通用任务的思考模式:temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0 - 精确编码任务(如 Web 开发)的思考模式:temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0 - 指令(或非思考)模式:temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0 请注意,采样参数的支持情况因推理框架而异。 > Qwen3.6 模型默认处于思考模式,会在生成最终回复前产生以 \n...\n\n 标识的思考内容。要禁用思考内容并获取直接回复,请参阅此处的示例 (https://huggingface.co/Qwen/Qwen3.6-35B-A3B#instruct-or-non-thinking-mode)。 #### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#text-only-input纯文本输入 from openai import OpenAI # 通过环境变量配置 client = OpenAI() messages = [ {"role": "user", "content": "Type \"I love Qwen3.6\" backwards"}, ] chat_response = client.chat.completions.create( model="Qwen/Qwen3.6-35B-A3B", messages=messages, max_tokens=81920, temperature=1.0, top_p=0.95, presence_penalty=1.5, extra_body={ "top_k": 20, }, ) print("Chat response:", chat_response) #### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#image-input图像输入 from openai import OpenAI # 通过环境变量配置 client = OpenAI() messages = [ { "role": "user", "content": [ { "type": "image_url", "image_url": { "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg" } }, { "type": "text", "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$" } ] } ] chat_response = client.chat.completions.create( model="Qwen/Qwen3.6-35B-A3B", messages=messages, max_tokens=81920, temperature=1.0, top_p=0.95, presence_penalty=1.5, extra_body={ "top_k": 20, }, ) print("Chat response:", chat_response) #### https://huggingface.co/Qwen/Qwen3.6-35B-A3B#video-input视频输入 from openai import OpenAI # 通过环境变量配置 client = OpenAI() messages = [ { "role": "user", "content": [ { "type": "video_url", "video_url": { "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4" } }, { "type": "text", "text": "How many porcelain jars were discovered in the niches located in the primary chamber of the tomb?" } ] } ] # 当 vLLM 以 `--media-io-kwargs '{"video": {"num_frames": -1}}'` 启动时, # 可通过 `extra_body` 配置视频帧采样(例如,设置 `fps`)。 # 该功能目前仅在 vLLM 中支持。 # # 默认情况下,`fps=2` 且 `do_sample_frames=True`。 # 当 `do_sample_frames=True` 时,可自定义 `fps` 值以设置所需的视频采样率。 chat_response = client.chat.completions.create( model="Qwen/Qwen3.6-35B-A3B", messages=messages, max_tokens=81920, temperature=1.0, top_p=0.95, presence_penalty=1.5, extra_body={ "top_k": 20, "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True}, }, ) print("Chat response:", chat_response) #### https:

相似文章

Qwen/Qwen3.6-35B-A3B-FP8

Hugging Face Models Trending

阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。

Qwen/Qwen3.6-27B

Hugging Face Models Trending

Qwen 在 Hugging Face 上发布了开源权重模型 Qwen3.6-27B,该模型具备更高的稳定性、强大的智能体编程能力以及思维链保留特性,有助于提升开发者的工作效率。

Qwen/Qwen3.8-2.4T-A95B-FP8

Hugging Face Models Trending

Qwen releases FP8-quantized weights for Qwen3.8-2.4T-A95B, a 2.4T-parameter MoE model with 95B activated parameters, claiming Qwen-Max-class capability in an open release with strong coding, agentic, and long-context performance.

Qwen3.8-27B

Hacker News Top

Qwen 发布了 Qwen3.8-27B 的开源权重,这是一个原生多模态稠密模型,拥有 27B 参数,整体性能超越 Qwen3.7-Plus,支持 262K 原生上下文并可扩展至 1M,采用 Apache 2.0 许可。

Qwen 3.7 Max

Reddit r/LocalLLaMA

Qwen 3.7 是一款来自中国实验室的新AI模型,令人印象深刻,讨论焦点在于其权重是否可供下载。