Qwen 3.8 27B 发布:开放权重,目前最好的本地稠密模型

Hacker News Top 模型

摘要

Qwen 发布了 Qwen3.8-27B,这是一个开放权重的 27B 稠密视觉语言模型,在编程、专业工作和长周期智能体任务上取得了重大进展,提供 FP8 版本并支持灵活的思考控制。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/14 15:29

Qwen/Qwen3.8-27B-FP8 · Hugging Face 来源:https://huggingface.co/Qwen/Qwen3.8-27B-FP8

该仓库包含 FP8 量化后的模型权重和配置文件,适用于 Hugging Face Transformers 格式的后训练模型。这些产物兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等。量化方法为块大小为 128 的细粒度 fp8 量化,其性能指标与原始模型几乎一致。

对于需要托管式、可扩展推理且无需维护基础设施的用户,官方 Qwen API 服务由 Qwen Cloud (https://www.qwencloud.com/) 提供。特别是,Qwen3.8-27B 将作为托管版本提供,并包含更多生产级特性,例如默认 1M 上下文长度、官方内置工具等。更多信息请参阅 Qwen3.8-27B 概览 (https://www.qwencloud.com/models/qwen3.8-27b)。该服务即将推出,敬请期待。

继 Qwen3.5 和 Qwen3.6 系列获得广泛的社区采用之后,我们很高兴推出 Qwen3.8,这是目前 Qwen 开源模型家族中能力最强的一代。基于 Qwen3.5 的架构基础,Qwen3.8 在编码、专业工作、研究以及长周期智能体任务方面均取得了显著提升。Qwen3.8-27B 将这些进步带入了一个紧凑、易于部署的稠密模型中:一个原生支持图像和视频理解的视觉语言模型,具备灵活的思维控制能力,旨在以更高的可靠性完成复杂、多步骤的任务。

Qwen3.8 亮点

Qwen3.8-27B 具备以下增强特性:

  • 核心能力:在编码、专业工作、研究以及长周期智能体任务方面全面提升。
  • 智能体执行:更强的自主规划和更好的环境反馈处理能力,从而实现更可靠的端到端任务完成。
  • 下游兼容性:更广泛地支持流行的评测框架和开发工具,更易于集成到您现有的技术栈中。
  • 灵活的思维控制:思维模式默认开启,可按请求关闭;推理深度可通过 reasoning_effort 调节,历史消息中的推理上下文可通过 preserve_thinking 保留。
  • 视觉语言理解:原生支持图像和视频理解,涵盖从 STEM 图表和文档到小时级视频的内容。

模型概述

  • 类型:带视觉编码器的因果语言模型
  • 训练阶段:预训练和后训练
  • 语言模型
  • 参数量:27B
  • 隐藏维度:5120
  • Token 嵌入:248,320(已填充)
  • 层数:64
  • 隐藏布局:16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
  • Gated DeltaNet:
    • 线性注意力头数量:V 为 48,QK 为 16
    • 头维度:128
  • Gated Attention:
    • 注意力头数量:Q 为 24,KV 为 4
    • 头维度:256
  • 旋转位置嵌入维度:64
  • 前馈网络:
    • 中间维度:17,408
    • LM 输出:248,320(已填充)
  • MTP(多 Token 预测):使用多步训练
  • 上下文长度:原生 262,144,可扩展至 1,000,000 个 token。

基准测试结果

文本性能

Qwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
Coding
Agentic terminal codingTerminal Bench 2.1 (Terminus)73.063.464.051.7
Agentic codingSWE-bench Pro61.753.557.651.2
Repo-level code generationNL2Repo-Bench42.336.241.1-
Agentic codingDeepSWE 1.142.213.314.2-
Software engineeringQwenSWEBench79.049.359.2-
Agent
Long-horizon office workCoWorkBench70.761.065.1-
Professional job tasksJobBench33.421.827.6-
Frontier agentic tasksAgents’ Last ExamPass@1 20.4 Score 42.9Pass@1 10.6 Score 27.3Pass@1 13.2 Score 33.6-
General
Instruction followingIFBench79.569.179.177.0
Scientific reasoningGPQA Diamond89.287.890.383.5
Multidisciplinary reasoningHLE30.824.034.722.0
Competitive codingLiveCodeBench v690.383.989.6-
  1. SWE-bench Pro:除 Opus4.6 Max 使用官方报告分数外,所有模型均使用 Claude Code 评测框架进行评估,温度为 1.0,top_p=0.95,上下文窗口为 256K。已纠正有问题的任务,并且所有基线模型均在修正后的基准上重新评估。
  2. NL2Repo-Bench:使用 Claude Code 评测框架评估。为防止奖励黑客,我们禁用了试图访问特定仓库的 Bash 命令,例如 pip download、pip install 和 git clone。
  3. DeepSWE 1.1:使用 Claude Code 评测框架评估,温度为 1.0,top_p=0.95,上下文窗口为 256K。
  4. QwenSWEBench:用于评估模型软件工程能力的内部编码基准。使用 Claude Code 评测框架评估。报告 avg@3,超时时间为 8 小时,max_tokens=32,768,温度=1.0,上下文窗口为 256K。
  5. CoWorkBench:内部协作基准,用于评估计算机科学、金融、法律、医疗及其他生产力领域的长期任务。
  6. HLE:由 GPT-4o 评判。
  7. 每行最佳结果以粗体显示。
  8. 空单元格(-)表示结果尚未可用或不适用。

视觉语言性能

Qwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
Agentic Multimodal Intelligence
Computer useOSWorld-Verified84.363.973.365.9
Browser useWebArena-Verified64.848.855.3-
Mobile useAndroidWorld81.970.381.0-
Application recreationRecreationBench47.129.830.2-
Multimodal tool useClawEval-MMPass@3 57.4 Average 56.9Pass@3 42.6 Average 50.4Pass@3 57.4 Average 60.1-
Multimodal software engineeringSWE-MM38.625.730.0-
Visual web developmentVision2Web62.945.042.1-
General Multimodal Intelligence
Visual math problem solvingMathVisionWithout CI 90.0 With CI 94.6Without CI 85.1 Without CI 90.3--
General visual reasoningBabyVisionWithout CI 65.7 With CI 85.6Without CI 28.9 Without CI 64.7 With CI 70.4--
Scientific chart analysisCharXiv (RQ)Without CI 83.7 With CI 90.2Without CI 78.4 Without CI 85.8 With CI 85.978.8-
Document intelligenceOmniDocBench 1.591.189.491.475.8
Real-world perceptionRealWorldQA85.984.186.9-
Embodied intelligenceERQA65.562.569.8-
  1. MathVision、BabyVision 和 CharXiv (RQ):在两种设置均可用的情况下,单元格分别报告“Without CI”和“With CI”;否则,仅显示可用设置。MathVision 和 CharXiv (RQ) 中少数错误的人工标注在手动验证后已进行修正,所有在这些基准上报告的分数均使用修正后的标注计算。
  2. MathVision:Qwen3.8-27B 使用固定提示词评估:“请逐步推理,并将最终答案放在 \boxed{} 中。”对于其余模型,我们报告两种提示变体中得分较高的一个——一种带 \boxed{} 格式要求,一种不带。
  3. WebArena-Verified:分数使用 OSWorld scaffold 下的官方 WebArena-Verified 评分器计算。
  4. RecreationBench:一个内部的长期应用重建基准,旨在评估跨五个平台的混合智能体能力:桌面(Ubuntu、macOS 和 Windows)、移动端(Android)和 Web。
  5. ClawEval-MM:分数报告为“Pass@3 / 平均分数”。Pass@3 是指在三次试验中至少一次通过的任务百分比;平均分数是三次试验的基准平均分。
  6. Vision2Web:分数取前端、网页和网站类别的平均值。评估使用 Claude Code 评测框架,并由 gpt-5.4-2026-03-05 评判。
  7. SWE-MM:使用 Claude Code 评测框架在 SWE-bench Multimodal 的公开 dev 分割上评估,修改内容见 Claude Opus 4.7 系统卡附录 8.3。
  8. 空单元格(-)表示结果尚未可用或不适用。

快速开始

为简化集成,我们建议通过 API 使用 Qwen3.8。

部署 Qwen3.8

推理效率和吞吐量在不同框架之间存在显著差异。我们建议使用最新版本的框架,以确保最佳性能和兼容性。对于生产工作负载或高吞吐量场景,推荐使用专用推理引擎,如 SGLang、vLLM 或 TokenSpeed。

Qwen3.8 可以使用流行的推理框架进行部署,例如:

  • SGLang (https://www.sglang.io/):Qwen3.8 Cookbook (https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B)
  • vLLM (https://vllm.ai/):Qwen3.8 Recipe (https://recipes.vllm.ai/Qwen/Qwen3.8-27B)
  • TokenSpeed (https://lightseek.org/tokenspeed/):Qwen3.8 Recipe (https://lightseek.org/tokenspeed/recipes/models#qwen3-8)

API 用法

Qwen3.8 模型默认以思维模式运行,在生成最终回复之前会产生以 \n...\n\n 标识的思维内容。要禁用思维内容并获得直接回复,请参考此处的示例 (https://huggingface.co/Qwen/Qwen3.8-27B-FP8#instruct-or-non-thinking-mode)。

我们建议使用以下采样参数集进行生成:

  • 思维模式:temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0
  • Instruct(或非思维)模式:temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0

请注意,采样参数的支持程度因推理框架而异。

Qwen3.8 官方支持 reasoning_effort,可用于调整推理深度并控制成本:

  • xhigh(默认):适用于需要深入分析的复杂任务
  • medium:在准确性和速度之间取得平衡
  • low:高效推理,优化速度和成本

此外,所有工作负载默认启用 preserve_thinking,以获得最佳的开箱即用体验。要禁用保留思维,请参考此处的示例 (https://huggingface.co/Qwen/Qwen3.8-27B-FP8#disable-preserved-thinking)。

在多轮智能体任务中,较低的推理努力并不总是能减少整体任务完成时间。虽然它可能产生更快的逐轮响应,但也可能导致分析不足、更多失败和重复重试,从而可能增加总延迟和 token 消耗。

Chat Completions API

Chat Completions API 可用于大多数推理框架,以及 Qwen Cloud (https://www.qwencloud.com/)。在开始之前,请确保已安装 OpenAI Python SDK,并配置好 API 密钥和 API 基础 URL,例如:

pip install -U openai
# 根据实际情况设置以下环境变量
export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'
纯文本输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B-FP8",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,  # 默认开启
            "preserve_thinking": True,  # 默认开启
        },
    },
    reasoning_effort="xhigh",  # 默认 xhigh;支持的级别为 xhigh、medium 和 low
    stream=True,
    stream_options={"include_usage": True},
)

reasoning_content = ""
answer_content = ""
is_answering = False

print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
            reasoning_content += delta.reasoning_content
    elif hasattr(delta, "reasoning") and delta.reasoning is not None:
        if not is_answering:
            print(delta.reasoning, end="", flush=True)
            reasoning_content += delta.reasoning
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

messages.append({
    "role": "assistant",
    "content": answer_content,
    "reasoning_content": reasoning_content,
    "reasoning": reasoning_content,
})
图像输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
                },
            },
            {
                "type": "text",
                "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"
            },
        ],
    }
]

chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B-FP8",
    messages=messages,
)

print("Chat response:", chat_response)
视频输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "video_url",
                "video_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
                },
            },
            {
                "type": "text",
                "text": "How many porcelain jars were discovered in the niches located in the primary chamber of the tomb?"
            },
        ],
    }
]

chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B",
    messages=messages,
)

# 当 vLLM 以 `--media-io-kwargs '{"video": {"num_frames": -1}}'` 启动时,
# 视频帧采样可以通过 `extra_body` 配置(例如,通过设置 `fps`)。
# 该功能目前仅在 vLLM 中支持。
#
# 默认情况下,`fps=2` 且 `do_sample_frames=True`。
# 当 `do_sample_frames=True` 时,您可以自定义 `fps` 值来设置所需的视频采样率。
#
# chat_response = client.chat.completions.create(
#     model="Qwen/Qwen3.8-27B-FP8",
#     messages=messages,
#     extra_body={
#         "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
#     },
# )

print("Chat response:", chat_response)
Instruct(或非思维)模式

Qwen3.8-27B 默认在回复前进行思考。您可以通过配置 API 参数来获取模型不带思考的直接回复。例如,

相似文章

Qwen3.8-27B

Hacker News Top

Qwen 发布了 Qwen3.8-27B 的开源权重,这是一个原生多模态稠密模型,拥有 27B 参数,整体性能超越 Qwen3.7-Plus,支持 262K 原生上下文并可扩展至 1M,采用 Apache 2.0 许可。

Qwen/Qwen3.6-27B

Hugging Face Models Trending

Qwen 在 Hugging Face 上发布了开源权重模型 Qwen3.6-27B,该模型具备更高的稳定性、强大的智能体编程能力以及思维链保留特性,有助于提升开发者的工作效率。

Qwen 3.7 Max

Reddit r/LocalLLaMA

Qwen 3.7 是一款来自中国实验室的新AI模型,令人印象深刻,讨论焦点在于其权重是否可供下载。

Qwen/Qwen3.6-27B-FP8

Hugging Face Models Trending

阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。