@no_stp_on_snek: 离 Qwen 3.8 发布还有几个小时!清理你的工作台!我将进行行为测试并与 3.6…

X AI KOLs Timeline 模型

摘要

Qwen3.8-27B 是一款新的 AI 模型,在编码、代理任务和视觉语言理解方面具有增强能力,提供灵活的思维控制和长上下文长度。它可在 Hugging Face 上获取,并设计为易于部署使用。

离 Qwen 3.8 发布还有几个小时! 清理你的工作台! 我将进行行为测试并与 3.6 进行对比。 https://t.co/gEfdFntAZs
查看原文
查看缓存全文

缓存时间: 2026/08/15 13:48

Qwen 3.8 就在几个小时后!清理工作台吧!我将进行行为测试并与3.6版本进行对比。https://t.co/gEfdFntAZs


Qwen/Qwen3.8-27B · Hugging Face

来源:https://huggingface.co/Qwen/Qwen3.8-27B

本仓库包含以 Hugging Face Transformers 格式提供的后训练模型权重和配置文件。这些资源兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等框架。
对于希望获得托管式、可扩展推理服务而无需维护基础设施的用户,官方 Qwen API 由 Qwen Cloud (https://www.qwencloud.com/) 提供。特别是,Qwen3.8-27B 将以托管版本提供,具备更多生产级功能,默认支持 100 万上下文长度,并内置官方工具。详情请参阅 Qwen3.8-27B 概览。服务即将推出,敬请关注更新。

继 Qwen3.5 和 Qwen3.6 系列被社区广泛采用之后,我们很高兴推出 Qwen3.8——这是目前 Qwen 开放模型家族中最强大的一代。基于 Qwen3.5 的架构基础,Qwen3.8 在编程、专业工作、研究和长周期智能体任务上均带来显著提升。Qwen3.8-27B 将这些进步整合到一个紧凑、易于部署的稠密模型中:原生支持图像和视频理解的视觉语言模型,具备灵活的思维控制,旨在更可靠地完成复杂的多步骤任务。

Qwen3.8 亮点

Qwen3.8-27B 具备以下增强特性:

  • 核心能力:在编程、专业工作、研究和长周期智能体任务上全面改进。
  • 智能体执行:更强的自主规划能力和对环境反馈的更好处理,从而实现更可靠的端到端任务完成。
  • 下游兼容性:更广泛地支持主流框架和开发工具,更易于集成到您现有的技术栈中。
  • 灵活思维控制:思维模式默认开启,可按请求禁用;可通过 reasoning_effort 调整推理深度,并通过 preserve_thinking 保留历史消息中的推理上下文。
  • 视觉-语言理解:原生支持图像和视频理解,涵盖 STEM 图表、文档乃至小时级长视频。

模型概览

  • 类型:带视觉编码器的因果语言模型
  • 训练阶段:预训练 & 后训练
  • 语言模型部分
    • 参数量:27B
    • 隐藏维度:5120
    • 词嵌入维度:248,320(填充)
    • 层数:64
    • 隐藏层结构:16 × (3 × (门控 DeltaNet → FFN) → 1 × (门控注意力 → FFN))
    • 门控 DeltaNet
      • 线性注意力头数:V 为 48,QK 为 16
      • 头维度:128
    • 门控注意力
      • 注意力头数:Q 为 24,KV 为 4
      • 头维度:256
      • 旋转位置嵌入维度:64
    • 前馈网络
      • 中间维度:17,408
    • LM 输出维度:248,320(填充)
    • MTP(多标记预测):以多步方式训练
  • 上下文长度:原生支持 262,144,可扩展至最高 1,000,000 标记。

基准测试结果

文本性能

任务类别具体任务Qwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
编程Agentic 终端编程 (Terminal Bench 2.1)73.063.464.051.778.2
Agentic 编程 (SWE-bench Pro)61.753.557.651.253.4
软件工程仓库级代码生成 (NL2Repo-Bench)42.336.241.147.6
Agentic 编程 (DeepSWE 1.1)42.213.314.2
软件工程 (QwenSWEBench)79.049.359.263.8
专业工作长周期办公任务 (CoWorkBench)70.761.065.168.2
专业岗位任务 (JobBench)33.421.827.6
前沿智能体任务智能体最终考试 (Agents’ Last Exam)Pass@1 20.4 (Score 42.9)Pass@1 10.6 (Score 27.3)Pass@1 13.2 (Score 33.6)
通用能力指令遵循 (IFBench)79.569.179.177.062.5
科学推理GPQA Diamond89.287.890.383.591.3
跨学科推理HLE30.824.034.722.040.0
竞赛编程LiveCodeBench v690.383.989.688.8
  1. SWE-bench Pro:除 Opus4.6 Max 使用官方报告分数外,所有模型均使用 Claude Code 框架在温度=1.0、top_p=0.95、256K 上下文窗口下评估。问题任务已修正,所有基线模型在改进后的基准上重新评估。
  2. NL2Repo-Bench:使用 Claude Code 框架评估。为防止奖励作弊,禁用了尝试访问特定仓库的 Bash 命令(如 pip download、pip install 和 git clone)。
  3. DeepSWE 1.1:使用 Claude Code 框架在温度=1.0、top_p=0.95、256K 上下文窗口下评估。
  4. QwenSWEBench:内部编码基准,用于评估模型的软件工程能力。使用 Claude Code 框架评估,报告 avg@3,超时8小时,max_tokens=32,768,温度=1.0,上下文窗口256K。
  5. CoWorkBench:内部协作基准,评估跨计算机科学、金融、法律、医学及其他生产力领域的长周期任务。
  6. HLE:由 GPT-4o 裁判。
  7. 每行最佳结果以粗体显示。
  8. 空白单元格(–)表示结果尚未提供或不适用。

视觉-语言性能

任务类别具体任务Qwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
智能体多模态智能电脑使用 (OSWorld-Verified)84.363.973.365.972.7
浏览器使用 (WebArena-Verified)64.848.855.3
移动端使用 (AndroidWorld)81.970.381.062.0
应用重现 (RecreationBench)47.129.830.2
多模态工具使用 (ClawEval-MM)Pass@3 57.4 (Average 60.1)Pass@3 42.6 (Average 50.4)Pass@3 57.4 (Average 60.1)Pass@3 52.5 (Average 54.7)
多模态软件工程 (SWE-MM)38.625.730.027.1
视觉网页开发 (Vision2Web)62.945.042.1
通用多模态智能视觉数学问题解决 (MathVision)Without CI 90.0
With CI 94.6
Without CI 85.1
Without CI 90.3
Without CI 65.5
通用视觉推理 (BabyVision)Without CI 65.7
With CI 85.6
Without CI 28.9
Without CI 64.7
With CI 70.4
Without CI 12.6
科学图表分析 (CharXiv (RQ))Without CI 83.7
With CI 90.2
Without CI 78.4
Without CI 85.8
With CI 85.9
78.8Without CI 66.0
文档智能 (OmniDocBench 1.5)91.189.491.475.886.6
真实世界感知 (RealWorldQA)85.984.186.973.9
具身智能 (ERQA)65.562.569.840.8
  1. MathVision, BabyVision, CharXiv (RQ):当两种设置都可用时,单元格分别报告“Without CI”和“With CI”;否则仅显示可用设置。在手动验证后,修正了 MathVision 和 CharXiv (RQ) 中少量错误的 ground-truth 标注,这些基准上报告的所有分数均基于修正后的标注计算。
  2. MathVision:Qwen3.8-27B 使用固定提示评估:“请逐步推理,并将最终答案放在\boxed{}内。”对于其他模型,报告两种提示变体(一种要求\boxed{}格式,一种不要求)中的较高分数。
  3. WebArena-Verified:分数使用官方 WebArena-Verified 评分器在 OSWorld 框架下计算。
  4. RecreationBench:一个内部的长周期应用重现基准,旨在评估跨五个平台(桌面端:Ubuntu、macOS 和 Windows;移动端:Android;以及 Web)的混合智能体能力。
  5. ClawEval-MM:分数报告为“Pass@3 / 平均分”。Pass@3 是任务在至少一次试验中通过的百分比;平均分是三次试验的平均基准分。
  6. Vision2Web:分数在前端、网页和网站类别上取平均值。评估使用 Claude Code 框架,并由 gpt-5.4-2026-03-05 裁判。
  7. SWE-MM:分数使用 Claude Code 框架在 SWE-bench Multimodal 的公开开发集上评估,并应用了 Claude Opus 4.7 系统卡附录 8.3 中描述的修改。
  8. 空白单元格(–)表示结果尚未提供或不适用。

快速开始

为便于集成,我们建议通过 API 使用 Qwen3.8。

部署 Qwen3.8

不同框架的推理效率和吞吐量差异很大。我们建议使用最新版本的框架以确保最佳性能和兼容性。对于生产负载或高吞吐量场景,推荐使用专用的推理引擎,如 SGLang、vLLM 或 TokenSpeed。
Qwen3.8 可通过流行的推理框架部署,例如:

API 使用

Qwen3.8 模型默认以思维模式运行,在生成最终响应前会生成以 \n...\n\n 表示的思维内容。要禁用思维内容并直接获取响应,请参阅此处示例
我们建议使用以下采样参数集进行生成:

  • 思维模式temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0
  • 指令模式(或非思维模式)temperature=0.7top_p=0.80top_k=20min_p=0.0presence_penalty=1.5repetition_penalty=1.0

请注意,对采样参数的支持因推理框架而异。
Qwen3.8 官方支持 reasoning_effort,可用于调整推理深度并控制成本:

  • xhigh(默认):适用于需要深入分析的复杂任务
  • medium:平衡准确性和速度
  • low:优化速度和成本的高效推理

此外,为提供最佳开箱即用体验,preserve_thinking 在所有负载中默认启用。要禁用保留的思维,请参阅此处示例

在多轮智能体任务中,降低推理努力程度并不总是减少整体任务完成时间。虽然它可能产生更快的每轮响应,但也可能导致分析不足、更多失败和重复重试,从而增加总延迟和 token 消耗。

Chat Completions API

Chat Completions API 可与大多数推理框架以及 Qwen Cloud 一起使用。开始前,请确保已安装 OpenAI Python SDK 并配置了 API 密钥和 API 基础 URL,例如:

pip install -U openai
# 根据实际情况设置以下环境变量
export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'
纯文本输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,  # 默认开启
            "preserve_thinking": True,  # 默认开启
        },
    },
    reasoning_effort="xhigh",  # 默认为 xhigh;支持的级别有 xhigh、medium 和 low
    stream=True,
    stream_options={"include_usage": True},
)

reasoning_content = ""
answer_content = ""
is_answering = False

print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content
    elif hasattr(delta, "reasoning") and delta.reasoning is not None:
        if not is_answering:
            print(delta.reasoning, end="", flush=True)
        reasoning_content += delta.reasoning
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

messages.append({
    "role": "assistant",
    "content": answer_content,
    "reasoning_content": reasoning_content,
    "reasoning": reasoning_content,
})
图像输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
                }
            },
            {"type": "text", "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"}
        ]
    }
]

chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B",
    messages=messages,
)

print("Chat response:", chat_response)
视频输入
from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "video_url",
                "video_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
                }
            },
            {"type": "text", "text": "How many porcelain jars were discovered in the niches located in the primary chamber of the tomb?"}
        ]
    }
]

chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B",
    messages=messages,
)

# 当 vLLM 以 `--media-io-kwargs '{"video": {"num_frames": -1}}'` 启动时,
# 视频帧采样可以通过 `extra_body` 进行配置(例如设置 `fps`)。
# 此功能目前仅在 vLLM 中支持。
#
# 默认情况下,`fps=2` 且 `do_sample_frames=True`。
# 当 `do_sample_frames=True` 时,您可以自定义 `fps` 值以设置所需的视频采样率。
#
# chat_response = client.chat.completions.create(
#     model="Qwen/Qwen3.8-27B",
#     messages=messages,
#     extra_body={
#         "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
#     },
# )

print("Chat response:", chat_response)
指令模式(或非思维模式)

Qwen3.8-27B 默认会在响应前进行思考。您可以通过配置 API 参数,从模型获取不经思考的直接响应。例如:

from openai import OpenAI

# 通过环境变量配置
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png"
                }
            },
            {"type": "text", "text": "Where is this?"}
        ]
    }
]

chat_response = client.chat.completions.create(

相似文章

Qwen/Qwen3.6-27B-FP8

Hugging Face Models Trending

阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。

还有人跟我一样对 Qwen 3.8 感到兴奋吗?

Reddit r/LocalLLaMA

作者表达了对即将推出的 Qwen 3.8 模型的期待,分享了他们使用 Qwen 3.6 27B 进行本地 LLM 的体验,并讨论了自托管 AI 取代基于订阅的前沿模型的潜力。