Qwen/Qwen3.8-Flash-Next
摘要
发布 Qwen3.8-Flash-Next,一款开放权重的 AI 模型,引入混合注意力(Hybrid Attention)与 QSA 以及门控残差(Gated Residual)等架构创新,提升效率和可扩展性,预览未来的 Qwen4 架构。
查看缓存全文
缓存时间: 2026/08/26 15:11
Qwen/Qwen3.8-Flash-Next · Hugging Face 来源:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
该仓库包含以 Hugging Face Transformers 格式存放的后训练模型权重与配置文件。这些组件兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等框架。 对于寻求托管、可扩展推理且无需维护基础设施的用户,官方 Qwen API 服务由 Qwen Cloud(https://www.qwencloud.com/)提供。其中,Qwen3.8-Flash 是基于 Qwen3.8-Flash-Next 的官方版本,具备更多生产级功能,例如默认支持 1M 上下文长度及官方内置工具。详情请参阅 Qwen3.8-Flash 概览(https://www.qwencloud.com/models/Qwen3.8-Flash)。 随着基础模型向更庞大的参数规模与更长的上下文窗口迈进,核心问题已不再是单纯追求规模扩展,而是如何更高效地实现。迈向惠及所有人的通用人工智能(AGI)的可持续进步需要架构创新。今天,我们分享一个具体进展:Qwen3.8-Flash-Next。
作为 Qwen4 基础架构的实验性预览版本,该设计从根本上重新思考了现代大语言模型核心组件在大规模下的协作方式。
亮点
此架构下的首个开放权重版本是 Qwen3.8-Flash-Next,其引入:
- 混合注意力与 QSA:门控 DeltaNet 与门控注意力的配对已重构为门控 DeltaNet 与 Qwen 稀疏注意力(QSA)。QSA 在微块级别操作,而非选择单个 token 处理,显著降低了长上下文延迟——这对于智能体负载日益主导的实际应用至关重要。
- 门控残差:归一化的残差流是让深度 LLM 训练可控的关键。门控残差通过逐元素、数据相关的读取门控与逐分支的标量写入门控,调节流经扩展残差流的信息,在保持训练稳定性与低推理开销的同时,实现了更细粒度的跨层表达能力。
- N-gram 嵌入:嵌入提供了一个独特的参数扩展维度,相比混合专家(MoE)更易于卸载且计算需求更低。通过短 n-gram 索引,该方法能在内存受限的加速器上实现高效的参数扩展且不损失质量。
- 定制化训练方案:Muon 与 AdamW 优化器被应用于特定权重类别以最大化效率。依据重新拟合的 scaling law,我们摒弃了传统的批量大小预热,直接从目标批量大小开始训练,在大幅减少总优化器步数的同时,安全支持更大学习率以实现稳健收敛。
更多详情请参阅我们的博客文章 Qwen3.8-Flash-Next(https://qwen.ai/blog?id=qwen3.8-flash-next)及技术报告(https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf)。
我们期待与您共同开启这一新篇章,并在构建未来的过程中欢迎您的反馈。
模型概览
- 类型:带有视觉编码器的因果语言模型
- 训练阶段:预训练与后训练
- 语言模型
- 参数量:125B,激活参数 6B,另含 51B n-gram 嵌入与 4B MTP
- 隐藏维度:2560
- Token 嵌入:248,320(填充后)
- N-gram 嵌入:20,000,000(二元/三元组,位于第 2 层)
- 层数:48
- 隐藏层布局:12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE))
- Gated DeltaNet
- 线性注意力头数:V 为 48,QK 为 16
- 头维度:128
- Qwen Sparse Attention
- 注意力头数:Q 为 24,KV 为 2
- 头维度:256
- 旋转位置嵌入维度:64
- 索引器结构:MQA,包含 4 个查询头与 1 个共享键头
- 索引器头维度:128
- 预算:512 个块或 2048 个 token
- 混合专家
- 专家数量:512
- 激活专家数:10 个路由专家 + 1 个共享专家
- 专家中间层维度:640
- Gated Residual
- 分支数:4
- 瓶颈秩:320
- LM 输出:248,320(填充后)
- MTP:1 层,通过多步训练
- 上下文长度:原生支持 262,144,可扩展至 1,000,000 token。
基准测试结果
语言
| 模型 | 参数量 | 激活参数 | N-gram 嵌入参数 | DeepSWE 1.1 | SWE-bench Pro | SWE-bench Multilingual | NL2Repo-Bench | CoWorkBench | JobBench | Agents’ Last Exam | Toolathlon Verified | IFBench | GPQA Diamond | HLE | LiveCodeBench v6 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8-Flash-Next | 125B | 6B | 51B | 58.7 | 62.5 | 81.0 | 48.1 | 73.9 | 55.7 | 51.2 | 73.5 | 81.3 | 91.7 | 35.9 | 91.9 |
| Qwen3.8-27B | 27B | 27B | - | 42.2 | 61.7 | 73.8 | 42.3 | 70.7 | 33.4 | 42.9 | 67.1 | 79.5 | 89.2 | 30.8 | 90.3 |
| Qwen3.7-Plus | 397B | 17B | - | 16.5 | 55.8 | 75.8 | 41.1 | 65.1 | 27.6 | 33.6 | 50.6 | 79.1 | 90.3 | 34.7 | 89.6 |
| DeepSeek-V4-Flash-0731 | 284B | 13B | - | 54.4 | 56.0 | - | 54.2 | 45.1 | 41.3 | - | 70.3 | 79.2 | 90.8 | 33.8 | 90.6 |
| Claude-Opus-4.6 (Max) | - | - | - | - | 53.4 | 77.5 | 47.6 | 68.2 | 36.6 | - | - | 62.5 | 91.3 | 40.0 | 88.8 |
- DeepSWE 1.1: 使用 Claude Code 和 mini-SWE-agent 框架评估,温度=1.0,top_p=0.95,256K 上下文窗口。报告两个框架中的最高分;值得注意的是,Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。
- SWE-bench Pro: 除 Claude-Opus-4.6 (Max) 报告其官方发布分数外,所有模型均使用 Claude Code 框架评估,温度=1.0,top_p=0.95,256K 上下文窗口。已修正问题任务并在改进后的基准上重新评估所有基线模型。
- SWE-bench Multilingual: 使用 mini-SWE-agent 框架评估,温度=1.0,top_p=0.95,256K 上下文窗口。
- NL2Repo-Bench: 使用 Claude Code 框架评估。为防止奖励破解,禁用了尝试访问特定代码库的 Bash 命令,如 pip download、pip install 和 git clone。
- CoWorkBench: 内部协作基准,评估跨计算机科学、金融、法律、医学及其他生产力领域的长期办公与生产力智能体任务。
- HLE: 由 GPT-4o 判定。
- 每行最佳结果以粗体显示。
- 空单元格(–):分数尚未提供或不适用。
视觉语言
| 模型 | ClawEval-MM | RecreationBench | AndroidWorld | OSWorld 2.0 | Vision2Web | ERQA | LVBench | RealWorldQA | MathVision | CharXiv (RQ) |
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3.8-Flash-Next | Pass@3 64.4 平均 60.4 | 49.9 | 84.5 | 二元 19.4 部分 52.3 | 64.0 | 72.3 | 76.6 | 88.5 | 无 CI 90.6 有 CI 95.7 | 无 CI 84.6 有 CI 90.6 |
| Qwen3.8-27B | Pass@3 57.4 平均 56.9 | 47.1 | 81.9 | 二元 19.4 部分 48.0 | 62.9 | 65.5 | 72.4 | 85.9 | 无 CI 90.0 有 CI 94.6 | 无 CI 83.7 有 CI 90.2 |
| Qwen3.7-Plus | Pass@3 57.4 平均 60.1 | 30.2 | 81.0 | 二元 2.8 部分 21.5 | 42.1 | 69.8 | 76.2 | 86.9 | 无 CI 90.3 有 CI 88.7 | 无 CI 85.8 有 CI 85.9 |
| Claude-Opus-4.6 (Max) | Pass@3 52.5 平均 54.7 | - | 62.0 | - | - | 40.8 | 63.0 | 73.9 | 无 CI 65.5 | 无 CI 66.0 |
- ClawEval-MM: 分数报告为“pass@3 / 平均分”。Pass@3 衡量至少在三次试验中一次通过的比例,平均分是三次试验的平均分数。
- RecreationBench: 内部的长期应用复现基准,评估跨五个平台(桌面端 Ubuntu、macOS、Windows,移动端 Android 及网页)的混合智能体能力。
- OSWorld 2.0: 分数报告为“二元 / 部分”。二元分数是获得完整任务奖励的任务百分比,部分分数汇总了所有任务获得的部分奖励。
- Vision2Web: 分数报告为前端、网页和网站类别的平均值,使用 Claude Code 框架评估,由 gpt-5.4-2026-03-05 判定。
- MathVision, CharXiv (RQ): 分数报告为“无 CI / 有 CI”。MathVision 中少量错误的真实标注经人工验证后已修正。我们的模型使用固定提示(如“请逐步推理,并将最终答案放在 \boxed{} 中”)评估。对于其他模型,我们报告使用与不使用 \boxed{} 格式化运行中较高的分数。
- 每行最佳结果以粗体显示。
- 空单元格(–)表示分数尚未提供或不适用。
快速开始
为便于集成,我们建议通过 API 使用 Qwen3.8-Flash-Next。
部署 Qwen3.8-Flash-Next
不同框架的推理效率和吞吐量差异显著。建议使用最新框架版本以确保最佳性能和兼容性。对于生产负载或高吞吐场景,强烈推荐使用专用服务引擎,如 SGLang、KTransformers 或 vLLM。
Qwen3.8-Flash-Next 可使用主流推理框架部署,例如:
API 使用
Qwen3.8-Flash-Next 模型默认运行于思考模式,在生成最终响应前会产生以
\\n...\\n\\n标识的思考内容。要禁用思考内容并获得直接响应,请参阅此处示例(https://huggingface.co/Qwen/Qwen3.8-Flash-Next#instruct-or-non-thinking-mode)。
建议为生成使用以下采样参数集:
- 思考模式:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0 - 指令(或非思考)模式:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
请注意,采样参数的支持因推理框架而异。
在多轮智能体任务中,较低的推理力度并不总能减少整体任务完成时间。虽然它可能产生更快的单轮响应,但也可能导致分析不足、更多失败和重复重试,从而可能增加总延迟和 token 消耗。Qwen3.8-Flash-Next 支持通过
enable_thinking、preserve_thinking和reasoning_effort控制思考行为。
Chat Completions API
Chat Completions API 可用于大多数推理框架以及 Qwen Cloud。开始之前,请确保已安装并配置了 API 密钥和 API 基础 URL,例如:
pip install -U openai
# 根据实际情况设置以下环境变量
export OPENAI_BASE_URL="http://localhost:8000/v1"
export OPENAI_API_KEY="EMPTY"
纯文本输入
from openai import OpenAI
# 通过环境变量配置
client = OpenAI()
messages = [
{"role": "user", "content": "Write a Python function to merge two sorted linked lists."},
]
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next",
messages=messages,
extra_body={
"chat_template_kwargs": {
"enable_thinking": True, # 默认开启
"preserve_thinking": True, # 默认开启
},
},
reasoning_effort="xhigh", # 默认 xhigh;支持 xhigh, medium, low
stream=True,
stream_options={"include_usage": True},
)
reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
if not chunk.choices:
print("\nUsage:")
print(chunk.usage)
continue
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
if not is_answering:
print(delta.reasoning_content, end="", flush=True)
reasoning_content += delta.reasoning_content
elif hasattr(delta, "reasoning") and delta.reasoning is not None:
if not is_answering:
print(delta.reasoning, end="", flush=True)
reasoning_content += delta.reasoning
if hasattr(delta, "content") and delta.content:
if not is_answering:
print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
is_answering = True
print(delta.content, end="", flush=True)
answer_content += delta.content
messages.append({
"role": "assistant",
"content": answer_content,
"reasoning_content": reasoning_content,
"reasoning": reasoning_content,
})
图像输入
from openai import OpenAI
# 通过环境变量配置
client = OpenAI()
messages = [
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
}
},
{
"type": "text",
"text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"
}
]
}
]
chat_response = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next",
messages=messages,
)
print("Chat response:", chat_response)
视频输入
from openai import OpenAI
# 通过环境变量配置
client = OpenAI()
messages = [
{
"role": "user",
"content": [
{
"type": "video_url",
"video_url": {
"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
}
},
{
"type": "text",
"text": "How many porcelain jars were discovered in the niches located in the primary chamber of the tomb?"
}
]
}
]
chat_response = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next",
messages=messages,
)
# 当 vLLM 使用 `--media-io-kwargs '{"video": {"num_frames": -1}}'` 启动时,
# 可通过 `extra_body`(例如设置 `fps`)配置视频帧采样。
# 此功能目前仅在 vLLM 中支持。
#
# 默认情况下,`fps=2`,`do_sample_frames=True`。
# 当 `do_sample_frames=True` 时,您可以自定义 `fps` 值以设置所需的视频采样率。
# chat_response = client.chat.completions.create(
# model="Qwen/Qwen3.8-Flash-Next",
# messages=messages,
# extra_body={
# "fps": 1,
# },
# )
相似文章
Qwen3.8-Flash-Next
Qwen 发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态 MoE 模型,拥有 125B tokens,但只有 6B 活跃参数,提供了性能提升,并作为 Qwen4 架构的早期预览。
Qwen3.8-Flash-Next: 一种新架构,迈向极致成本效率
Qwen3.8-Flash-Next 引入了一种新的人工智能架构,专注于实现模型性能的极致成本效率。
@QwenDevs: Qwen的新一波浪潮即将来临
该公告预示着Qwen3.8-Flash-Next即将开源发布,该模型由Qwen4的新型下一代架构驱动。
Qwen3.8-Flash-Next 明日发布
阿里巴巴的通义千问系列将于明日发布 Qwen3.8-Flash-Next AI 模型,可能重点提升速度和效率。
Qwen 3.8 Flash Next:以一半参数超越 DS V4 Flash,强于 Opus 4.6
Qwen团队发布了一个开放权重模型Qwen 3.8 Flash Next,它在性能上以一半的参数超越DS V4 Flash,并且强于Opus 4.6,为Qwen 4架构提供了预览。