Qwen/Qwen-AgentWorld-35B-A3B
摘要
Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。
查看缓存全文
缓存时间: 2026/06/24 19:45
Qwen/Qwen-AgentWorld-35B-A3B · Hugging Face
来源:https://huggingface.co/Qwen/Qwen-AgentWorld-35B-A3B
此仓库包含 Qwen-AgentWorld-35B-A3B 的模型权重和配置文件,这是一个原生语言世界模型,专为智能体环境模拟而训练。这些工件与 Hugging Face Transformers、vLLM、SGLang 等兼容。
Qwen-AgentWorld 是首个在单个模型中覆盖七个智能体交互领域的语言世界模型。它通过长思维链推理来模拟智能体环境,根据智能体的动作和交互历史预测下一个环境状态。经过三阶段训练流程——CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟保真度——Qwen-AgentWorld 是一个原生世界模型:环境建模从 CPT 阶段起即为训练目标,而非事后添加的附加功能。
亮点
- 七个统一领域:单个模型覆盖 MCP(工具调用)、搜索、终端、SWE(软件工程)、Android、Web 和 OS——涵盖文本和图形用户界面交互环境。
- 原生世界模型:环境建模从 CPT 阶段开始,而非在通用大语言模型上进行事后适配。
- 可泛化、可扩展、可控的模拟器:对分布外环境(例如 OpenClaw)实现零样本泛化;可控扰动和虚构世界构建超越真实环境训练。
- 智能体基础模型:在单轮、非智能体轨迹上的 LWM RL 预热可迁移到多轮、工具调用的智能体任务,覆盖 7 个基准,其中 3 个完全在领域外。
模型概述
- 类型:因果语言模型(语言世界模型)
- 基座模型:Qwen3.5-35B-A3B-Base (https://huggingface.co/Qwen/Qwen3.5-35B-A3B-Base)
- 训练阶段:持续预训练(CPT)→ 监督微调(SFT)→ 强化学习(RL,GSPO)
- 参数量:总计 35B,激活 3B
- 隐藏维度:2048
- 词嵌入:248320(填充后)
- 层数:40
- 隐藏布局:10 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
- Gated DeltaNet:
- 线性注意力头数:V 为 32,QK 为 16
- 头维度:128
- Gated Attention:
- 注意力头数:Q 为 16,KV 为 2
- 头维度:256
- 旋转位置嵌入维度:64
- 混合专家(MoE):
- 专家数:256
- 激活专家数:8 路由 + 1 共享
- 专家中间维度:512
- 上下文长度:262,144 tokens
- 免责声明:训练流程中未包含任何外部 API 服务的输出。
性能
AgentWorldBench(开放式评估)
按领域平均的五维度评分标准,标准化至 0-100 分。
| 模型 | MCP | 搜索 | 终端 | SWE | Android | Web | OS | 总体 |
|---|---|---|---|---|---|---|---|---|
| GPT-5.4 | 70.10 | 37.26 | 53.69 | 66.29 | 60.00 | 51.80 | 68.58 | 58.25 |
| Claude Opus 4.8 | 54.93 | 35.14 | 59.18 | 64.10 | 61.50 | 54.66 | 66.62 | 56.59 |
| Claude Opus 4.6 | 69.90 | 29.30 | 57.51 | 64.55 | 61.74 | 51.42 | 70.20 | 57.80 |
| Gemini 3.1 Pro | 59.07 | 30.21 | 52.47 | 59.07 | 61.40 | 52.83 | 66.92 | 54.57 |
| Claude Sonnet 4.6 | 70.00 | 28.79 | 56.98 | 64.52 | 58.03 | 50.78 | 63.17 | 56.04 |
| DeepSeek-V4-Pro | 63.27 | 27.61 | 51.26 | 59.44 | 55.17 | 50.32 | 63.70 | 52.97 |
| GLM-5.1 | 67.60 | 22.46 | 47.32 | 52.07 | 59.10 | 51.50 | 59.13 | 51.31 |
| Kimi K2.6 | 65.23 | 27.48 | 52.54 | 58.77 | 58.93 | 50.20 | 60.80 | 53.42 |
| MiniMax-M2.7 | 55.82 | 27.30 | 41.62 | 37.44 | 52.40 | 50.52 | 57.73 | 46.12 |
| Qwen3.5-35B-A3B | 57.87 | 25.98 | 46.13 | 47.58 | 53.18 | 47.10 | 56.27 | 47.73 |
| Qwen3.5-397B-A17B | 68.31 | 30.81 | 55.30 | 64.44 | 54.90 | 48.55 | 60.85 | 54.74 |
| Qwen3.6-Plus | 55.28 | 21.94 | 50.58 | 59.08 | 57.65 | 50.78 | 60.33 | 50.81 |
| Qwen-AgentWorld-35B-A3B | 64.79 | 36.69 | 53.96 | 65.63 | 58.17 | 49.55 | 65.92 | 56.39 |
| Qwen-AgentWorld-397B-A17B | 68.24 | 37.82 | 57.73 | 68.49 | 60.20 | 50.98 | 67.89 | 58.71 |
快速开始
部署
Qwen-AgentWorld-35B-A3B 可通过流行的推理框架以 API 形式提供服务。以下示例命令展示了如何启动兼容 OpenAI 的 API 服务器。
模型默认上下文长度为 262,144 tokens。如果遇到内存不足(OOM)错误,请考虑减小上下文窗口。然而,由于 Qwen-AgentWorld 利用扩展上下文进行多轮环境模拟,我们建议至少保持 128K tokens 的上下文长度。
SGLang
SGLang (https://github.com/sgl-project/sglang) 是一个快速的大语言模型服务框架。
python -m sglang.launch_server \
--model-path Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3
兼容 OpenAI 的 API 将在 http://localhost:8000/v1 上可用。
vLLM
vLLM (https://github.com/vllm-project/vllm) 是一个高吞吐量、内存高效的 LLM 推理引擎。
vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--trust-remote-code
兼容 OpenAI 的 API 将在 http://localhost:8000/v1 上可用。
使用 Transformers 进行推理
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen-AgentWorld-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto",
)
messages = [
{
"role": "system",
"content": "You are a language world model simulating a Linux terminal environment. "
"Given the user's command, predict the terminal output."
},
{
"role": "user",
"content": "Action: execute_bash\nCommand: ls -la /home/user/project/"
}
]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.6)
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)
print(response)
通过 Chat Completions API 使用
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY",
)
# 终端领域示例
messages = [
{
"role": "system",
"content": "You are a language world model simulating a Linux terminal environment. "
"Given the user's command, predict the terminal output."
},
{
"role": "user",
"content": "Action: execute_bash\nCommand: ls -la /home/user/project/"
}
]
response = client.chat.completions.create(
model="Qwen/Qwen-AgentWorld-35B-A3B",
messages=messages,
max_tokens=32768,
temperature=0.6,
)
print(response.choices[0].message.content)
我们提供了领域特定的世界模型系统提示模板,位于 GitHub 仓库的
prompts/(https://github.com/QwenLM/Qwen-AgentWorld/tree/master/prompts) 目录中,涵盖全部 7 个领域。这些模板可作为使用 Qwen-AgentWorld 作为环境模拟器时的通用系统提示。每个领域文件夹包含一个system_prompt.txt(世界模型系统提示)和一个judge_system_prompt.txt(评估提示)。
在 AgentWorldBench 上进行评估
AgentWorldBench 通过五个维度(格式、事实性、一致性、真实性和质量)对语言世界模型预测的每个环境观察结果进行评分。
设置
# 克隆评估仓库
git clone https://github.com/QwenLM/Qwen-AgentWorld.git
cd Qwen-AgentWorld
# 下载基准数据
huggingface-cli download Qwen/AgentWorldBench --repo-type dataset --local-dir ./AgentWorldBench
# 安装依赖
pip install openai
运行评估
评估采用三步流程:
cd eval
# 第1步:运行世界模型推理
python eval.py infer \
--data-dir ../AgentWorldBench \
--model-base-url http://localhost:8000/v1 \
--model-name Qwen/Qwen-AgentWorld-35B-A3B \
--output-dir ./results
# 第2步:运行 LLM 评分器
export OPENAI_API_KEY="your-api-key"
python eval.py judge \
--predictions ./results/predictions.jsonl \
--judge-base-url https://api.openai.com/v1 \
--judge-model gpt-5.2-2025-12-11 \
--output-dir ./results
# 第3步:汇总并显示分数
python eval.py score --predictions ./results/judged.jsonl
最佳实践
- 采样参数:对于世界模型推理,我们推荐使用
temperature=0.6、top_p=0.95、top_k=20。模型默认使用思考模式(......)在生成预测观察结果之前推理环境状态转换。 - 足够的输出长度:对于大多数查询,我们建议输出长度为 32,768 tokens。对于长多步轨迹,可以增加最大输出长度以适应详细的环境观察。
- 领域特定的系统提示:为了获得最佳模拟保真度,请使用 GitHub 仓库
prompts/(https://github.com/QwenLM/Qwen-AgentWorld/tree/master/prompts) 目录中提供的领域特定系统提示。
引用
如果您觉得我们的工作有帮助,欢迎引用。
@article{zuo2026qwen,
title={Qwen-agentworld: language world models for general agents},
author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},
journal={arXiv preprint arXiv:2606.24597},
year={2026}
}
相似文章
Qwen-AgentWorld-35B-A3B:一个3B激活参数的MoE模型,用于模拟MCP、终端、软件工程、安卓、网页和操作系统环境
Qwen发布了Qwen-AgentWorld-35B-A3B,这是一个35B参数的MoE模型,拥有3B激活参数,旨在作为语言世界模型,模拟智能体在七个领域(包括MCP、终端、软件工程、安卓、网页和操作系统)交互时的环境响应。
unsloth/Qwen-AgentWorld-35B-A3B-GGUF
Unsloth 发布了 Qwen-AgentWorld-35B-A3B 的 GGUF 量化版本,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域(MCP、搜索、终端、SWE、Android、Web、操作系统)中的智能体环境,并通过 CPT、SFT 和 RL 进行训练。
Qwen-AgentWorld: 通用智能体的语言世界模型
Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。
Qwen-AgentWorld-397B-A17B
Qwen 发布了新的大语言模型 Qwen-AgentWorld-397B-A17B,详情请见 HuggingFace 和 Qwen 博客。
Qwen/Qwen3.6-35B-A3B
Qwen 发布 Qwen3.6-35B-A3B,一款开源权重的混合专家(MoE)模型,总参数量 35B,激活参数量 3B,在智能体编码和推理能力保持方面实现显著提升。