Qwen/Qwen-AgentWorld-35B-A3B

Hugging Face Models Trending 模型

摘要

Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。

任务: text-generation 标签: transformers, safetensors, qwen3_5_moe, image-text-to-text, qwen, world-model, agent, environment-simulation, text-generation, conversational, 数据集:Qwen/AgentWorldBench, arxiv:2606.24597, 基础模型:Qwen/Qwen3.5-35B-A3B-Base, 基础模型:finetune:Qwen/Qwen3.5-35B-A3B-Base, 许可协议:apache-2.0, 端点兼容, 区域:us
查看原文
查看缓存全文

缓存时间: 2026/06/24 19:45

Qwen/Qwen-AgentWorld-35B-A3B · Hugging Face

来源:https://huggingface.co/Qwen/Qwen-AgentWorld-35B-A3B

此仓库包含 Qwen-AgentWorld-35B-A3B 的模型权重和配置文件,这是一个原生语言世界模型,专为智能体环境模拟而训练。这些工件与 Hugging Face Transformers、vLLM、SGLang 等兼容。

Qwen-AgentWorld 是首个在单个模型中覆盖七个智能体交互领域的语言世界模型。它通过长思维链推理来模拟智能体环境,根据智能体的动作和交互历史预测下一个环境状态。经过三阶段训练流程——CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟保真度——Qwen-AgentWorld 是一个原生世界模型:环境建模从 CPT 阶段起即为训练目标,而非事后添加的附加功能。

亮点

  • 七个统一领域:单个模型覆盖 MCP(工具调用)、搜索、终端、SWE(软件工程)、Android、Web 和 OS——涵盖文本和图形用户界面交互环境。
  • 原生世界模型:环境建模从 CPT 阶段开始,而非在通用大语言模型上进行事后适配。
  • 可泛化、可扩展、可控的模拟器:对分布外环境(例如 OpenClaw)实现零样本泛化;可控扰动和虚构世界构建超越真实环境训练。
  • 智能体基础模型:在单轮、非智能体轨迹上的 LWM RL 预热可迁移到多轮、工具调用的智能体任务,覆盖 7 个基准,其中 3 个完全在领域外。

模型概述

  • 类型:因果语言模型(语言世界模型)
  • 基座模型:Qwen3.5-35B-A3B-Base (https://huggingface.co/Qwen/Qwen3.5-35B-A3B-Base)
  • 训练阶段:持续预训练(CPT)→ 监督微调(SFT)→ 强化学习(RL,GSPO)
  • 参数量:总计 35B,激活 3B
  • 隐藏维度:2048
  • 词嵌入:248320(填充后)
  • 层数:40
  • 隐藏布局:10 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
  • Gated DeltaNet:
    • 线性注意力头数:V 为 32,QK 为 16
    • 头维度:128
  • Gated Attention:
    • 注意力头数:Q 为 16,KV 为 2
    • 头维度:256
  • 旋转位置嵌入维度:64
  • 混合专家(MoE):
    • 专家数:256
    • 激活专家数:8 路由 + 1 共享
    • 专家中间维度:512
  • 上下文长度:262,144 tokens
  • 免责声明:训练流程中未包含任何外部 API 服务的输出。

性能

AgentWorldBench(开放式评估)

按领域平均的五维度评分标准,标准化至 0-100 分。

模型MCP搜索终端SWEAndroidWebOS总体
GPT-5.470.1037.2653.6966.2960.0051.8068.5858.25
Claude Opus 4.854.9335.1459.1864.1061.5054.6666.6256.59
Claude Opus 4.669.9029.3057.5164.5561.7451.4270.2057.80
Gemini 3.1 Pro59.0730.2152.4759.0761.4052.8366.9254.57
Claude Sonnet 4.670.0028.7956.9864.5258.0350.7863.1756.04
DeepSeek-V4-Pro63.2727.6151.2659.4455.1750.3263.7052.97
GLM-5.167.6022.4647.3252.0759.1051.5059.1351.31
Kimi K2.665.2327.4852.5458.7758.9350.2060.8053.42
MiniMax-M2.755.8227.3041.6237.4452.4050.5257.7346.12
Qwen3.5-35B-A3B57.8725.9846.1347.5853.1847.1056.2747.73
Qwen3.5-397B-A17B68.3130.8155.3064.4454.9048.5560.8554.74
Qwen3.6-Plus55.2821.9450.5859.0857.6550.7860.3350.81
Qwen-AgentWorld-35B-A3B64.7936.6953.9665.6358.1749.5565.9256.39
Qwen-AgentWorld-397B-A17B68.2437.8257.7368.4960.2050.9867.8958.71

快速开始

部署

Qwen-AgentWorld-35B-A3B 可通过流行的推理框架以 API 形式提供服务。以下示例命令展示了如何启动兼容 OpenAI 的 API 服务器。

模型默认上下文长度为 262,144 tokens。如果遇到内存不足(OOM)错误,请考虑减小上下文窗口。然而,由于 Qwen-AgentWorld 利用扩展上下文进行多轮环境模拟,我们建议至少保持 128K tokens 的上下文长度。

SGLang

SGLang (https://github.com/sgl-project/sglang) 是一个快速的大语言模型服务框架。

python -m sglang.launch_server \
    --model-path Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tp-size 4 \
    --context-length 262144 \
    --reasoning-parser qwen3

兼容 OpenAI 的 API 将在 http://localhost:8000/v1 上可用。

vLLM

vLLM (https://github.com/vllm-project/vllm) 是一个高吞吐量、内存高效的 LLM 推理引擎。

vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --trust-remote-code

兼容 OpenAI 的 API 将在 http://localhost:8000/v1 上可用。

使用 Transformers 进行推理

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen-AgentWorld-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto",
)

messages = [
    {
        "role": "system",
        "content": "You are a language world model simulating a Linux terminal environment. "
                   "Given the user's command, predict the terminal output."
    },
    {
        "role": "user",
        "content": "Action: execute_bash\nCommand: ls -la /home/user/project/"
    }
]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.6)
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)
print(response)

通过 Chat Completions API 使用

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY",
)

# 终端领域示例
messages = [
    {
        "role": "system",
        "content": "You are a language world model simulating a Linux terminal environment. "
                   "Given the user's command, predict the terminal output."
    },
    {
        "role": "user",
        "content": "Action: execute_bash\nCommand: ls -la /home/user/project/"
    }
]

response = client.chat.completions.create(
    model="Qwen/Qwen-AgentWorld-35B-A3B",
    messages=messages,
    max_tokens=32768,
    temperature=0.6,
)

print(response.choices[0].message.content)

我们提供了领域特定的世界模型系统提示模板,位于 GitHub 仓库的 prompts/ (https://github.com/QwenLM/Qwen-AgentWorld/tree/master/prompts) 目录中,涵盖全部 7 个领域。这些模板可作为使用 Qwen-AgentWorld 作为环境模拟器时的通用系统提示。每个领域文件夹包含一个 system_prompt.txt(世界模型系统提示)和一个 judge_system_prompt.txt(评估提示)。

在 AgentWorldBench 上进行评估

AgentWorldBench 通过五个维度(格式、事实性、一致性、真实性和质量)对语言世界模型预测的每个环境观察结果进行评分。

设置

# 克隆评估仓库
git clone https://github.com/QwenLM/Qwen-AgentWorld.git
cd Qwen-AgentWorld

# 下载基准数据
huggingface-cli download Qwen/AgentWorldBench --repo-type dataset --local-dir ./AgentWorldBench

# 安装依赖
pip install openai

运行评估

评估采用三步流程:

cd eval

# 第1步:运行世界模型推理
python eval.py infer \
    --data-dir ../AgentWorldBench \
    --model-base-url http://localhost:8000/v1 \
    --model-name Qwen/Qwen-AgentWorld-35B-A3B \
    --output-dir ./results

# 第2步:运行 LLM 评分器
export OPENAI_API_KEY="your-api-key"
python eval.py judge \
    --predictions ./results/predictions.jsonl \
    --judge-base-url https://api.openai.com/v1 \
    --judge-model gpt-5.2-2025-12-11 \
    --output-dir ./results

# 第3步:汇总并显示分数
python eval.py score --predictions ./results/judged.jsonl

最佳实践

  1. 采样参数:对于世界模型推理,我们推荐使用 temperature=0.6、top_p=0.95、top_k=20。模型默认使用思考模式(......)在生成预测观察结果之前推理环境状态转换。
  2. 足够的输出长度:对于大多数查询,我们建议输出长度为 32,768 tokens。对于长多步轨迹,可以增加最大输出长度以适应详细的环境观察。
  3. 领域特定的系统提示:为了获得最佳模拟保真度,请使用 GitHub 仓库 prompts/ (https://github.com/QwenLM/Qwen-AgentWorld/tree/master/prompts) 目录中提供的领域特定系统提示。

引用

如果您觉得我们的工作有帮助,欢迎引用。

@article{zuo2026qwen,
  title={Qwen-agentworld: language world models for general agents},
  author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},
  journal={arXiv preprint arXiv:2606.24597},
  year={2026}
}

相似文章

unsloth/Qwen-AgentWorld-35B-A3B-GGUF

Hugging Face Models Trending

Unsloth 发布了 Qwen-AgentWorld-35B-A3B 的 GGUF 量化版本,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域(MCP、搜索、终端、SWE、Android、Web、操作系统)中的智能体环境,并通过 CPT、SFT 和 RL 进行训练。

Qwen-AgentWorld: 通用智能体的语言世界模型

Hacker News Top

Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。

Qwen-AgentWorld-397B-A17B

Reddit r/LocalLLaMA

Qwen 发布了新的大语言模型 Qwen-AgentWorld-397B-A17B,详情请见 HuggingFace 和 Qwen 博客。

Qwen/Qwen3.6-35B-A3B

Hugging Face Models Trending

Qwen 发布 Qwen3.6-35B-A3B,一款开源权重的混合专家(MoE)模型,总参数量 35B,激活参数量 3B,在智能体编码和推理能力保持方面实现显著提升。