Qwen-AgentWorld: 通用智能体的语言世界模型
摘要
Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。
查看缓存全文
缓存时间: 2026/06/24 04:48
# 通用代理的语言世界模型 来源:https://arxiv.org/html/2606.24597 ## Qwen\-AgentWorld:通用代理的语言世界模型 ###### 摘要 世界模型基于当前观测和动作预测环境动态,是推理与规划的核心认知机制。本文研究基于语言模型的世界建模如何进一步拓展通用代理的边界。 (i) 我们首先聚焦于构建代理环境模拟的基础模型。我们推出 Qwen\-AgentWorld\-35B\-A3B 和 Qwen\-AgentWorld\-397B\-A17B,这是首批能够通过长思维链推理模拟涵盖 7 个领域的代理环境的语言世界模型。利用 7 个领域在真实环境中超过 1000 万条交互轨迹,我们通过三阶段训练流程开发了 Qwen\-AgentWorld:CPT 从状态转移动力学和增强的专业语料库中注入通用世界建模能力,SFT 激活下一状态预测推理,RL 通过定制框架与混合评分与规则奖励机制提升模拟保真度。为了评估语言世界模型,我们提出了 AgentWorldBench,一个全面的基准测试,基于 5 个前沿模型在 9 个已建立基准(如 Tool Decathlon、Terminal\-Bench 1.0 & 2.0、OSWorld\-Verified)上的真实世界交互构建,通过基于真实情况的评分评判,从 5 个维度评估世界建模质量。实证结果表明,Qwen\-AgentWorld 显著优于现有前沿模型。 (ii) 除了基础模型,我们还研究了世界建模增强通用代理的两种互补范式。首先,作为*解耦*的环境模拟器,Qwen\-AgentWorld 支持对数千个真实世界环境进行可扩展且可控的模拟,用于代理强化学习,带来的增益超过了单独的真实环境训练。其次,作为*统一*的代理基础模型,世界模型训练作为一种高效的热身阶段,在 7 个代理基准测试上提升了下游性能。 参见图注 图 1:Qwen\-AgentWorld 概览。顶部:Qwen\-AgentWorld 是跨七个领域的统一*原生*语言世界模型。底部:我们探索两种互补策略,将世界建模应用于增强语言代理(主要使用 35B\-A3B 模型作为代理):解耦与统一,其中世界模型分别作为环境模拟器和代理基础模型。 目录 ## 1 引言 世界模型已被广泛视为迈向通用智能的基础 (Ball et al., 2025; World Labs team, 2025; Xiang et al., 2025a; Ali et al., 2025),并且越来越一致的观点认为,学习预测世界是有效行动的先决条件 (LeCun and others, 2022; Hafner et al., 2023; 2025; Assran et al., 2025)。Richenset al. (2025) 进一步证明了一个更强的论断:任何能够在足够广泛的任务范围内泛化的代理,必定已经学习了世界模型,从而将世界模型确立为通用代理不仅有用而且必需的组成部分。然而,LLM 代理运行的语言环境仍然缺乏通用的世界模型。在代理-环境交互循环中,两个互补组件至关重要:策略(状态→动作)和世界模型((状态, 动作)→后续状态)。然而,当前关于 LLM 代理的研究几乎完全集中在策略一侧。我们认为,世界建模是通往通用代理道路上缺失的关键一环。 在这项工作中,我们既探索如何实现语言世界建模,也探索如何将其应用于推动通用代理的发展。 我们首先研究语言模型中的世界建模,以开发一个基础模型——语言世界模型 (LWM),用于代理环境模拟。然后,我们研究世界建模如何通过两种互补范式来改进通用代理:将代理与世界模型解耦,或者将两者统一进单一框架。 当真实环境存在时,为什么还需要语言世界模型?不是为了降低成本,而是作为推动前沿的互补维度。 (1) 解耦:使用世界模型作为模拟器,有助于实现回合级别的可扩展性和可控性。 (i) 可扩展性:LWM 可以在不依赖专用基础设施(例如沙盒或 GUI 虚拟机)的情况下实现不同环境的回合级扩展,涵盖极端场景、真实世界任务 (OpenClaw, 2026; Patwardhan et al., 2025),以及由于不可逆操作、专有部署或缺乏公开实现而无法执行真实操作的高价值专业领域。 (ii) 可控性:LWM 提供了精确的可控性,能够创建更多样化和更具挑战性的环境,通过有针对性的扰动系统性地暴露代理弱点,而这些扰动在真实环境中很少或根本不存在。例如,它可以返回部分结果,迫使代理采取额外的交互步骤以检索完整信息。针对此类扰动进行训练,有助于代理处理仅靠真实环境训练无法覆盖的边缘情况,最终超越仅在真实环境中训练的代理 (§6.1.2)。 (2) 统一:一个能干的通用代理应同时具备决策能力和世界建模能力。世界建模是构建更强大代理的基础,因为它使代理能够预测未来状态以优化动作选择,而传统的代理训练仅关注从状态到动作的决策。直觉上,能够在下定行动决心之前预测环境反馈的代理,原则上不会比缺乏这种能力的代理表现得更差 (Richenset al., 2025)。因此,下一状态预测可以内化为一种类似于“反思”但面向未来的元级思维模式 (§6.2)。此外,准确的下一状态预测需要推理、知识、指令遵循和长上下文处理能力 (附录 7.1),而这些能力本身就是通用代理的基础。 我们提出 Qwen\-AgentWorld,这是首个通过长思维链推理模拟七种代理环境的语言世界模型:MCP、搜索、终端、软件工程、安卓、网页和操作系统。对于三个 GUI 领域,环境观测被表示为无障碍树和 UI 视图层次,而非像素帧。Qwen\-AgentWorld 是一个*原生*世界模型,通过三个阶段训练:CPT 注入状态转移动力学和世界知识,SFT 激活下一状态预测的思维模式,RL 结合混合评分与规则奖励提升模拟保真度。 为了评估 LWM,我们构建了 AgentWorldBench,这是一个涵盖所有七个领域的综合基准测试。该基准测试基于前沿模型(如 Claude Opus 4.6)在广泛使用的代理基准测试(如 Terminal\-Bench 1.0 & 2.0 (Merrill et al., 2026) 和 OSWorld\-Verified (Xie et al., 2024))上的真实环境交互构建,确保完全跨分布评估。AgentWorldBench 通过开放式评分评判,从五个维度评估模拟质量。此外,我们还针对确定性的检查设计了基于规则的验证器,用于评估关键的模拟能力。 实证评估表明,Qwen\-AgentWorld 在性能上优于现有前沿模型。我们进一步研究了世界建模改进通用代理的两种互补范式: - • 环境模拟器 (§6.1)。 我们证明 Qwen\-AgentWorld 可以模拟 4k4k 个真实世界的 OpenClaw 环境用于代理强化学习,在 Claw\-Eval (Ye et al., 2026a) 和 QwenClawBench (Team and Data, 2026) 上取得了增益。此外,可控性提供了与真实世界交互互补的显著优势,在 Tool Decathlon (Li et al., 2025a)、MCPMark (Wu et al., 2025) 和 WideSearch (Wong et al., 2025) 上带来了大幅提升。 - • 代理基础模型 (§6.2)。在 Terminal\-Bench 2.0 (Merrill et al., 2026)、SWE\-Bench Verified (Jimenez et al., 2024)、SWE\-Bench Pro (Deng et al., 2025)、BFCL v4 (Patil et al., 2025)、Claw\-Eval (Ye et al., 2026a)、QwenClawBench (Team and Data, 2026) 和 WideSearch (Wong et al., 2025) 上的全面实验表明,LWM 训练作为一种热身或辅助训练阶段。它在下游代理强化学习之前,让代理熟悉环境动态和下一状态预测,从而为启动更强的代理性能提供了关键基础。 参见图注 图 2:Qwen\-AgentWorld 在单一语言世界模型内统一了七类交互式环境模拟。 ## 2 预备知识 本节形式化定义本文研究的语言世界模型 (LWM)。我们基于语言模型,利用广泛的世界知识语料库训练世界模型,并将七个领域统一在共享的文本表示下,从而支持语言世界建模的跨域泛化。首先确立术语 (§2.1),然后提出七个领域和训练阶段共享的统一的轨迹模式 (§2.2),并形式化世界建模目标 (§2.3)。 ### 2.1 术语 本文一致使用以下术语。 LWM 训练指通过三个阶段训练世界模型本身:持续预训练 (LWM CPT, §3.2)、监督微调 (LWM SFT, §3.3) 和强化学习 (LWM RL, §3.4)。 单独地,Sim RL 使用 LWM 作为环境模拟器,通过 RL 训练策略代理 (§6.1),而 Real RL 在活跃的真实世界环境(例如实际的搜索引擎或正在运行的终端)中训练同一代理。 在本文中,轨迹指环境轨迹,结构上是代理与环境之间的多轮对话,表示为一系列 (动作, 观测) 对。相反,代理轨迹是代理针对某个任务的单次完成过程,这是一个多步工具集成的推理轨迹,交织了代理的内部思考、动作选择以及环境的观测。环境轨迹可以从代理轨迹中提取(去除代理推理,仅保留 (动作, 观测) 对),也可以直接从原始交互日志中收集。 系统提示 — 终端 LWM RL [1] 任务描述 static 你是一个终端世界模型——一个精确的终端状态模拟器。你的任务是在执行给定命令或命令序列后,预测 Linux/Unix 终端的确切输出。你的目标是在保持整个交互序列一致性和逻辑正确性的同时,尽可能忠实于真实终端行为。 给定:(1) 历史上下文(可选);(2) 当前终端状态;(3) 用户动作(按键)。 预测:执行所有动作后的确切下一终端状态。 核心职责:状态预测∣上下文维护∣行为保真度 [ ... 状态转移规则、副作用追踪、错误处理、输出格式 ... ] [2] 动作空间 static 用户动作是命令对象的 JSON 数组:{"keystrokes": "ls -la\\n", "duration": 0.1} 按键:\\n= 执行;C\-c= SIGINT;C\-d= EOF;C\-z= SIGTSTP;C\-l= 清屏 Shell 结构:管道、重定向、命令链;程序:Shell 内建命令、编辑器 (vim/nano)、REPL、分页器 [3] 初始状态 dynamic, 按轨迹注入 终端环境的初始容器快照为: OS: Ubuntu 22.04.3 LTS (x86_64) Kernel: Linux 5.15.0-134-generic 软件包:Python 3.10.12, pip 23.2.1, Node 18.17.1, gcc 11.4.0, git 2.34.1, Docker 24.0.5 磁盘:64 GB (41 GB 空闲) 内存:16 GB 工作目录:/workspace 初始终端状态为: root@6b254155-5503-4b86-837b-fd0f080ab297:/workspace# [4] 示例 static 第1轮| 动作:"git clone https://github.com/expressjs/express.git /tmp/express\\n" 观测: root@6b254155:/workspace# git clone https://github.com/expressjs/express.git /tmp/express 正在克隆到 '/tmp/express'... 第2轮| 动作:"", duration=3.0 观测: 远程:正在枚举对象:32841,完成。 远程:正在计数对象:100%(1205/1205),完成。 正在接收对象:100%(32841/32841),12.76 MiB | 8.53 MiB/s,完成。 正在解析增量:100%(21567/21567),完成。 root@6b254155:/workspace# [ ... 另外6轮演示目录导航和构建操作 ... ] [5] 模拟指令 dynamic, 按轨迹注入 模拟一个具有 CUDA 11.8 驱动且仅有 2 GB 空闲磁盘空间的系统。 pip install torch==2.1.0 应正常完成下载阶段(进度条达到 100%),然后在解压 libtorch_cuda.so 时失败,报 OSError: [Errno 28] No space left on device。 失败后,pip cache list 应报告部分下载的 .whl 文件仍然存在。 df -h 应显示 /tmp 使用率达 100%。 参见 §6.1.2 了解可控模拟能力。 图 3:终端领域 LWM RL 系统提示的剖析,展示了 §2.2 中定义的五个组件。 蓝色 = 静态(跨轨迹共享);红色 = 动态(按轨迹注入)。 ### 2.2 统一的环境轨迹模式 要在七个领域上训练单一的世界模型,而状态表示各不相同(例如终端的文件系统快照和安卓的 UI 视图层次),就需要一种共享的格式。我们采用以下统一的环境轨迹模式,应用于所有七个领域和训练阶段: 统一环境轨迹模式 system\_prompt:= task\_description⊕action\_space⊕initial\_state⊕demonstrations⊕simulation\_instruction相似文章
Qwen/Qwen-AgentWorld-35B-A3B
Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。
Qwen-AgentWorld-397B-A17B
Qwen 发布了新的大语言模型 Qwen-AgentWorld-397B-A17B,详情请见 HuggingFace 和 Qwen 博客。
@_akhaliq: 论文:
一篇批评性分析Qwen-AgentWorld论文的优质推文串,该论文提出面向通用智能体的语言世界模型。批评聚焦于模拟器保真度、基准设计及成本问题,在胡说八道指数上仅得4.5/10分。
unsloth/Qwen-AgentWorld-35B-A3B-GGUF
Unsloth 发布了 Qwen-AgentWorld-35B-A3B 的 GGUF 量化版本,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域(MCP、搜索、终端、SWE、Android、Web、操作系统)中的智能体环境,并通过 CPT、SFT 和 RL 进行训练。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua