@_akhaliq: 论文:

X AI KOLs Following 论文

摘要

一篇批评性分析Qwen-AgentWorld论文的优质推文串,该论文提出面向通用智能体的语言世界模型。批评聚焦于模拟器保真度、基准设计及成本问题,在胡说八道指数上仅得4.5/10分。

https://t.co/jFrWGGX9wq
查看原文
查看缓存全文

缓存时间: 2026/06/25 07:15

paper: https://t.co/jFrWGGX9wq


论文页面 - Qwen-AgentWorld: 面向通用智能体的语言世界模型

来源:https://huggingface.co/papers/2606.24597 非常好的论文,但看完后我有一些抱怨。我把这些告诉了Qwen3.7,以下是它自己的结论:

胡说指数:4.5 / 10——研究真实,表述过于乐观。


问题1:50–60%的保真度对于干净的强化学习信号来说太低

辩护方:这些都是困难的分布外任务。能超越前沿模型本身就是进步,下游智能体的收益也证明了模拟器的有用性。

为什么不够:强化学习会放大分布偏移。在50%保真度下,智能体学到的不是真实的环境动态——而是学会了利用模拟器的幻觉模式。他们从未测量智能体学到了什么错误的东西,只看最终的基准分数。


问题2:他们构建了自己被评估所用的基准

辩护方:AgentWorldBench 基于前沿模型在已建立的外部基准上的真实交互。真实答案来自真实环境。

为什么不够:他们仍然控制评分标准的设计、评分维度和评判提示。即使有真实答案,评分标准的选择会默默偏向他们模型被训练去表现的行为。没有独立的复现验证。


问题3:没有消融实验将模拟器保真度与下游智能体收益关联起来

辩护方:实证结果不言自明——用世界语言模型训练的智能体优于仅用真实环境训练的智能体。机理无需完全分离。

为什么不够:没有保真度-性能曲线,你无法判断收益是来自世界模型本身、来自额外的训练计算量、还是来自任何数据增强策略都能产生的受控/对抗性轨迹。核心声明在现有呈现方式下不可证伪。


问题4:成本论点含糊其辞

辩护方:目标不是降低成本——而是可控性以及进入真实执行不可行的环境。

为什么不够:每次环境步骤运行397B参数且使用长思维链,其成本远高于真实的Docker容器。’真实环境不可行’的用例确实存在但很狭窄。对于他们测试的大多数领域——终端、网页、SWE——真实环境可访问且便宜得多。没有提供实际的成本比较。


问题5:GUI领域回避了最难的部分

辩护方:将GUI状态表示为无障碍树是一个有原则的选择,使问题在语言模型内可控。

为什么不够:真实的GUI智能体面对像素级渲染bug、动态动画以及无障碍树无法捕捉的状态。声称’模拟’Android和Web,却在经过清理的树表示上操作,这回避了问题的核心混乱,很可能夸大了这些领域的保真度分数。


我想向Qwen团队提的问题

  1. 保真度与下游性能之间的曲线是什么样的?在什么模拟器准确度下,强化学习的收益会消失?
  2. 你是否测量过智能体从模拟器学到错误的东西——那些在模拟中得分高但在真实环境中失败的行为?
  3. 模拟器的错误是随机的还是结构化的?一个有一致偏差的模拟器仍有用途。一个任意幻觉的模拟器对于强化学习就只是噪声。
  4. 在RL规模下,每个模拟步骤的实际成本与真实容器化环境相比如何?
  5. AgentWorldBench能否由外部团队仅使用你发布的评分标准复现,而不使用你内部的评判提示?
  6. 对于智能体热身阶段的收益——你是否与一个基线进行了比较?该基线使用相同的轨迹进行普通的下一个词预测训练,而没有世界模型目标。这个框架真的起了作用,还是仅仅是更多数据?

相似文章

Qwen-AgentWorld: 通用智能体的语言世界模型

Hacker News Top

Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。

Qwen/Qwen-AgentWorld-35B-A3B

Hugging Face Models Trending

Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。

unsloth/Qwen-AgentWorld-35B-A3B-GGUF

Hugging Face Models Trending

Unsloth 发布了 Qwen-AgentWorld-35B-A3B 的 GGUF 量化版本,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域(MCP、搜索、终端、SWE、Android、Web、操作系统)中的智能体环境,并通过 CPT、SFT 和 RL 进行训练。

编码代理作为世界模拟器表现良好

arXiv cs.AI

本文提出了一种基于代理的框架,利用编码代理从自然语言提示生成物理上可信的世界模拟,在物理准确性和指令保真度方面优于基于视频的模型。

Qwen-AgentWorld-397B-A17B

Reddit r/LocalLLaMA

Qwen 发布了新的大语言模型 Qwen-AgentWorld-397B-A17B,详情请见 HuggingFace 和 Qwen 博客。