代理编辑世界模型 (AEWM):重新思考大语言模型代理的世界建模
摘要
本文提出代理编辑世界模型(AEWM),通过建模推理和动作如何塑造未来的任务进展来增强大语言代理,并在搜索和软件工程等多个领域的基准测试中实现了显著的性能提升。
查看缓存全文
缓存时间: 2026/09/25 03:45
论文页面 - Agent-Editing World Model:重新思考面向LLM智能体的世界建模
来源:https://huggingface.co/papers/2609.28416
摘要
大型语言模型(LLM)的最新进展已使智能体能够处理跨多样环境的长期任务。为进一步提升智能体性能,现有的语言世界模型通常预测环境观察结果,然而在已有真实反馈可用的情况下,重建高熵、依赖执行的工具响应价值有限。与此同时,智能体面临任务状态污染问题,即历史记录中残留着未验证的假设和过时计划,并扭曲了后续决策。我们提出了Agent-Editing World Model(AEWM),它建模推理和行动如何塑造未来的任务进展,而非模拟工具响应。AEWM结合了Action Judge来区分关键、探索性和噪声决策,以及State Revision来编辑同一观察历史下的噪声推理-行动序列。EditAct将这些能力与真实执行相结合,直接改变后续决策所依据的状态,而不仅仅是提供批判。我们通过中期训练和监督微调,在搜索、终端和软件工程领域训练了AEWM。AEWM在我们的Action Judge基准测试中取得了70.5%的宏观F1分数,超出最强基线模型10.6个百分点。在六个基准测试和三个智能体骨干网络中,EditAct相较于最强基线将平均分数提高了3.2-6.7分。此外,在经过验证的EditAct轨迹上进行拒绝采样微调(称为AEWM-RFT),在三个领域中比Self-RFT提升了2.2-2.6分,且无需在线AEWM指导。
查看arXiv页面 (https://arxiv.org/abs/2609.28416) 查看PDF (https://arxiv.org/pdf/2609.28416) 项目页面 (https://huggingface.co/RUC-AIBOX/collections) GitHub (https://github.com/RUCAIBox/Agent-Editing-World-Model) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.28416)
在你的智能体中获取这篇论文:
hf papers read 2609\.28416
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接到本文。
在模型的README.md中引用arxiv.org/abs/2609.28416,即可从本页面链接到它。
引用本文的数据集0
没有数据集链接到本文。
在数据集的README.md中引用arxiv.org/abs/2609.28416,即可从本页面链接到它。
引用本文的空间0
没有空间链接到本文。
在空间的README.md中引用arxiv.org/abs/2609.28416,即可从本页面链接到它。
包含本文的合集1
相似文章
弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型
本文系统综述了面向基于LLM的智能体的文本世界模型,涵盖基础、构建范式、在规划与训练中的应用以及评估方法。
迈向基于信念的LLM智能体世界模型
本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。
超越下一观测预测:面向顺序决策的智能体自主世界建模
本文提出了一种名为“智能体自主世界建模”(AAWM)的训练流程,该流程基于策略自身的决策需求构建世界模型监督,而非依赖下一观测预测,从而使学习目标与有效决策所需的动态特性对齐。
Qwen-AgentWorld: 通用智能体的语言世界模型
Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。
@dair_ai: 一个LLM代理真的能构建它无法看到的环境模型吗?这项工作使这个问题可评分。一个代理…
一篇研究论文提出了‘智能体自动机学习’来评估LLM代理是否能通过交互推断隐藏的世界模型,发现性能随着任务复杂度的增加而急剧下降,并且推理模型优于非推理模型,但仍然存在困难。