代理编辑世界模型 (AEWM):重新思考大语言模型代理的世界建模

Hugging Face Daily Papers 论文

摘要

本文提出代理编辑世界模型(AEWM),通过建模推理和动作如何塑造未来的任务进展来增强大语言代理,并在搜索和软件工程等多个领域的基准测试中实现了显著的性能提升。

大语言模型(LLMs)的最新进展使得代理能够在多样化环境中处理长期任务。为了进一步提升代理性能,现有的语言世界模型通常预测环境观测,然而,当真实反馈可用时,重构高熵、执行相关的工具响应价值有限。同时,代理受到任务状态污染的影响,其中未支持的假设和过时的计划在历史中持续存在,扭曲了后续决策。我们提出代理编辑世界模型(AEWM),它对推理和动作如何塑造未来任务进展进行建模,而非模拟工具响应。AEWM 结合了动作判断器(Action Judge)来区分关键、探索性和噪声决策,以及状态修订(State Revision)来从相同观测历史中编辑噪声推理-动作连续体。EditAct 将这些能力与真实执行相结合,直接改变后续决策所基于的状态,而不仅仅是提供批评。我们通过中期训练和监督微调,在搜索、终端和软件工程领域训练了 AEWM。AEWM 在我们的动作判断基准测试中达到了 70.5\% 的宏 F1,超过最强前沿基线 10.6 个点。在六个基准测试和三个代理骨干网络中,EditAct 相比最强基线提高了平均分数 3.2--6.7 个点。此外,在已验证的 EditAct 轨迹上进行的拒绝采样微调,称为 AEWM-RFT,在三个领域中改进了 Self-RFT 2.2--2.6 个点,无需在线 AEWM 指导。
查看原文
查看缓存全文

缓存时间: 2026/09/25 03:45

论文页面 - Agent-Editing World Model:重新思考面向LLM智能体的世界建模

来源:https://huggingface.co/papers/2609.28416

摘要

大型语言模型(LLM)的最新进展已使智能体能够处理跨多样环境的长期任务。为进一步提升智能体性能,现有的语言世界模型通常预测环境观察结果,然而在已有真实反馈可用的情况下,重建高熵、依赖执行的工具响应价值有限。与此同时,智能体面临任务状态污染问题,即历史记录中残留着未验证的假设和过时计划,并扭曲了后续决策。我们提出了Agent-Editing World Model(AEWM),它建模推理和行动如何塑造未来的任务进展,而非模拟工具响应。AEWM结合了Action Judge来区分关键、探索性和噪声决策,以及State Revision来编辑同一观察历史下的噪声推理-行动序列。EditAct将这些能力与真实执行相结合,直接改变后续决策所依据的状态,而不仅仅是提供批判。我们通过中期训练和监督微调,在搜索、终端和软件工程领域训练了AEWM。AEWM在我们的Action Judge基准测试中取得了70.5%的宏观F1分数,超出最强基线模型10.6个百分点。在六个基准测试和三个智能体骨干网络中,EditAct相较于最强基线将平均分数提高了3.2-6.7分。此外,在经过验证的EditAct轨迹上进行拒绝采样微调(称为AEWM-RFT),在三个领域中比Self-RFT提升了2.2-2.6分,且无需在线AEWM指导。

查看arXiv页面 (https://arxiv.org/abs/2609.28416) 查看PDF (https://arxiv.org/pdf/2609.28416) 项目页面 (https://huggingface.co/RUC-AIBOX/collections) GitHub (https://github.com/RUCAIBox/Agent-Editing-World-Model) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.28416)

在你的智能体中获取这篇论文:

hf papers read 2609\.28416

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接到本文。

在模型的README.md中引用arxiv.org/abs/2609.28416,即可从本页面链接到它。

引用本文的数据集0

没有数据集链接到本文。

在数据集的README.md中引用arxiv.org/abs/2609.28416,即可从本页面链接到它。

引用本文的空间0

没有空间链接到本文。

在空间的README.md中引用arxiv.org/abs/2609.28416,即可从本页面链接到它。

包含本文的合集1

相似文章

迈向基于信念的LLM智能体世界模型

arXiv cs.AI

本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。

Qwen-AgentWorld: 通用智能体的语言世界模型

Hacker News Top

Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。