弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型
摘要
本文系统综述了面向基于LLM的智能体的文本世界模型,涵盖基础、构建范式、在规划与训练中的应用以及评估方法。
查看缓存全文
缓存时间: 2026/06/10 05:45
论文页面 - 弥合智能体-世界差距:面向LLM智能体的文本世界模型
来源:https://huggingface.co/papers/2606.09032 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
文本世界模型作为基于大语言模型(LLM)智能体在交互式环境中的过渡模型,通过从文本状态和动作预测环境变化,支持规划和高效学习。
基于大语言模型(LLM)的智能体越来越多地应用于交互式文本环境,涵盖网页导航、代码编辑、工具使用以及长程对话等场景。然而,许多智能体仍然高度反应式,直接将观测映射到动作,缺乏对环境结构及演化方式的显式建模。这催生了文本世界模型(TWMs):即基于文本状态的过渡模型,给定一个状态和候选动作,能够预测相应的网页内容、终端输出、API响应或用户回复,从而支持规划、高效学习以及有原则的评估。我们围绕一个正式框架和智能体生命周期对面向LLM智能体的文本世界模型进行了系统性综述,组织如下:(1)基础:定义文本世界模型,并根据状态表示和基础领域对其进行表征;(2)构建:对LLM作为世界模型(LLM-as-WM)和代码作为世界模型(Code-as-WM)两种范式进行分类,并回顾构建方法;(3)应用:审视世界模型如何在训练阶段通过经验合成、在推理阶段通过规划、验证和自适应来支持智能体;(4)评估:涵盖对世界模型本身的评估,以及将其作为智能体评估环境的用途。我们旨在整合这一快速发展领域的研究,厘清其设计空间,并强调未来的开放挑战。
查看 arXiv 页面(https://arxiv.org/abs/2606.09032)| 查看 PDF(https://arxiv.org/pdf/2606.09032)| GitHub5(https://github.com/sustech-nlp/awesome-text-world-models)| 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09032)
在您的智能体中获取本文:
hf papers read 2606\.09032
没有最新命令行工具?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型(0)
暂无模型引用本文
请在一个模型的 README.md 中引用 arxiv.org/abs/2606.09032,以便从本页面链接该模型。
引用本文的数据集(0)
暂无数据集引用本文
请在一个数据集的 README.md 中引用 arxiv.org/abs/2606.09032,以便从本页面链接该数据集。
引用本文的空间(0)
暂无空间引用本文
请在一个空间的 README.md 中引用 arxiv.org/abs/2606.09032,以便从本页面链接该空间。
包含本文的收藏(1)
相似文章
为何通用人工智能需要世界模型:大型语言模型的不足与世界模型的潜在优势
本文认为,大型语言模型在因果推理和长时域规划方面存在困难,其原因在于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配,并引入了潜在动态推断视角以及Flux环境来研究这些局限性。
Qwen-AgentWorld: 通用智能体的语言世界模型
Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。
你认为World Models会通向AGI吗?
讨论World Models(通过学习内部环境表示来模拟物理和规划行动)是否能够克服类似LLMs的被动预测文本模型的局限性,从而通向AGI。
虚构世界构建:基于分层上下文压缩与迭代审核的多智能体LLM协作
本文介绍了AutoWorldBuilder,一个用于自动化虚构世界构建的多智能体LLM系统。该系统通过分层上下文压缩、基于DAG的调度和迭代审核,解决了上下文爆炸、创意多样性和质量保证问题,实现了95%的成功率,并每个世界生成了56-103个自洽概念。
模拟一切,差不多如此:世界模型的承诺与局限
一篇Ars Technica的文章探讨了世界模型作为新兴人工智能范式的承诺与局限,将其与大语言模型进行对比,并邀请了专家就其在机器人、研究和资产生成中的应用提供见解。