AgentOdyssey:面向测试时持续学习智能体的开放式长时域文本游戏生成

arXiv cs.CL 论文

摘要

介绍 AgentOdyssey,一个程序化文本游戏生成框架,旨在评估智能体在测试时持续学习的能力,包括探索、情景记忆、世界知识获取、技能学习和长时域规划。该框架突显了当前智能体与人类表现之间的显著差距。

arXiv:2606.24893v1 公告类型:新 摘要:要使智能体在与世界交互的测试过程中持续学习,它们必须能够有效探索、获取新的世界知识和技能、保留相关的情景经验,并进行长时域规划。为了评估测试时持续学习智能体的这些关键能力,我们引入了 AgentOdyssey,这是一个新颖的评估框架,它程序化生成包含丰富实体、世界动态和长时域任务的开放式文本游戏。关键的是,AgentOdyssey 超越了传统机器学习假设(即测试时不进行学习),将智能体置于一个持续的长时域环境中,在部署过程中交织学习与推理。我们进一步提出了多层面评估方法,不仅衡量游戏进展,还提供关于世界知识获取、情景记忆、物体与动作探索、动作多样性以及模型成本的诊断性测试。我们在生成的游戏中评估了多种智能体范式。实验结果显示,智能体的关键能力存在严重局限性,并揭示了影响其有效时域的因素。尽管性能随更强的基础模型而提升,但即使是最优智能体仍远低于人类表现,留下了巨大的改进空间。在智能体机制中,我们发现短期记忆对多种智能体范式有益,是智能体测试时训练的重要组成部分。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:09

# AgentOdyssey:面向测试时持续学习代理的开放式长期文本游戏生成

来源:https://arxiv.org/html/2606.24893  

\newdateformat ymd2026\-5\-29 Zehao Wen∗\*Alvin ZhangAndrew WangJianwen Xie Daniel Khashabi♡\heartsuitTianmin Shu♡\heartsuit 约翰霍普金斯大学 AgentOdyssey\.github\.io (https://agentodyssey.github.io/) ††∗共同第一作者。♡共同指导。

#### 摘要

为了让代理在测试时能够通过与世界的交互持续学习,它们必须能够有效探索、获取新的世界知识和技能、保留相关的经验片段,并在长时程上进行规划。为了评估测试时持续学习代理的这些关键能力,我们引入了 **AgentOdyssey**,这是一个新颖的评估框架,能程序化地生成具有丰富实体、世界动态和长时程任务的开放式文本游戏。关键的是,AgentOdyssey 超越了传统机器学习中“测试时不学习”的假设,将代理置于一个持续、长时程的环境中,在整个部署过程中交织学习与推理。我们进一步提出了一种多面评估方法,不仅测量游戏进度,还提供关于世界知识获取、情景记忆、物体与行动探索、行动多样性和模型成本的诊断测试。我们在生成的游戏中评估了多种代理范式。实验结果揭示了代理关键能力的临界限制,以及影响其有意义时程的因素。尽管性能随着基础模型能力的增强而提升,但即使是最优代理,其表现也远低于人类水平,留下了巨大的改进空间。在代理机制中,我们发现短期记忆对多种代理范式都有益,是代理测试时训练的重要组成部分。

参考图注
图 1:AgentOdyssey 生成游戏中的示例玩家轨迹。AgentOdyssey 游戏测试了测试时持续学习代理的五种关键能力:**探索**(寻找工作台)、**情景记忆**(回忆掉落的交易物品)、**世界知识获取**(避免危险旅行时间)、**技能学习**(通过书面配方改进制造)以及**长时程规划**(完成多步目标,例如制造用于交易的钥匙)。轨迹展示了这些能力在数百个步骤中协同工作以完成任务。

## 1 引言

表 1:用于代理的文本游戏环境比较。列从左到右依次报告:**世界**(开放或封闭)、**#实体**(实体类型;O = 物体,A = 区域,N = NPC)、**#行动**(每局游戏的动作数量)、**#目标**(每局游戏的叙事目标数量)、**污染**(评估内容是否可能出现在训练数据中)、**可扩展性**(生成更大或多样化游戏环境的能力)、**随机性**(是否存在随机动态)、**动态世界**(游戏环境是否独立于代理动作而演变)、**时程**(典型回合步数)。我们将 Voyager[Wang et al., 2023a (https://arxiv.org/html/2606.24893#bib.bib53)] 中的游戏环境用作基于文本的 Minecraft 设置,其中代理接收文本形式的世界观察并生成可执行代码动作。对于 AgentOdyssey,我们包含 ∞\bm\{\infty\} 作为游戏生成器的**理论**能力。

| 环境 | 世界 | #实体 | #行动 | #目标 | 污染 | 可扩展性 | 随机性 | 动态世界 | 时程 |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| ALFWorld[Shridhar et al., 2020 (https://arxiv.org/html/2606.24893#bib.bib46)] | 封闭 | O, A | 1 | 1 | 是 | 否 | 否 | 否 | 50 |
| Jericho[Hausknecht et al., 2020 (https://arxiv.org/html/2606.24893#bib.bib20)] | 封闭 | O, A, N | 187.2 | 1 | 是 | 否 | 是 | 否 | 100 |
| ByteSized32[Wang et al., 2023b (https://arxiv.org/html/2606.24893#bib.bib54)] | 封闭 | O | 9.8 | 1 | 否 | 是 | 否 | 否 | 12.8 |
| Minecraft (Text)[Wang et al., 2023a (https://arxiv.org/html/2606.24893#bib.bib53)] | 开放 | O, A, N | ∼\sim 300 | 是 | 否 | 是 | 是 | 是 | ∞\bm\{\infty\} |
| **AgentOdyssey** | **开放** | **O, A, N** | **∞\bm\{\infty\}** | **∞\bm\{\infty\}** | **否** | **是** | **是** | **是** | **∞\bm\{\infty\}** |

大语言模型(LLM)的进步已在数学和编程等挑战性领域展现出强大的推理和问题解决能力[Hendrycks et al., 2021 (https://arxiv.org/html/2606.24893#bib.bib22), Chen et al., 2021 (https://arxiv.org/html/2606.24893#bib.bib9), Wei et al., 2022 (https://arxiv.org/html/2606.24893#bib.bib59), Kojima et al., 2022 (https://arxiv.org/html/2606.24893#bib.bib28), Roziere et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib39), Bai et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib4), Lightman et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib32), Guo et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib19)]。基于这些成功,涌现了许多用于序列决策和具身任务的基于LLM的代理框架,其中基于LLM的代理在交互环境中进行感知、规划和行动[Yao et al., 2022b (https://arxiv.org/html/2606.24893#bib.bib64), Shinn et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib45), Huang et al., 2022 (https://arxiv.org/html/2606.24893#bib.bib25), Ahn et al., 2022 (https://arxiv.org/html/2606.24893#bib.bib1), Singh et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib48), Reed et al., 2022 (https://arxiv.org/html/2606.24893#bib.bib37), Driess et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib14), Mu et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib35), Xiang et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib60), Zhang et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib67)]。然而,现有的用于此类代理的基准和训练范式仍不足以研究真实的测试时学习。首先,传统基准隐式地假设测试时不发生学习,仅作为静态性能度量的纯推理时间评估[Li et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib31), Cheng et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib11)]。其次,即使考虑学习,它也不是评估过程中的持续过程;相反,代理在评估前会经历多个回合的训练[Shridhar et al., 2020 (https://arxiv.org/html/2606.24893#bib.bib46), Côté et al., 2018 (https://arxiv.org/html/2606.24893#bib.bib13), Wang et al., 2025c (https://arxiv.org/html/2606.24893#bib.bib58), Feng et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib16)]。总之,这些范式掩盖了现实世界代理面临的一个核心挑战:在初始训练之后,学习必须在整个生命周期中持续进行。

在这项工作中,我们研究**测试时持续学习代理**,它们与世界交互,持续获取必要的新知识和技能,并在测试时部署过程中有意义地改进。这与传统的持续学习形成对比,后者通常假设一个非交互式设置以及训练和测试之间的明确界限[McCloskey and Cohen, 1989 (https://arxiv.org/html/2606.24893#bib.bib34), Kirkpatrick et al., 2017 (https://arxiv.org/html/2606.24893#bib.bib27), Lopez-Paz and Ranzato, 2017 (https://arxiv.org/html/2606.24893#bib.bib33), Shin et al., 2017 (https://arxiv.org/html/2606.24893#bib.bib44)]。测试时持续学习可以在无需参数更新的情况下发生,其中基于检索的条件化和上下文内机制驱动学习;也可以在参数更新的情况下发生,其中代理通过测试时训练来学习。从人类认知发展中汲取灵感[Gopnik and Meltzoff, 1997 (https://arxiv.org/html/2606.24893#bib.bib17), Spelke and Kinzler, 2007 (https://arxiv.org/html/2606.24893#bib.bib49)],我们假设成功的测试时持续学习代理需要五种关键能力:**探索**、**情景记忆**、**世界知识获取**、**技能学习**和**长时程规划**。这些能力相互增强,并共同塑造在长时程、不可重置环境中的表现。探索和规划帮助代理收集新颖的经验,从中获得世界知识和技能,解锁未来经验,形成正反馈循环。记忆是这一循环的核心:过去的经验、知识和技能通常对未来成功至关重要,使得遗忘或泛化不良代价高昂。因此,记忆不能是被动的观察和行动日志;它必须通过将情景经验抽象为语义知识并保留因果、决策相关信息以供未来规划来支持学习。

为了研究测试时持续学习代理的关键能力,我们引入了 **AgentOdyssey**,这是一个新颖的评估框架,能程序化地生成具有丰富、长时程环境的开放式文本游戏。如图 1 (https://arxiv.org/html/2606.24893#S0.F1) 所示,生成的游戏具有以下特点:(1) 关于实体(如区域、物体和NPC)的新颖且多样的世界知识,以及代理必须探索和获取的世界动态;(2) 鼓励技能学习的丰富游戏机制,例如记笔记;(3) 具有挑战性的长时程任务,要求代理将目标分解为子目标,随时间管理目标,并使用情景记忆进行更有效的规划。与视频游戏[Chen et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib10), Hu et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib24)]、计算机任务[Tan et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib51), Xie et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib61), Wang et al., 2025a (https://arxiv.org/html/2606.24893#bib.bib55)] 和具身3D环境[Ren et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib38), Zhuang et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib75), Zhou et al., 2025b (https://arxiv.org/html/2606.24893#bib.bib72)] 相比,这些文本游戏将关键代理能力与其他挑战(如感知、视觉定位和低级控制)分离开来。它们还允许在高度可控和可重复的设置中研究代理,同时捕捉现实世界决策的重要动态。

在 AgentOdyssey 中,我们开发了一个游戏生成引擎,由基于LLM的实体和规则合成驱动,并立足于长时程游戏的本体论,如图2 (https://arxiv.org/html/2606.24893#S3.F2) 所示。该引擎可以生成无限且多样化的游戏实体,包括地点、物体和非玩家角色(NPC),以及游戏规则,包括定义动作效果的动作规则和定义环境动态(例如,NPC行为)的步骤规则。关键的是,它还验证游戏正确性,并通过程序合成自动修复任何问题。除了游戏生成,我们设计了多面度量来基准测试代理性能。与典型的基于游戏的评估不同,我们引入了一套诊断测试来探测代理的能力,这些能力并不直接反映在游戏进度中,例如世界知识、情景记忆、物体和行动探索、行动多样性以及模型成本,从而进一步量化代理在长时程内的演化。

总之,我们的主要贡献包括:(1) **AgentOdyssey**,第一个用于研究测试时持续学习代理五种关键能力的游戏生成引擎;(2) 一种新的多面评估方法,用于测量游戏进度和诊断关键能力;(3) 对多种代理范式的实证研究,揭示了当前代理的临界限制、影响其有意义时程的因素,以及短期记忆在代理测试时训练中的重要性。

## 2 相关工作

**用于评估代理的文本游戏。** 已有各种用于代理评估的环境,包括视频游戏[Bellemare et al., 2013 (https://arxiv.org/html/2606.24893#bib.bib7), Kempka et al., 2016 (https://arxiv.org/html/2606.24893#bib.bib26)]、具身模拟器[Ren et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib38), Zhuang et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib75), Zhou et al., 2025b (https://arxiv.org/html/2606.24893#bib.bib72), Li et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib31), Cheng et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib11)],以及网络和操作系统环境[Yao et al., 2022a (https://arxiv.org/html/2606.24893#bib.bib63), Zhou et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib73), Xie et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib61)]。然而,它们并不能完全支持评估我们为测试时持续学习代理提出的五种关键能力。具体来说,除了LLM可能已经学到的常识性世界知识和典型的现实世界技能之外,很难生成代理必须学习的新颖世界知识和技能。此外,在这些环境中取得成功还需要额外的能力,如感知、视觉定位以及中低级甚至低级控制,这超出了我们提出的测试时持续学习评估的范围。因此,在这项工作中,我们专注于文本游戏[Narasimhan et al., 2015 (https://arxiv.org/html/2606.24893#bib.bib36), He et al., 2016 (https://arxiv.org/html/2606.24893#bib.bib21), Côté et al., 2018 (https://arxiv.org/html/2606.24893#bib.bib13), Shridhar et al., 2020 (https://arxiv.org/html/2606.24893#bib.bib46), Wang et al., 2023a (https://arxiv.org/html/2606.24893#bib.bib53), Hu et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib24)]。如表1 (https://arxiv.org/html/2606.24893#S1.T1) 所示,与我们的 AgentOdyssey 框架不同,现有的文本游戏环境仍然缺乏评估持续代理所需的关键特性,包括可扩展性、动作无关动态和长时程。

**测试时持续学习代理。** 记忆是代理支持测试时持续学习的核心。它可以大致分为5类:(1) 基于RAG的代理:代理使用检索增强生成(RAG)将经验和知识存储在外部队列中作为记忆[Zhao et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib70), Chhikara et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib12), Wang et al., 2023a (https://arxiv.org/html/2606.24893#bib.bib53)]。(2) 长上下文代理:代理在每一步将经验和知识附加到上下文窗口中。(3) 固定大小记忆代理:为记忆维持固定的上下文长度。最简单的实现是固定步数的滑动窗口,作为过去经验的短期记忆。近期工作 MEM1[Zhou et al., 2025c (https://arxiv.org/html/2606.24893#bib.bib74)] 使用推理更新记忆,而 MemAgent[Yu et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib65)] 使用强化学习(RL)更新记忆。(4) 潜在记忆代理:使用隐式表示来编码和检索记忆[Wang et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib56), 2025b (https://arxiv.org/html/2606.24893#bib.bib57), Zhang et al., 2025a (https://arxiv.org/html/2606.24893#bib.bib66)]。(5) 参数记忆代理:通过监督微调(SFT)[Chen et al., 2023 (https://arxiv.org/html/2606.24893#bib.bib8)] 或 RL[Wang et al., 2025c (https://arxiv.org/html/2606.24893#bib.bib58), Feng et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib16)] 更新模型参数。其他在推理时通过调整部分模型权重来建模上下文依赖的测试时训练方法也与我们的工作高度相关[Sun et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib50), Behrouz et al., 2024 (https://arxiv.org/html/2606.24893#bib.bib5), Zhang et al., 2025b (https://arxiv.org/html/2606.24893#bib.bib68), Behrouz et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib6), Tandon et al., 2025 (https://arxiv.org/html/2606.24893#bib.bib52)]。

## 3 AgentOdyssey

参考图注
图 2:AgentOdyssey

相似文章

EvoTest:面向自我改进智能体系统的进化式测试时学习

arXiv cs.CL

EvoTest 引入了 J-TTL,一个衡量智能体测试时学习能力的基准,并提出了一个进化框架,其中 Actor 智能体玩游戏,而 Evolver 智能体在不进行微调的情况下迭代改进系统的提示、记忆和超参数。该方法在基于复杂文本的游戏中表现出优于基于反思和记忆的基线方法的性能。