大语言模型并非优秀战略家,但记忆增强的代理能力可提升推理
摘要
本文介绍了 EpicStar 框架,该框架利用情景记忆和动态检索帮助 LLM 代理在星际争霸 II 等长时程任务中保持战略连贯性,以显著更少的 token 实现更高的胜率。
arXiv:2608.12626v1 公告类型:新
摘要:在长时程环境中,大语言模型(LLM)的战略推理往往受限于不一致的子目标。在这些场景中,有限的注意力资源使模型无法在数千步中保持战略连贯性。这一限制导致战略漂移,即局部决策无法在推理过程中维持连贯的轨迹。为解决此问题,我们提出了 EpicStar 框架,该框架使代理能够将记忆作为策略来学习,以应对长时程推理。具体而言,代理维护一个成功过往情节的库作为启发式信息,同时使用工作记忆来跟踪短期环境变化。在推理期间,动态门控机制决定是直接执行检索到的动作,还是通过检索情节与当前工作记忆的上下文融合进行新的推理。以星际争霸 II 作为测试平台,我们针对多种对手风格评估了 EpicStar。它显著优于基线方法,以少一个数量级的 token 消耗实现更高的胜率,并且在难度级别和对手策略上保持一致的优势。我们的研究结果提供了有力证据,表明结构化的跨情节记忆对于使 LLM 代理在动态、自主环境中执行稳健的长期战略执行至关重要。
查看缓存全文
缓存时间: 2026/08/14 09:26
# LLM并非优秀战略家,但记忆增强的智能体提升了推理能力 来源:https://arxiv.org/html/2608.12626 Yi Wu 感谢:同等贡献。作者顺序按名字字母顺序排列,每位作者保留在自己的记录中将名字列为首位的权利。该论文发表于 ICLR 2025 LLM推理与规划研讨会。 机构:芝加哥大学 邮箱:[[email protected]](mailto:) Zhimin Hu11footnotemark:1 ###### 摘要 大型语言模型(LLMs)在长时域环境中的战略推理常常受限于不一致的子目标。在这些环境中,有限的注意力资源使模型无法在数千步内维持战略连贯性。这种限制导致了策略漂移,即局部决策无法在推理过程中维持连贯的轨迹。为解决这一问题,我们引入了 EpicStar,一个使智能体能够将记忆作为策略来学习,从而应对长时域推理的框架。具体而言,智能体维护一个成功历史片段库作为启发式信息,同时利用工作记忆来追踪短期环境变化。在推理过程中,动态门控机制决定是直接执行检索到的动作,还是通过检索片段与当前工作记忆的上下文融合来进行新推理。以星际争霸II为测试平台,我们评估了EpicStar面对多种对手风格的表现。它显著优于基线方法,在实现更高胜率的同时消耗了数量级更少的token,并且在不同难度级别和对手策略下均能保持这一优势。我们的研究结果提供了有力证据,表明结构化的跨片段记忆对于使LLM智能体在动态、自主环境中执行稳健的长期战略至关重要。 ## 1 引言 在动态且部分可观测的环境中进行战略推理,对大型语言模型(LLMs)而言是一项严峻挑战。智能体必须在适应快速环境变化的同时,维持连贯的长期轨迹。星际争霸II长期以来一直是此类能力的测试平台,因为它要求玩家在数千个时间步内同时协调资源管理、科技扩张和单位控制。虽然LLMs在短时域场景中已经达到了人类水平的推理能力(13 (https://arxiv.org/html/2608.12626#bib.bib14);9 (https://arxiv.org/html/2608.12626#bib.bib1)),但在长距离序列推理任务中,它们的表现往往会下降。我们认为,这种失败主要是由于智能体倾向于逐渐过拟合于局部观测,从而失去对全局目标的把握。现有的缓解这些问题的尝试要么依赖更多提示循环来压缩信息(12 (https://arxiv.org/html/2608.12626#bib.bib2)),要么引入更多规则来稳定推理(15 (https://arxiv.org/html/2608.12626#bib.bib5))。在本文中,我们认为稳健的战略推理需要从被动提示转向对过往经验的结构化复用(10 (https://arxiv.org/html/2608.12626#bib.bib15))。我们引入了 EpicStar,一个将情景检索与情境调制相结合作为推理策略的智能体框架。EpicStar 将成功的游戏片段持续存储在一个结构化的记忆库中。在推理时,智能体检索相关片段,作为指导其推理的战略启发式信息。为了对新情况保持响应,EpicStar 维护一个工作记忆以追踪环境变化,并采用动态门控机制来平衡直接复用过去的动作与为情境适应而进行的新推理之间的取舍。此外,在情境适应中,检索到的片段通过上下文对齐机制进行融合,为持续推理提供高层次的上下文和结构。 图1:EpicStar 架构概览。该智能体由不同的记忆组件及其交互组成。情景记忆(左侧蓝色面板)存储游戏片段,用于检索和长期学习。工作记忆由一个短期缓存和门控机制组成,管理探索与利用,在连贯规划与动态适应之间取得平衡。上下文融合使得工作记忆与情景记忆之间能够进行双向调制,促进即时上下文与过往战略知识的整合。 我们使用 TextStarCraft II(12 (https://arxiv.org/html/2608.12626#bib.bib2))在星际争霸II中评估了 EpicStar,并选择其 Chain of Summarization (CoS) 方法作为主要基线,因为它与我们的方法具有最可比的假设和设计范围。我们重点关注第5级和第6级游戏难度,这大致对应入门级和高于平均水平的人类表现,同时也是 CoS 开始显现性能退化迹象的阈值。我们发现 EpicStar 在两个难度级别上均持续优于 CoS,实现了更高的胜率(表1 (https://arxiv.org/html/2608.12626#S4.T1)),同时消耗更少的token。此外,它在多样化战略条件下展现出显著提升的适应性(图2 (https://arxiv.org/html/2608.12626#S5.F2))。总之,我们的贡献有三个方面:1) 我们引入了 EpicStar,一个基于LLM的智能体框架,结合了结构化情景记忆以支持长时域战略推理。EpicStar 通过检索和调整过去的轨迹来缓解策略漂移,从而随着时间的推移保持连贯性;2) 我们提出了一种情境调制机制,在过往经验与实时上下文之间取得平衡。这包括一个动态门控模块,将情景回忆与工作记忆整合起来,以及一个上下文融合步骤,将检索到的片段转化为战略指导;3) 我们提供了实证证据,表明情景记忆和工作记忆对战略表现都是必不可少的。即使少量高质量的情景记忆也能带来胜率和适应性的显著提升。代码可在 https://github.com/ethanyiwu/EpicStar 获取。 ## 2 相关工作 ### 2.1 游戏智能体 基于LLM的游戏智能体领域建立在几个关于智能体设计的基本思想之上:1) 智能体可以从自身行动失败中学习并反思其推理(21 (https://arxiv.org/html/2608.12626#bib.bib8);16 (https://arxiv.org/html/2608.12626#bib.bib9));智能体可以配备外部知识(11 (https://arxiv.org/html/2608.12626#bib.bib16));智能体可以学习使用工具(14 (https://arxiv.org/html/2608.12626#bib.bib11))。这些进展促使LLM智能体在更复杂的游戏场景中的开发蓬勃发展。首先,Voyager(18 (https://arxiv.org/html/2608.12626#bib.bib7))通过在 Minecraft 中执行可执行代码来自主构建程序性技能工具包。相反,PokeLLMon(5 (https://arxiv.org/html/2608.12626#bib.bib4))检索外部知识并使用记忆进行游戏内反思,以优化 Pokémon 中的高层策略。3 (https://arxiv.org/html/2608.12626#bib.bib17) 和 6 (https://arxiv.org/html/2608.12626#bib.bib18) 利用外部游戏数据集训练语言模型来下国际象棋和打扑克。 ### 2.2 星际争霸II智能体 在众多游戏中,星际争霸II在测试长时域战略推理方面具有独特性。作为部分可观测环境中的实时策略游戏,它要求玩家在多源信息约束下进行推理,并在大量步骤中调整策略。该领域的复杂性首先通过 PySC2 接口(2 (https://arxiv.org/html/2608.12626#bib.bib10))向智能体研究开放,该接口提供低层状态信息和控制。这一接口推动了诸如 AlphaStar(17 (https://arxiv.org/html/2608.12626#bib.bib3))等基于强化学习的智能体的发展,后者通过大规模自我对弈实现了超人类表现,但计算成本高昂且泛化能力有限。最近,SwarmBrain(15 (https://arxiv.org/html/2608.12626#bib.bib5))将该低层接口应用于LLMs。虽然它试图通过记录所用策略的语义描述日志从游戏对局中学习,但其学习本质上是面向低层控制的,缺乏上下文丰富性。之后,TextStarCraft II 接口(12 (https://arxiv.org/html/2608.12626#bib.bib2))被引入,摆脱了微观操作,将游戏重新定义为高层战略挑战。我们的工作正属于这一范式。其 CoS 方法是一个强大的基线,使用滑窗摘要作为工作记忆,将复杂的高维状态信息提炼为简洁、可操作的表征。然而,一个明显的空白仍然存在:现有的面向星际争霸II等高层战略推理的智能体中,没有一个以结构化方式从自身游戏经验中学习。 ## 3 基于记忆的推理 ### 3.1 任务形式化 星际争霸II中的战略推理可以被概念化为一个序贯决策过程,其特征由元组 \(S,A,T,R,Z,O\) 描述。\(S\) 表示世界的实际状态空间,其中 \(S=\{s_{1},s_{2},\ldots,s_{N}\}\) 是系统可能处于的所有可能状态的集合。\(A\) 表示动作空间,\(A=\{a_{1},a_{2},\ldots,a_{M}\}\) 是智能体可以采取的动作集合。在部分可观测环境中,智能体可以访问一个观测空间 \(O=\{o_{1},o_{2},\ldots,o_{K}\}\)。\(T\) 作为状态转移函数,\(T\left(s^{\prime}\mid s,a\right)=P\left(s^{\prime}\mid s,a\right)\),而 \(Z\) 是观测函数,\(Z\left(o\mid s^{\prime},a\right)\),表示智能体采取动作 \(a\) 并转移到状态 \(s^{\prime}\) 后接收到观测 \(o\) 的概率。在此框架中,智能体不会收到直接奖励 \(R(s,a)\),而是观察到游戏的结局——要么胜利,要么失败。与传统强化学习不同,我们不直接估计 \(T\) 和 \(Z\),而是依赖LLM推理结合记忆机制来最大化期望累积奖励。 算法1 工作记忆的探索与利用 - \(W(\cdot)\) 探索冷却帧 \(d_e\),队列弹出冷却帧 \(d_q\),动作大小 \(n\),当前游戏时间 \(t\),上次探索时间 \(l_e\),上次弹出队列时间 \(l_q\) 1: \((e_1,\dots,e_n)\leftarrow Re^{EC}(t,o_t)\) ▷ 检索 \(n\) 个片段 2: \(a_t\leftarrow ExtractAction((e_1,\dots,e_n))\) ▷ 选择第一个动作 3: 如果 \(t\geq d_e+l_e\) 则 4: \(l_e\leftarrow t\) 5: \(o'_t=o_t\times Q_o(t)\) 6: \((a_1,\dots,a_n)\leftarrow LLM(S,(o'_t))\) ▷ 提出 \(n\) 个探索动作 7: \(Q_a.push((a_1,\dots,a_n))\) 8: 结束 9: 如果 \(a_t = \text{EmptyAction}\) 且 \(Q_a.size()>0\) 且 \(t\geq l_q+d_q\) 则 10: \(l_q=t\) 11: \(a_t\leftarrow Q_a.pop()\) ▷ 添加探索动作 12: 结束 13: \(t\leftarrow t+1\) 14: 返回 \(a_t\) ### 3.2 从情景记忆中进行检索 给定一组游戏数据,我们定义一系列片段 \(\{(t_i,o_i,a_i)\mid i=1,2,\ldots,e\}\),其中 \(t_i\) 表示游戏中的时间。情景记忆,记为 \(M^{EC}(t,o,a)\),由对应胜利游戏的片段组成。对于新游戏中的每个时刻 \((t,o)\),我们通过从 \(M^{EC}\) 中找到与当前场景密切匹配的片段索引 \(D_{index}\) 来识别相似的过去时刻。最初,我们在 \(M^{EC}\) 中搜索 \(t\) 附近的内容以检索一个子集: \[ {M^{EC}}_{t}=\operatorname{BinarySearch}(M^{EC},t,t_{\Delta}) \] (1) 其中 \(t_{\Delta}\) 是一个预定义参数,表示围绕 \(t\) 进行搜索的时间范围(为简单起见,我们设 \(t_{\Delta}=0\))。接下来,我们计算当前观测 \(o_t\) 与之前所有观测 \(O'\in {M^{EC}}_{t}\) 之间的差异,每个观测 \(o_t\) 被表示为一个Python字典(以单位作为键,标量作为值)。我们计算两个指标:(1)发生变化的条目数量,记为 \(D_{item}\);(2)发生改变的值数量,记为 \(D_{value}\)。然后,我们根据以下标准获得前 \(n\) 个记忆: \[ \begin{split} D_{index}=\operatorname{Argsort}(\alpha\operatorname{MinMax}(D_{item})\\ +\beta\operatorname{MinMax}(D_{value})) \end{split} \] (2) 我们对 \(D_{item}\) 和 \(D_{value}\) 进行最小-最大归一化,然后按升序对 \(D\) 进行排序。我们设 \(n=3,\alpha=0.5,\beta=0.5\)。因此,检索函数定义为: \[ \begin{split} Re^{EC}(t,o)= \begin{cases} \Big\{\text{EmptyAction}\Big\}, & \text{如果 } |{M^{EC}}_{t}|=0\\ \Big\{{M^{EC}}_{t}(t_i,o_i,a_i)\mid i\in D_{index}[:n]\Big\}, & \text{否则} \end{cases} \end{split} \] (3) ### 3.3 工作记忆与门控机制 对于每个时间步 \(t\),观测队列 \(Q_o\) 捕获最近 \(k_{max}\) 个观测。受帧跳过(1 (https://arxiv.org/html/2608.12626#bib.bib6))的启发,工作记忆以帧间隔 \(L\) 回忆过去的观测: \[ Q_o(t)=\left\{\left(o_{t-k}\right)\mid k=L,2L,\ldots,k_{max}L\right\} \] (4) 其中 \(o_{t-k}\) 表示时间 \(t-k\) 时的观测。在推理之前,我们将观测 \(o_t\) 映射到一个增强的观测空间,定义为:\(o'_t=o_t\times Q_o(t)\)。我们设 \(k_{max}=4\) 和 \(L=24\)。我们将基础系统提示与上下文融合的组合定义为语义知识 \(S\),并将对LLM的查询定义为函数 \(LLM(\cdot)\)。然后我们进行探索和利用过程,记为 \(W(\cdot)\),并按照算法1的定义,用一个探索动作队列 \(Q_a\) 来初始化它。在 \(W(\cdot)\) 中,\(Q_o(t)\) 提供短期历史信息,使智能体能够分析状态的趋势。相比之下,\(Q_a\) 存储动作,用于在未来插入到从情景记忆检索到的动作序列中,从而实现自适应规划。 算法2 EpicStar 智能体 星际争霸II游戏环境 \(env\),工作记忆 \(W(\cdot)\) 1: \(env.initialize()\), 2: \(Q_a\leftarrow\emptyset\), \(l_e\leftarrow 0\), \(t\leftarrow 0\), \(l_q\leftarrow 0\) 3: \(o_t\leftarrow env.observation()\) ▷ 初始观测 4: 当 \(env\) 未终止时 执行 5: \(a_t\leftarrow W(t,Q_a,o_t,Q_o(t),l_e,l_q)\) 6: \(t\leftarrow t+1\) 7: \(o_t=env.step(a_t)\) ▷ 下一帧的观测 8: 结束 9: 返回 \(env.game\_result()\)
相似文章
从记忆到技能:基于证据的长期LLM智能体协同进化治理
MSCE是一种免训练框架,将LLM智能体的经验组织为三个记忆层次,并将其转化为带有证据链接的可复用技能,优于现有的记忆增强和技能增强基线。
EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体
EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。
受人类启发的LLM智能体记忆架构
微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。
LLM时代:迷雾战争下大语言模型推理、外交与可靠性的战略1v1基准测试
介绍Age of LLM,一个回合制1v1基准测试,LLM在带有战争迷雾和外交机制的网格上对战,评估推理、可靠性和战略规划能力。结果显示核速攻战术占主导,且可靠性与获胜之间存在弱关联。
@omarsar0: // LLM 智能体中的记忆诅咒 //(建议收藏)过长的历史记录显然会导致智能体性能下降,因为它们变得越来越…
本研究论文揭示了 LLM 智能体中的“记忆诅咒”现象,证明扩大的上下文窗口会通过削弱前瞻性意图,系统性地破坏多智能体社会困境中的合作行为。作者表明,通过定向微调、合成记忆净化以及减少显式思维链(Chain-of-Thought)推理,可有效缓解此类行为衰退。