让它烹饪:在序列决策中学习等待
摘要
本文介绍了一种强化学习方法,用于训练智能体在序列决策任务中策略性地等待,从而在任务性能与资源节约之间取得平衡。实验表明,在家庭环境和连续状态环境中均出现了显著的等待行为。
arXiv:2608.11511v1 公告类型:新
摘要:在序列决策中,智能体通常在每个时间步观察环境并采取行动。然而,这种主动参与并非总是必要的;例如冲泡咖啡等任务包含一些阶段,在这些阶段中,让环境自行演变而不进行持续监控和控制同样能达到效果。在此期间,智能体可以简单地等待以节约资源,或将注意力转移到另一项任务上。我们利用这些机会,训练一个“等待策略”来决定在哪里等待以及等待多久。这涉及放弃感知以执行等待动作,即有意暂停固定数量的时间步。我们将“学习等待”形式化为在不牺牲任务性能(例如完成任务的总时间)的前提下,最小化感知和决策的频率。为了训练等待策略,我们提出了一种使用字典序目标的强化学习方法。在4个离散状态家庭任务和3个连续状态环境的实验中,我们表明我们的方法成功学会了等待行为,并能调整预训练策略以在适当的地方等待。虽然不同任务在不妨碍任务性能的前提下允许的等待量不同,但我们的方法始终能找到具有显著等待行为的解,有时等待时间超过任务总时长的50%。
查看缓存全文
缓存时间: 2026/08/13 15:36
# 静待其熟:序列决策中的学会等待
来源:https://arxiv.org/html/2608.11511
###### 摘要
在序列决策中,智能体通常会在每个时间步观察环境并采取行动。然而,这种主动参与并非总是必要的;诸如冲泡咖啡之类的任务包含一些阶段,在这些阶段中,让环境自行演变而不进行持续监控和控制同样能达到目的。在此期间,智能体可以简单地等待以节省资源,或者将注意力转向另一项任务。我们通过训练一个“等待策略”来利用这些机会,该策略决定在何处等待以及等待多长时间。这涉及到放弃感知并承诺执行一个等待动作,即有意暂停固定数量的时间步。我们将“学会等待”形式化为在不牺牲任务性能(例如,完成任务的总时间)的前提下,最小化感知和决策的频率。为了训练等待策略,我们提出了一种采用具有字典序目标的强化学习方法。在涉及 44 个离散状态的家庭任务和 33 个连续状态环境的实验中,我们表明我们的方法成功地学习了等待行为,并且可以使预训练策略在适当的地方适应性地等待。虽然不同的任务允许在不牺牲任务性能的情况下有不同数量的等待,但我们的方法始终能找到具有显著等待量的解决方案,有时等待时间超过任务时长的 50%。
## 1 引言
序列决策中的主流范式将智能体视为主动的闭环系统,它们持续监控并响应环境。这种方法假设朝着目标取得有意义的进展需要智能体的持续参与——从而使其感觉、计算和运动资源得到积极利用。然而,许多现实世界任务天然具有被动动态特性,可以利用这些特性更高效地实现目标 (34)。想象一下繁忙厨房中平凡但复杂的配合:水壶需要时间烧开,汤需要时间炖煮,咖啡机一旦设定好冲泡便会自行工作。在上述每种情景中,对人类或机器人而言,最有效的行动就是简单地等待。一个能够识别在哪里等待以及等待多久的智能体,可以切换到定时的“待机模式”以节省认知和运动资源,或者将这些资源重新导向辅助任务。鉴于策略性等待的好处,出现的关键问题是:(1) 我们如何形式化等待的目标?(2) 如何开发学习方法,训练智能体优化这一等待目标?
对于每个环境,我们定义了一个特殊的 `wait` 动作,例如在咖啡冲泡时保持静止,或在视频游戏 Pong 中保持球拍不动。那么“等待”就是承诺连续多个时间步执行这个 `wait` 动作。我们旨在发现并利用那些智能体可以长时间等待的机会。虽然我们的方法在技术上对 `wait` 动作对环境的影响不作任何假设,但我们把实验限制在“等待”对应于让环境按照直观的被动动态演变的场景中,如上述例子所示。
学会等待需要平衡两个可能相互竞争的目标:最大化任务性能与最小化智能体感知和响应环境的次数(这对应于最大化智能体用于等待的时间)。我们考虑严格优先考虑任务性能(以马尔可夫环境中的累积奖励衡量)的智能体,并且仅在不降低任务性能的情况下才寻求最大化等待。形式上,这种偏好将问题转化为具有字典序的多目标优化问题:智能体寻求最大化 \(\max[J^{0},J^{1}]\),其中累积任务奖励 \(J^{0}\) 代表期望任务性能,而累积等待奖励 \(J^{1}=-D\) 随着智能体需要感知并做出决策(无论是等待还是行动)的次数 \(D\) 的增加而减少。对我们来说,等待阶段不涉及感知、计算或面向目标的行为。因此最小化 \(D\) 结合了两个期望:(1) 减少感知和决策计算,(2) 减少对智能体主动干预的需求。在多任务设置中,等待可能对应于智能体可以将其资源重新导向另一项任务的期间。更一般地说,等待期间允许切换到定时“待机模式”,以节省感觉、计算和运动资源。
为了利用我们目标的结构,我们在多个离散状态和连续状态环境中应用了一种字典序多目标强化学习(MORL)算法。可实现的等待量取决于环境;在某些环境中,我们的方法产生的策略在不牺牲任务性能的前提下,相比普通的无等待 RL 基线能够等待(在某些环境中超过任务时长的 50%)。我们还将我们的方法与一种使用标量化奖励的标准 MORL 技术进行比较,该技术通过奖励加权标量化系数探索任务性能与增加等待之间的帕累托前沿。在对任务性能有严格偏好的情况下,我们的字典序 MORL 方法与标量化方法在任务和等待性能上几乎相同,而无需通过超参数搜索来为每个环境发现最佳奖励加权系数。我们还表明,我们的方法可以用来“包装”一个预训练策略,在不牺牲任务性能的情况下添加等待行为。最后,我们展示了学习的等待行为如何在多任务场景中实现策略交错。
## 2 序列决策中的等待
我们将其中发生的“等待马尔可夫决策过程”(WMDP)定义为一个元组 \(\mathcal{M}=(\mathcal{S},\mathcal{A},\mathit{wait},\mathcal{W},\mathcal{P},R,\mu)\),其中 \(\mathcal{S}\) 是(离散或连续的)状态集,\(\mathcal{A}\) 是(离散的)原始动作集,\(\mathit{wait}\in\mathcal{A}\) 是特殊的等待动作,\(\mathcal{W}\subseteq\mathbb{N}^{+}\) 是(有限的)等待时长集合,\(\mathcal{P}(s_{t+1}\;|\;s_{t},a_{t})\) 是在采取原始动作 \(a_{t}\) 后从 \(s_{t}\) 转移到 \(s_{t+1}\) 的概率,\(R:\mathcal{S}\times\mathcal{A}\times\mathcal{S}\rightarrow\mathbb{R}\) 是奖励函数,\(\mu\) 是初始状态分布。WMDP 与标准马尔可夫决策过程的区别在于特殊的 \(\mathit{wait}\) 动作和等待时长集合 \(\mathcal{W}\)。每个自然数 \(w\in\mathcal{W}\) 描述了一个等待宏动作,它对应于连续等待 \(w\) 个时间步——即在连续 \(w\) 个时间步内放弃感知并执行原始 \(\mathit{wait}\) 动作。¹ 我们将时长为 \(w\) 的等待宏动作用其自然数 \(w\) 来表示。我们对 \(\mathit{wait}\) 动作下的动态 \(\mathcal{P}\) 不作任何特殊要求,但在应用中,我们会选择一种与自然的“不干预”概念相对应的等待动作(例如在炉子上炖汤时站着不动,或在 Pong 游戏中不移动球拍)。我们旨在学习能够承诺长时间“等待”的策略,如图 1 所示。
[图注] 图 1:在我们的 Cook 环境中,智能体在汤烹饪过程接近尾声时承诺执行一个时长为 5 的等待宏动作。等待期间不进行任何感知、计算或主动运动。
\(\mathit{wait}\) 动作和等待时长集合 \(\mathcal{W}\) 使我们能够定义等待策略 \(\pi:\mathcal{S}\rightarrow\Delta(\mathcal{A}\cup\mathcal{W})\) 的概念,该策略与 WMDP 交互以同时接收任务奖励和等待奖励。² 当在状态 \(s\) 被询问时,等待策略要么产生一个原始动作 \(a\in\mathcal{A}\),根据动态 \(\mathcal{P}\) 产生其通常的效果,要么产生一个等待宏动作 \(w\in\mathcal{W}\)。一个 WMDP \(\mathcal{M}=(\mathcal{S},\mathcal{A},\mathit{wait},\mathcal{W},\mathcal{P},R,\mu)\)、一个等待策略 \(\pi:\mathcal{S}\rightarrow\Delta(\mathcal{A}\cup\mathcal{W})\) 和一个有限时间范围 \(H\in\mathbb{N}\) 共同诱导出一个长度为 \(H\) 的轨迹分布 \(s_{0}a_{0}r^{0}_{1}r^{1}_{1}s_{1}\ldots a_{H-1}r^{0}_{H}r^{1}_{H}s_{H}\),其生成方式为:抽取初始状态 \(s_{0}\sim\mu\),并在时间步 0 询问策略 \(\pi\),以获得一个等待宏动作或一个原始动作。在每个时间步 \(t\),如果策略被询问并产生一个等待宏动作 \(w\),则接下来的 \(w\) 个动作 \(a_{t},a_{t+1},\ldots,a_{t+w-1}\) 都是等待动作 \(\mathit{wait}\),并且策略直到时间步 \(t+w\) 才再次被询问。相反,如果被询问的策略产生一个原始动作 \(a\in\mathcal{A}\),则 \(a_{t}=a\),并且策略将在下一个时间步 \(t+1\) 再次被询问。对于每个时间步 \(1\leq t\leq H\),状态 \(s_{t}\) 按 \(s_{t}{\sim}\mathcal{P}(\cdot\;|\;s_{t-1},a_{t-1})\) 采样,任务奖励 \(r^{0}_{t}\) 定义为 \(r^{0}_{t}=R(s_{t-1},a_{t-1},s_{t})\),这与 MDP 中通常的奖励概念一致。等待奖励 \(r^{1}_{t}\) 在策略于时间步 \(t\) 被询问时为 \(-1\),否则为 0。当达到最大情节范围 \(H\) 时,情节会突然终止,无论智能体是否正处于等待宏动作的执行过程中。
给定一个轨迹 \(\tau=s_{0}a_{0}r^{0}_{1}r^{1}_{1}s_{1}\ldots a_{H-1}r^{0}_{H}r^{1}_{H}s_{H}\),我们将(未折扣的)累积任务奖励定义为 \(J^{0}(\tau)=\sum_{1\leq i\leq H}r^{0}_{i}\)。我们将(未折扣的)累积等待奖励定义为 \(J^{1}(\tau)=\sum_{1\leq i\leq H}r^{1}_{i}\),即策略 \(\pi\) 在轨迹中被询问的次数乘以 \(-1\)。
##### 字典序等待目标。
直观地说,一个好的等待策略是在获得良好任务性能(以累积任务奖励衡量)的同时尽可能多地进行等待。由于我们考虑的是事先固定范围 \(H\) 的轨迹,并且其中唯一的扩展时长动作是等待宏动作,因此策略被询问的次数更少就对应于等待更多。给定一个 WMDP \(\mathcal{M}\) 和一个有限时间范围 \(H\),我们将等待策略 \(\pi\) 的向量值目标定义为 \(J(\pi)\in\mathbb{R}^{2}\):
\(J(\pi)=\mathbb{E}_{\tau\sim\mathcal{M},\pi}[J^{0}(\tau),J^{1}(\tau)]\) (1)
我们采用标准的字典序排序 \(\leq\),定义如下:\([J^{0},J^{1}]\leq[J^{0\,\prime},J^{1\,\prime}]\Leftrightarrow J^{0}<J^{0\,\prime}\,\text{OR}\,(J^{0}=J^{0\,\prime}\,\text{AND}\,J^{1}\leq J^{1\,\prime})\)。换句话说,一个策略“优于”另一个策略当且仅当它要么 (1) 获得更高的累积任务奖励 \(J^{0}\),要么 (2) 具有相等的 \(J^{0}\) 和更高的累积等待奖励 \(J^{1}\)。在下一节中,我们将描述基于强化学习的方法,旨在学习一个达到最大 \(J(\pi^{*})\) 的策略 \(\pi^{*}\)。
我们选择的等待目标——最小化等待策略被询问的期望次数——非常契合主动决策会产生计算或感官成本的场景。这一思想在 36 中进行了探索,它使用包含交互成本的标量奖励来鼓励动作重复,并且 13 使用类似的深思熟虑成本来减少分层强化学习中高层策略被询问的次数。在上述工作中,交互或深思熟虑成本的大小隐式定义了任务性能与策略查询频率之间的权衡。相比之下,我们的字典序目标 (1) 使任务奖励和等待奖励的相对大小变得无关紧要。换句话说,如果我们定义 WMDP 轨迹使得每个 \(r^{1}_{t}\) 都乘以一个任意的正因子,那么目标 (1) 将在最优策略上产生相同的排序,我们将在第 3.1 节介绍的 LQ-Learning 学习算法(算法 1)也将表现类似。实际上,这避免了为找到任务奖励与等待奖励的适当权重而进行超参数搜索的需要。
我们形式化方法的另一个重要区别特征是,避免询问策略的唯一方法是选择时间上延展的等待宏动作。因此,我们的目标自然鼓励智能体选择这些动作。此外,由于在我们的环境中“等待”动作将控制权交给环境的被动动态,更多的等待不仅节省了感知和计算,还节省了运动资源。对所有决策(包括选择等待)进行惩罚,鼓励智能体在可能时采取时长更长的等待动作。偏好长时间连续等待可以为下游多任务应用提供便利,因为较长的等待期为智能体提供了更多时间,可以通过执行辅助策略来“填补”等待期,从而在另一个任务上取得进展;我们将在第 4 节中在 Coffee 任务背景下探讨这一思想的简单实例。
## 3 学会等待
### 3.1 字典序 Q-Learning
我们的目标是最大化向量值目标 (1),这自然适合采用字典序 MORL 方法 (7; 32),该方法寻求最大化向量值奖励信号的策略。我们改编了 32 中描述的字典序 Q-Learning 版本,以处理等待宏动作。我们最终的 LQ-Learning 算法详细见算法 1,它维护两个 Q 估计:任务 Q 估计 \(Q^{0}\) 和等待 Q 估计 \(Q^{1}\)。每个 Q 估计都考虑“完整动作集” \(\mathcal{A}\cup\mathcal{W}\),其中包含原始动作和等待宏动作。贪婪策略推断选择一个与最优值相差 \(\sigma\) 以内的动作(即相似文章
寻找思考的时间:实时强化学习中的规划预算学习
本文引入了可变延迟实时强化学习,其中智能体决定在环境持续运行的情况下需要多长时间的思考,并提出了一种轻量级的门控策略来选择基于状态的规划预算,在多个实时游戏中优于固定预算和启发式基线。
何时规划:学会在响应式控制与深思熟虑的规划之间进行选择
本文介绍了一种强化学习方法,用于训练一个元推理策略,该策略基于响应式策略的不确定性,在快速的响应式控制与较慢的深思熟虑规划之间进行选择,从而在导航任务中实现更好的平衡与适应性。
在等待AI代理完成任务时你会做什么?
关于用户在等待AI代理完成任务时所做之事的讨论,探讨实用策略和行为观察。
Agentick:用于通用序贯决策智能体的统一基准
本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。
超越下一观测预测:面向顺序决策的智能体自主世界建模
本文提出了一种名为“智能体自主世界建模”(AAWM)的训练流程,该流程基于策略自身的决策需求构建世界模型监督,而非依赖下一观测预测,从而使学习目标与有效决策所需的动态特性对齐。