何时规划:学会在响应式控制与深思熟虑的规划之间进行选择

arXiv cs.AI 论文

摘要

本文介绍了一种强化学习方法,用于训练一个元推理策略,该策略基于响应式策略的不确定性,在快速的响应式控制与较慢的深思熟虑规划之间进行选择,从而在导航任务中实现更好的平衡与适应性。

arXiv:2607.16421v1 公告类型:新 摘要:人们早已认识到,人类能够在快速的响应式决策与较慢的深思熟虑规划之间切换。在本文中,我们研究如何在人工智能体中学习这种能力(即元推理)。我们将响应式决策建模为一种直接状态观测映射到动作的策略。此类策略可以通过强化学习(RL)或模仿学习进行训练,但在训练分布之外可能泛化不佳。另一种方法是基于模型的决策时规划,它在更广泛的状态集上更有可能产生好的动作,但需要额外的计算时间,从而延迟行动。在这项工作中,我们引入了一种RL方法,用于训练一个元推理策略,该策略通过条件化于一个响应式策略的不确定性分数来分配计算。该分数使其能够预测响应式策略何时可能表现不佳以及何时需要规划。我们在运动规划和导航环境中进行了实证研究,表明这种设计使元推理策略能够学会何时响应式策略提供了足够好的动作,以及何时需要决策时规划。此外,我们还表明,随着响应式策略的改进,我们的设计使元智能体能够转向完全响应式控制。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:38

# 学习在反应式控制与审慎式规划之间进行选择
来源:https://arxiv.org/html/2607.16421
何时规划:学习在反应式控制与审慎式规划之间进行选择

Adam Labiosa, Josiah P. Hanna

关键词:元推理、强化学习、自适应计算。

**摘要** 人类具备在快速、反应式决策与缓慢、审慎式规划之间切换的能力,这一点早已被公认。本文研究如何在人工智能体中学习这种被称为元推理的能力。我们将反应式决策建模为一个将状态观测直接映射到动作的策略。此类策略可以通过强化学习(RL)或模仿学习进行训练,但在其训练分布之外可能泛化能力较差。另一种方法是基于模型的决策时规划,它更有可能在更广泛的状态集合中产生良好的动作,但需要额外的计算时间,从而延迟行动。在这项工作中,我们引入了一种RL方法,用于训练一个元推理策略,该策略通过条件化反应式策略的不确定性分数来分配计算资源。这个分数使其能够预测反应式策略何时可能表现不佳,以及何时需要规划。我们在运动规划和导航环境中进行了一项实证研究,结果表明,这种设计使得元推理策略能够学习何时反应式策略提供了足够好的动作,以及何时需要决策时规划。此外,我们还展示了我们的设计使得元智能体能够在反应式策略改进时转向完全反应式控制。

**贡献**

1. 我们引入了一种强化学习方法,用于学习一个元策略,以在快速、反应式策略(在其训练分布外可能表现不佳)和规划器(需要时间但能可靠产生接近最优动作)之间进行选择。
   上下文:先前的工作使用RL来最小化计算量,要么是针对单个决策选择内部计算(callaway_learning_2018),要么是通过在整幕中使用动作重复(orenstein_toward_2025)。我们的工作不同之处在于,将元推理问题视为需要在整个任务幕中,在反应式策略和规划器之间进行一系列元层级的选择。认知科学中研究了相关思想(keramati_speedaccuracy_2011; kool_planning_2018),但这些工作旨在描述人类行为,而非为人工智能体提供机制。

2. 我们表明,我们的方法生成的元策略能够根据环境特征(如规划延迟、反应式策略能力和环境随机性)平衡审慎式规划和使用反应式策略。
   上下文:我们进行了一项实证研究,结果表明,与始终承诺使用一种决策规则的基线(见表1)相比,我们的方法获得了更高的回报。通过改变规划成本、反应式策略能力和任务随机性,我们分析了每个因素如何改变反应式动作与审慎式规划之间的平衡(见图3)。

3. 我们表明,即使反应式策略随时间推移而改进,不确定性条件化的元策略也能追踪其能力,并随着反应式能力的提高而转向更多的反应式控制。
   上下文:我们进行了一项实验,在训练期间使用规划器轨迹的行为克隆来微调反应式策略(见第6.6节,图4)。关键结果是,不确定性条件化的观测足以使元策略学会在其训练分布变宽时更多地调用反应式策略。

## 摘要

人类具备在快速、反应式决策与缓慢、审慎式规划之间切换的能力,这一点早已被公认。本文研究如何在人工智能体中学习这种被称为元推理的能力。我们将反应式决策建模为一个将状态观测直接映射到动作的策略。此类策略可以通过强化学习(RL)或模仿学习进行训练,但在其训练分布之外可能泛化能力较差。另一种方法是基于模型的决策时规划,它更有可能在更广泛的状态集合中产生良好的动作,但需要额外的计算时间,从而延迟行动。在这项工作中,我们引入了一种RL方法,用于训练一个元推理策略,该策略通过条件化反应式策略的不确定性分数来分配计算资源。这个分数使其能够预测反应式策略何时可能表现不佳,以及何时需要规划。我们在运动规划和导航环境中进行了一项实证研究,结果表明,这种设计使得元推理策略能够学习何时反应式策略提供了足够好的动作,以及何时需要决策时规划。此外,我们还展示了我们的设计使得元智能体能够在反应式策略改进时转向完全反应式控制。

## 1 引言

人类自然地根据情况分配认知努力。例如,驾驶员通常以最小的认知努力导航熟悉的路线,而在不熟悉的环境中,他们从遵循直觉反应转向深思熟虑的决策(charlton_driving_2013)。与反应性行动相对立,先思考再行动在认知科学中被称为系统1和系统2思维(kahneman2011thinking; evans1984heuristic),在AI系统中也可以看到类似的区别。使用无模型RL或模仿学习训练的反应式、模式匹配智能体能够实现快速决策,但可能对训练分布之外的状态泛化能力较差;而始终调用决策时规划器的智能体则能产生高质量的动作,但必须在行动前花费时间制定计划。目前大多数系统在测试时采用固定策略,例如始终使用无模型反应式动作(bansal_chauffeurnet_2018; haarnoja_learning_2023)、始终在行动前规划(xia_survey_2024),或始终在响应前推理(openai_openai_2024; deepseek-ai_deepseek-r1_2025)。

本工作的目标是实现*自适应计算*,通过学习*何时*调用计算上更密集的规划程序,而不是采取反应式动作。我们的工作为AI研究领域中被称为元推理(horvitz_computation_nodate; russell_principles_1991)的领域做出了贡献,该领域研究智能体应如何分配其计算资源,特别是使用RL来学习元认知策略。

我们研究了一个包含两种主要动作生成机制的元推理问题:反应式策略和决策时规划器。反应式策略通过单次神经网络前向传播产生动作,但仅在有限的训练分布内表现良好。相比之下,规划器能够从任何环境状态产生一系列良好的动作,但代价是相对于反应式策略需要额外的计算。虽然用于规划的学得世界模型同样局限于其训练分布,但先前的工作表明,它们比反应式策略具有更强的泛化鲁棒性(young_benefits_2023)。因此,规划在反应式策略训练分布之外的状态中最为有价值。这些观察结果激发了对在受分布约束的反应式策略和在整个状态空间都有效的规划器之间进行仲裁的需求。

在这个问题设置中,我们提出以下问题:

*RL智能体如何学习在受分布约束的反应式策略与较慢的决策时规划程序之间进行选择?*

为了回答这个问题,我们开发了一种方法来训练一个元策略,该策略在反应式动作和可变深度规划之间进行选择,以在基于时间的成本下最大化任务回报。关键是,元策略的条件基于来自反应式策略的不确定性信号,这使得它能够估计在当前状态下反应式策略的能力。

我们在套件中的运动规划和导航任务中评估了我们的方法。首先,我们展示了我们的自适应元策略在到达目标状态所需的时间上少于固定计算量的基线方法,包括始终反应和始终规划。其次,我们消融了元策略观测空间的关键设计选择,并表明反应式不确定性和观测历史是有效计算分配的最关键组成部分。第三,我们通过改变反应式能力、规划成本和环境随机性,展示了元策略学会了依赖环境特征的行为。最后,我们将我们的方法应用于联合训练设置,其中反应式策略与元策略同时改进,并表明不确定性条件化观测使元策略能够追踪不断增长的反应式能力,并转向完全反应式控制。

总之,我们的工作做出了以下贡献:

1. 我们引入了一种新颖的强化学习方法,用于学习一个元策略,以在快速、反应式策略(在其训练分布外可能表现不佳)和规划器(需要时间但能可靠产生接近最优动作)之间进行选择。
2. 我们表明,我们的方法生成的元策略能够根据环境特征(如规划延迟、反应式策略能力和环境随机性)平衡审慎式规划和使用反应式策略。
3. 我们表明,即使反应式策略随时间推移而改进,不确定性条件化的元策略也能追踪其能力,并随着反应式能力的提高而转向更多的反应式控制。

## 2 马尔可夫决策过程

我们考虑由元组 M = (S, A, P, r, γ) 定义的马尔可夫决策过程 (MDP),其中 S 是状态空间,A 是动作空间,P(s'|s, a) 表示转移动态,r(s, a) 是奖励函数,γ ∈ [0, 1) 是折扣因子。在每个时间步 t,智能体根据策略 π 选择动作 at ∼ π(·|st),从而产生轨迹 τ = (s0, a0, s1, a1, ...)。RL的目标是学习一个最大化期望折扣回报的策略:J(π) = E_{τ∼π}[∑_{t=0}^{∞} γ^t r(st, at)]。

图1:我们的环境套件示例图像。环境在状态空间类型(离散与连续)、任务结构和反应式策略难度方面各不相同。在所有环境中,目标都是从起始状态到达目标状态。

## 3 相关工作

**学习使用计算。** 多项工作使用RL来学习元推理。与我们的工作类似,callaway_learning_2018 使用无模型RL来选择计算。然而,他们的工作侧重于在现实世界中采取动作之前分配计算,而我们的工作则将计算分配视为一个贯穿整个任务幕的序贯决策问题。其他工作调整规划器内部的计算量(budd_stop_2024; wang_dynamic_2025),而我们的智能体则在立即执行反应式策略与花时间生成计划之间进行选择。事件触发式和自适应重规划方法(hashimoto_learning-based_2025; chen_reinforcement_2022; honda_when_2024)学习计划何时不再有效,但假设智能体始终进行规划,不考虑通过最小化计算来更快完成任务。其他相关工作考虑可变长度的选项以最小化动作数量(karimi_dynamic_2023; lakshminarayanan_dynamic_2017; metelli_control_2020; orenstein_toward_2025; sharma_learning_2020),但这些工作优化的是动作效率而非计算分配,并且不考虑反应式执行与规划成本之间的显式权衡。

**无模型与基于模型控制之间的仲裁。** 何时使用无模型控制与基于模型控制的问题在AI和神经科学中都有研究(dolle_path_2010; lee_neural_2014)。现有的AI方法通常依赖于手工设计的切换规则或从预测误差信号导出的不确定性启发式方法(sheikhnezhad_fard_novel_2019; fard_mixing_2018; sharma_hybrid_2025; raj_rethinking_2024),并且忽略了基于模型规划所需的计算。其他方法学习在多个控制器之间进行选择(kastner_all-in-one_2021; dey_learning_2023; hamrick_metacontrol_2017),但假设规划和反应式推理花费相同的时间。我们的工作不同之处在于显式建模不同控制器的基于时间的成本,并学习一个元推理策略来在它们之间进行仲裁。

**大语言模型中的自适应计算。** 最近关于LLM的工作解决了何时生成推理令牌的问题(paglieri_learning_2025; fang_thinkless_2025; sabbata_rational_2025; manvi_zero-overhead_2025; chung_thinker_2025)。虽然结构相似,但这些工作不使用元层级智能体,而是旨在将决策编码到LLM本身中,这限制了方法的适应性。ong_routellm_2025 使用控制器在较大和较小模型之间路由,但使用的是偏好数据而非像我们一样在线学习决策。hanna_when_2025 引入了RL智能体应何时学习采取抽象思维动作的理论形式化,这些动作可被解释为选择额外计算。相比之下,我们专注于开发从一组使用不同计算量的具体决策规则中进行选择的智能体。

**认知科学。** 快速反应行为与缓慢深思之间的权衡在有界理性和双过程理论的认知科学中得到了充分研究(griffiths_doing_2019; keramati_speedaccuracy_2011; kelly_best_2022)。多项工作理论认为,当期望价值超过其成本时,人类会进行深思(lieder_strategy_2017; lieder_rational_2018),这直接激励了我们将规划公式化为一个时间成本高昂的选项。类似的工作将RL应用于元认知控制的建模(krueger_enhancing_2017; jain_how_2019),但这些工作提供了人类行为的描述性模型,而我们则专注于在人工智能体中操作化这种能力。

图2:元推理智能体。反应式策略(神经网络集成)为当前状态输出动作 a_r 和不确定性分数 u~t。a_r 和 u~t 以及到目标的距离和先前动作等任务特征被输入到元智能体。元智能体在反应式动作和一组具有不同范围的计划之间进行选择。动作在环境中执行。

## 4 问题公式化

我们考虑通过RL训练一个元推理策略的问题,该策略在具有不同时间成本的控制器之间进行选择。具体来说,我们关注于在反应式策略(在其训练分布内产生正确动作但时间成本低)和规划器(在整个状态空间产生正确动作但时间成本高)之间进行切换。W

相似文章

寻找思考的时间:实时强化学习中的规划预算学习

arXiv cs.LG

本文引入了可变延迟实时强化学习,其中智能体决定在环境持续运行的情况下需要多长时间的思考,并提出了一种轻量级的门控策略来选择基于状态的规划预算,在多个实时游戏中优于固定预算和启发式基线。