ASK in the Dark: 部分可观测环境下的不确定性门控大语言模型辅助
摘要
本文提出ASK+,一种在部分可观测环境(POMDP)中利用小型语言模型(SLM)对强化学习智能体进行不确定性门控辅助的方法。通过提供轨迹感知上下文和结构化思维链推理,ASK+显著提升了基准方法的成功率,证明提示设计和选择性门控对模型规模具有主导作用。
arXiv:2607.02686v1 Announce Type: new
摘要:在部分可观测环境下运行的强化学习智能体必须基于不完整信息采取行动,因此自然适合从携带广泛推理先验知识的小型语言模型(SLM)中获得指导。然而,将SLM指导集成到该环境中已被证明是困难的:在所有测试环境中,朴素的不确定性门控方法的覆盖率接近或等于零,这意味着SLM几乎从不贡献独立动作。我们将这一失败归因于赤裸的自我中心提示,该提示缺乏足够的上下文进行真正推理,并确定这是一个上下文问题而非能力问题。我们提出ASK+,它为SLM提供轨迹感知上下文(部分揭示的地图、访问位置和动作历史)以及结构化思维链推理,将其从被动的冗余检查转变为更具信息量的顾问,偶尔纠正策略。我们进一步证实,用于选择性查询的预测熵信号衡量的是动作不确定性而非状态不确定性,并且在POMDP中仍然具有信息量,使得不确定性门控辅助在完全可观测环境之外也切实可行。有状态的提示带来了显著提升:在DoorKey上,朴素ASK与PPO持平(均为89%),而ASK+达到93%的成功率;在FourRooms上,成功率从53%提升至70%;在HigherLower上,准确率达到73.7%,与仅使用SLM的上界相当。在所有环境中,Qwen3.5-2B匹配或超越Qwen3.5-4B,证实提示设计和选择性门控对模型规模的影响起主导作用,从而无需大模型即可实现指导。
查看缓存全文
缓存时间: 2026/07/07 04:34
# 黑暗中的ASK:部分可观察性下的不确定性门控LLM辅助 来源:https://arxiv.org/html/2607.02686 \copyrightclause 本文版权归作者所有。根据知识共享署名4.0国际许可协议(CC BY 4.0)允许使用。 \conference PRL+CAIPI Workshop @ IJCAI-ECAI 2026 [[email protected], ]\cormark[1]\fnmark[1] [[email protected], ]\fnmark[1] [[email protected], ] [[email protected] ] [[email protected] ] [[email protected], ]\cortext[1]通讯作者。\fntext[1]这些作者贡献相等。 Nathan Gavenski 伦敦国王学院,伦敦,英国 Guilherme Lima Francisco Galuppo Odinaldo Rodrigues Adriano Veloso (2026) ###### 摘要 在部分可观察性下运行的强化学习代理必须基于不完整信息行动,这使得它们自然适合从小型语言模型(SLM)获得指导,这些模型带有广泛的推理先验。然而,将SLM指导融入这一设置已被证明是困难的:在所有测试环境中,朴素的不确定性门控方法实现的覆写率接近为零,意味着SLM几乎从未贡献过独立动作。我们将这一失败追溯到简朴的自我中心提示,它无法为真正的推理提供足够的上下文,并确定这是一个上下文问题而非能力问题。我们提出ASK+,它向SLM提供轨迹感知上下文(部分揭示的地图、访问过的位置和动作历史)以及结构化思维链推理,将其从被动的冗余检查转变为信息更丰富的顾问,偶尔纠正策略。我们进一步确定,用于选择性查询的预测熵信号衡量的是动作不确定性而非状态不确定性,并且在POMDP中仍然有效,使得不确定性门控辅助在完全可观察设置之外也得以可行。状态化提示带来了显著的收益:在DoorKey上,朴素ASK与PPO匹配(两者均为89%),ASK+达到93%的成功率;在FourRooms上,成功率从53%上升到70%;在HigherLower上,准确率达到73.7%,匹配仅使用SLM的上限。在所有环境中,Qwen3.5-2B匹配或超过Qwen3.5-4B,确认提示设计和选择性门控主导了模型规模的影响,使得无需大型模型即可实现指导。 ###### 关键词: 部分可观察性\sep强化学习\sep语言模型\sep不确定性估计\sep蒙特卡洛Dropout ## 1 引言 在部分可观察性下运行的代理必须基于不完整信息行动,依赖自我中心观察,这些观察可能不足以区分有意义的不同的潜在状态。这种设置对于强化学习(RL)代理尤为具有挑战性,它们在训练期间学会近似反映训练环境特定结构的值函数。当该结构发生变化(例如门重新定位)时,代理没有机制检测不匹配。它的观察看起来熟悉,于是它自信地遵循其值函数走向失败。近期工作[monteiro2026ask, ahn2022saycan]通过将语言模型(LM)的外部指导与RL代理相结合来应对这一挑战。LM是此角色的自然候选者:接受过大量人类知识训练,它们能够推理目标、推断结构,甚至在全新情况下建议合理的动作。然而,这种推理能力取决于拥有足够的上下文。在部分可观察性下,代理的世界观固有地受限,仅咨询狭窄自我中心观察的LM可能缺乏可靠推理所需的全局上下文,产生的是自信错误而非有益纠正的指导[valmeekam2025systematic]。 ASK框架[monteiro2026ask]通过选择性地门控小型LM(SLM)查询来解决这一问题,仅在策略的不确定性超过阈值时咨询语言模型。在其对完全可观察环境FrozenLake的原始评估中,这种选择性策略使ASK接近PPO级别的性能,同时保持较低的模型查询次数。这表明,有限的推理预算若能明智使用,可以补偿策略不确定性而不压垮它。这种门控机制在部分可观察性下是否仍然有效,是原始工作留下的问题,也是本文旨在回答的问题。 我们评估了ASK的一个扩展,我们将其称为ASK+,在三个互补压力测试其门控机制的部分可观察环境中进行测试。 - MiniGrid-FourRooms-v0[minigrid]要求代理从自我中心7×7视野导航19×19网格以到达稀疏目标,隔离了有限可见性下空间定位的挑战。 - MiniGrid-DoorKey-8x8[minigrid]在此基础上增加了顺序子任务结构,要求代理找到钥匙、解锁门并到达目标。 - POPGym-HigherLower[morad2023popgym]要求代理每一步从单个观察预测扑克牌等级,最优玩法取决于跟踪所有先前看到的牌。 三个环境共同隔离了语言模型辅助在部分可观察性下的不同故障模式:空间定位、顺序任务分解和时间记忆。 我们的贡献如下: 1. 我们提出ASK+,将朴素ASK在部分可观察性下的失败诊断为上下文瓶颈而非能力限制,并通过状态化的情节提示来解决,该提示向SLM提供部分揭示的地图、访问过的位置、动作历史和结构化思维链推理。我们展示了底层熵信号在部分可观察性下仍然有效,并且ASK+在三个互补的部分可观察马尔可夫决策过程(POMDP)中始终优于朴素ASK和PPO基线。 2. 我们提供了实证比较,显示提示设计和选择性门控而非模型规模是性能的主要驱动力,Qwen3.5-2B在我们的实验中匹配或超过Qwen3.5-4B。 ## 2 背景 我们将部分可观察性问题形式化为部分可观察马尔可夫决策过程(POMDP)[kaelbling1998planning]。POMDP是一个元组 M = ⟨S, A, T, r, γ, O, Ω⟩,其中 S 是状态空间集,A 是动作空间集,T: S×A→S 是转移函数,r: S×A→R 是在状态 s 采取动作 a 的期望即时奖励,γ∈[0,1) 是折扣因子,O 是观察空间集,Ω: S→O 是观察函数。注意,与传统的马尔可夫过程不同,在POMDP中,代理观察到Ω产生的观察。求解POMDP产生一个策略 π: O→A,它将观察映射到动作,以最大化期望折扣回报 E[∑_{t=0}^{∞} γ^t r(s_t, a_t)]。我们将观察视为不完整的状态表示:Ω是非单射的,因此不同状态可能产生相同观察,代理无法仅从 o 恢复 s。 我们使用ASK[monteiro2026ask]框架来同时利用RL策略和SLM模型。ASK是一种外部方法,它增强训练好的RL策略与SLM顾问,无需重新训练或架构修改。在每一步,ASK对策略的MLP(多层感知机)应用MC Dropout[gal2016dropout]:它执行N次随机前向传递(Dropout激活),产生动作概率分布,其熵用作不确定性信号。如果总预测熵 H(o) 达到或超过阈值 τ,则根据当前观察(以及PPO建议,对于ASK)查询SLM;其响应在有效时覆盖策略。阈值 τ 通过保留验证集上的贝叶斯优化选择;测试集在调优期间从未访问。ASK最初在离散、完全可观察的网格FrozenLake上评估,选择性查询以低干预率实现了鲁棒的分布外泛化。我们研究相同的基于熵的信号在策略操作于模糊部分观察时是否仍然是可靠的触发器,以及SLM的基础知识是否足以解决部分可观察任务。 ## 3 方法 ASK+通过将其不确定性门控查询机制扩展为包含状态化情节推理(图1 (https://arxiv.org/html/2607.02686#S3.F1))来将ASK[monteiro2026ask]推广到部分可观察设置:MC Dropout通过N次随机前向传递估计总预测熵 H(o);如果 H(o) < τ,则直接执行PPO动作并更新 σ,否则通过从 o、a 和 σ 构建的提示 Pr 查询SLM。ASK+与ASK的主要区别在于如何激发SLM的推理能力。原始ASK仅提供当前观察,剥夺了模型运用其基础知识所需的上下文:限制在代理即时视野内的语言模型无法进行空间推理、跟踪历史或证明其建议。ASK+通过设计提示接口来解锁三种互补的推理能力来解决这一点。提示经过*丰富*处理,包含推导出的环境特征和局部动作预览,使SLM能够进行空间推理,而非对原始观察进行被动模式匹配。它具有*状态化*特性,附加了从 σ 构建的情节记忆(即部分揭示的地图、访问过的位置和动作历史),使SLM能够基于轨迹而非孤立快照进行推理。最后,它在受限预算内激活SLM的原生思考模式,给模型一个有限窗口的刻意计算时间,然后再承诺行动,而不是迫使其立即给出一个词的回应。 \includestandalone [width=.7]figures/ask_diagram 图1:ASK+的决策流程。每一步,PPO策略产生默认动作 a,MC Dropout估计总预测熵 H(o)。如果 H(o) ≥ τ,则通过从当前观察、PPO建议和情节状态 σ 构建的提示 Pr 查询SLM;其输出 a' 在有效时覆盖 a。情节状态 σ(虚线箭头)在整个情节中累积观察、访问位置和动作历史,为任何单个自我中心观察所缺乏的全局上下文提供支持。 ### 3.1 语言模型辅助 ASK+目标是SLM而非前沿模型,将ASK最初依赖较大系统的策略扩展到在逐个步骤推理计算上可行的小型模型。选择这一点的理由是,最近的SLM编码了足够的系统知识并能执行结构化推理[qwen3.5]。然而,这种能力是潜在的,需要正确的上下文才能激活。像ASK那样提供单个自我中心观察,既不提供空间定位也不提供这些模型需要用来启动其推理机制的序列上下文,导致信息不足的预测。因此,ASK+将提示视为模型推理的接口而非查询格式,并通过三种配置系统地改变提供的上下文数量。 - *丰富*配置将原始观察扩展为包含推导出的环境特征和局部动作预览,为模型提供空间推理所需的输入。 - *状态化*配置额外注入来自 σ 的情节记忆,使模型能够基于轨迹历史进行条件推理,并推理哪些区域已被探索或哪些移动已被尝试。 - *理由(rationale)*配置进一步启用SLM的原生思考模式,分配10个令牌的受限预算用于有意识的计算,然后再承诺行动,而不会产生会破坏小模型效率案例的计算开销。可见输出仍以短的理由行结束。不过,这行是对决策的简要说明,而非思考过程本身的可验证轨迹,我们不将其视为超出刚才描述机制之外的推理证据。 这些配置形成一个递进:每个配置增加一层上下文,使得一种定性不同的推理能力变得可访问,而非作为表层工程选择变化提示风格。我们在第6.1节(https://arxiv.org/html/2607.02686#S6.SS1) 中呈现了全面的消融研究,探索每个配置。 ### 3.2 策略架构与不确定性估计 RL策略是标准的演员-评论家,其神经网络提取器结合了蒙特卡洛Dropout,遵循第2节(https://arxiv.org/html/2607.02686#S2) 中描述的不确定性分解。Dropout在推理时保留,以产生跨N次随机前向传递的动作估计分布,从中推导出总预测熵 H(o)、偶然不确定性和认知不确定性。门控阈值应用于 H(o) 而非仅认知分量,因为两种不确定性来源都表明策略的动作估计不可靠:偶然不确定性反映了真实的观察模糊性,而认知不确定性反映了训练覆盖不足。尽管大多数研究关注认知不确定性,但我们主张使用总不确定性,因为偶然不确定性虽然从RL策略角度不可约,但通过利用SLM的基础知识和推理能力可能仍然可解决。 混合架构的一个关键方法论含义是RL策略不再需要对高不确定性状态进行泛化。在部分可观察性下通过RL单独实现泛化通常成本高昂:策略必须隐式学习从奖励信号中跟踪历史和解决模糊性,这需要高参数容量和扩展训练。在ASK+中,这些状态被委托给SLM,SLM的预训练已灌输了RL难以轻易获得的广泛世界知识和推理结构。这使得PPO策略可以保持小型并专注于分布内状态,在那里它既高效又准确。SLM相对于即时任务的过度参数化并非负担;它是策略有意放弃的泛化能力的来源。阈值 τ 于是充当容量分配机制,决定SLM的表示盈余中有多少被征用来补偿策略受限的泛化。 尽管如此,我们假设SLM无法独自解决这些任务,需要RL策略的局部、任务特定知识才能成功。为了理解ASK+中RL策略的影响,我们在第6.3节(https://arxiv.org/html/2607.02686#S6.SS3) 中实验了不同程度的次优性。 ## 4 实验与度量 在本工作中,我们使用Stable-Baselines3的PPO实现[stable_baselines3]作为基础策略,训练2×10^6步,使用默认超参数和线性学习率调度。至于SLM,我们使用Qwen3.5的2B和4B参数变体。
相似文章
面向LLM Agent澄清请求的不确定性分解
本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。
面向稀疏奖励强化学习的不确定性感知LLM引导策略塑形
提出ULPS,一种将校准的LLM集成到RL训练中的框架,通过不确定性调制的引导和基于A*的符号轨迹,在MiniGrid-UnlockPickup上实现了更高的成功率和样本效率。
使用语言模型先验从观测中学习POMDP世界模型
本文介绍了Pinductor,一种利用语言模型先验从有限的观测-动作数据中高效学习POMDP世界模型的方法,其性能与具有特权隐藏状态访问的方法相当,同时超越了传统的表格方法。
当证据稀疏时:对话与LLM-Agent轨迹中的弱监督早期故障预警
本文提出了一种两阶段方法,用于对话和LLM-Agent轨迹中的早期故障预警。该方法通过从轨迹标签中学习逐轮故障证据来解决证据稀疏的挑战,并使用基于注意力的预测器与偏好条件停止策略(α-STOP),以实现可控的准确率-及时性权衡。
部分可观测下安全关键控制的动作条件风险门控
本文提出了动作条件风险门控(Action-Conditioned Risk Gating),一种用于部分可观测下风险敏感控制的轻量级强化学习方法,该方法利用紧凑的有限历史代理状态和基于动作条件的近期风险预测器来平衡安全性和性能。