提示驱动探索

arXiv cs.LG 论文

摘要

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。

arXiv:2607.08837v1 公告类型:新 摘要:探索对于强化学习至关重要,因为策略无法通过反复采样其已偏好的行为来改进。标准方法在动作空间中注入随机性,但这种抖动只会产生接近原始轨迹的轨迹。摆脱弱策略通常需要动作噪声无法产生的全局扰动。大型语言模型(LLM)和视觉-语言-动作模型(VLA)提供了一条途径:它们将策略条件化于自然语言提示,由于轨迹由此产生,修改提示会引发全局变化。挑战在于找到能引发有用全局变化的提示。当弱策略很少成功时,奖励过于稀疏而无法进行选择。我们的想法是从轨迹本身优化提示:视觉语言模型(VLM)对轨迹视频进行推理,诊断策略如何响应,并重写提示以在下次引发更好的行为。这个过程在提示层面实现了后验采样,一种经典的强化学习探索框架:VLM维护一个关于有用提示的隐式分布,并根据观察到的轨迹进行更新。我们将此策略称为提示驱动探索(PDE)。在操作和推理任务中,PDE使得强化学习即使在零奖励起点也能学习到成功的策略,并在更广泛的任务中提高样本效率。我们的网站访问地址:https://xinyunsunshine.github.io/prompt-rl。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:55

# 提示驱动探索 来源:https://arxiv.org/html/2607.08837 Sunshine Jiang1,3,John Marangola1,3,David Zhang1,3,Raghuram Kowdeed3,Ruiyang Luo1,3,Nitish Dashora1,3,Richard Li1,3,Pulkit Agrawal1,3,Zhang\-Wei Hong1,2,3 Massachusetts Institute of Technology1, MIT\-IBM Computing Research Lab2, Improbable AI Lab3 ###### 摘要 探索对于强化学习至关重要,因为策略无法通过重复采样其已偏好的行为来改进。标准方法在动作空间中注入随机性,但这种抖动仅能产生接近原始行为的轨迹。摆脱弱策略通常需要全局扰动,而动作噪声无法产生这种扰动。大语言模型(LLMs)和视觉-语言-动作(VLA)模型提供了一条途径:它们将策略基于自然语言提示,并且由于轨迹随之生成,修改提示会引起全局变化。难点在于找到能引发有用全局变化的提示。对于很少成功的弱策略,奖励过于稀疏而无法用于选择。我们的想法是从轨迹本身来优化提示:视觉语言模型(VLM)对轨迹视频进行推理,诊断策略如何响应,并重写提示以便下次诱导出更好的行为。这一过程在提示层面实现了后验采样(一种经典的强化学习探索框架):VLM 维护一个关于有用提示的隐式分布,并根据观测到的轨迹更新该分布。我们将这种策略称为提示驱动探索(PDE)。在操作和推理任务中,PDE 使得强化学习即使在零奖励起点也能学习到成功策略,并广泛提高了样本效率。我们的网站见 https://xinyunsunshine.github.io/prompt-rl。 ## 1引言

强化学习(RL)(kaelbling1996reinforcement, (https://arxiv.org/html/2607.08837#bib.bib20))已成为基础模型的主导后训练范式,因为它能够在大规模监督学习之外实现可扩展的自我改进。RL 微调已经解锁了大语言模型(LLMs)(jaech2024openai, (https://arxiv.org/html/2607.08837#bib.bib18);Guo2025DeepSeekR1, (https://arxiv.org/html/2607.08837#bib.bib14)) 的强推理和数学能力,并使大规模基于扩散的文本到图像模型能够直接与人类偏好对齐(black2024training, (https://arxiv.org/html/2607.08837#bib.bib6))。然而,自我改进受到探索的瓶颈限制:策略只能通过生成与其当前偏好不同的轨迹来超越其当前行为,这样 RL 才能强化获得更高奖励的轨迹。标准实践通过随机采样动作而非贪婪方式(williams1992simple, (https://arxiv.org/html/2607.08837#bib.bib46);schulman2017ppo, (https://arxiv.org/html/2607.08837#bib.bib36);haarnoja2018soft, (https://arxiv.org/html/2607.08837#bib.bib15)) 在动作空间中对策略进行扰动。但这种动作层面的噪声仅能抖动单个动作,并产生接近原始的轨迹;它仅能引起局部探索(osband2016deep, (https://arxiv.org/html/2607.08837#bib.bib32);ecoffet2021first, (https://arxiv.org/html/2607.08837#bib.bib13)),并且通过逐动作噪声可达的轨迹集合随视野和动作维度迅速缩小。摆脱弱策略通常需要全局扰动,从而改变整个轨迹的行为,而动作噪声无法产生这种扰动。在没有强热启动的情况下,这一限制尤为明显,特别是在操作任务上的视觉-语言-动作(VLA)模型微调中,最先进的模型通常从接近零的成功率开始(kim2024openvla, (https://arxiv.org/html/2607.08837#bib.bib22);black2024pi0, (https://arxiv.org/html/2607.08837#bib.bib5))。如果动作噪声只能产生局部探索,我们如何对策略进行全局扰动?基础模型提供了一条途径。LLMs(brown2020language, (https://arxiv.org/html/2607.08837#bib.bib7);achiam2023gpt, (https://arxiv.org/html/2607.08837#bib.bib1)) 和 VLA(kim2024openvla, (https://arxiv.org/html/2607.08837#bib.bib22);black2024pi0, (https://arxiv.org/html/2607.08837#bib.bib5)) 基于自然语言提示,并且由于整个轨迹随之生成,修改提示会引起全局变化。图1 (https://arxiv.org/html/2607.08837#S1.F1) 展示了这种行为:给定提示“将绿色容器放在底部架子上”,策略拿起容器但未能完全放置在架子上。动作噪声仅抖动机械臂而不改变策略。将提示改写为“将绿色容器完全放在底部架子上”将策略引导至正确的接触点并成功,而无需任何权重更新。先前关于上下文工程和提示优化的工作表明,提示措辞可以显著塑造模型行为(brown2020language, (https://arxiv.org/html/2607.08837#bib.bib7);opsahl2024optimizing, (https://arxiv.org/html/2607.08837#bib.bib31);karnik2024embodied, (https://arxiv.org/html/2607.08837#bib.bib21);hong2024curiosity, (https://arxiv.org/html/2607.08837#bib.bib16)),但据我们所知,提示尚未被用作 RL 中探索的轴。开放问题是如何找到能引发有用全局变化的提示。一个自然的答案是尝试候选提示并保留那些产生更高奖励的提示,但对于很少成功的弱策略,奖励过于稀疏而无法用于选择。我们反而从轨迹本身来优化提示:视觉语言模型(VLM)对轨迹视频进行推理,诊断策略如何响应,并重写提示以便下次诱导出更好的行为。这一过程在提示层面镜像了后验采样 RL(strens2000bayesian, (https://arxiv.org/html/2607.08837#bib.bib39);osband2013posterior, (https://arxiv.org/html/2607.08837#bib.bib33);daniel2018tutorial, (https://arxiv.org/html/2607.08837#bib.bib10);osband2016deep, (https://arxiv.org/html/2607.08837#bib.bib32))。VLA 定义了一个由提示条件化的策略族,因此提示上的分布隐式地诱导了策略上的分布,该分布由预训练的语言先验结构化。VLM 作为摊销的后验更新:它从其语言先验中采样合理的提示(yang2023large, (https://arxiv.org/html/2607.08837#bib.bib52);zhou2022large, (https://arxiv.org/html/2607.08837#bib.bib56);soylu2024fine, (https://arxiv.org/html/2607.08837#bib.bib38)),并通过推理观测到的轨迹来优化这一分布(qwen2025vl, (https://arxiv.org/html/2607.08837#bib.bib47);openai2024gpt4o, (https://arxiv.org/html/2607.08837#bib.bib17);gemini2024, (https://arxiv.org/html/2607.08837#bib.bib42)),而无需梯度训练。这与上下文学习可以表现为隐式贝叶斯推理的证据一致(xie2021explanation, (https://arxiv.org/html/2607.08837#bib.bib49);wang2023large, (https://arxiv.org/html/2607.08837#bib.bib44);akyurek2022learning, (https://arxiv.org/html/2607.08837#bib.bib3))。我们将得到算法称为提示驱动探索(PDE):VLM 根据观测到的轨迹迭代更新提示分布,每次轨迹通过从该分布中采样提示来生成。我们的贡献是一种简单的探索策略,通过从策略轨迹中优化提示,使得 RL 能够摆脱弱初始策略。我们在 LIBERO(liu2023libero, (https://arxiv.org/html/2607.08837#bib.bib26)) 和 LIBERO-PRO(zhou2025liberopro, (https://arxiv.org/html/2607.08837#bib.bib55)) 上评估 PDE,使用仅在部分演示上训练过的 VLA。在此设置下,策略没有成功轨迹可以强化,动作空间扰动很少能偶然发现成功。在不同难度的任务中,PDE 以更少的环境交互实现了更高的成功率,并解决了动作空间探索失败的任务。我们的分析表明,VLM 更新可靠地将提示分布转向能够引出成功的提示,支持了 PDE 背后的后验采样观点。为了展示 PDE 在 VLA 控制之外的通用性,我们还将其应用于具有挑战性的 LLM 编码任务,它同样提高了样本效率。

参见图注:图1:左:给定提示“将绿色容器放在底部架子上”,VLA 策略拿起容器但未完全放置在架子上,导致其从边缘掉落(上排)。将提示改写为“将绿色容器完全放在底部架子上”后,相同策略成功,无需任何权重更新(下排)。右:使用我们的提示驱动探索(PDE)的 RL 将成功率从10%提高到50%,而使用标准动作噪声探索的 PPO(schulman2017ppo, (https://arxiv.org/html/2607.08837#bib.bib36)) 仍接近零。

## 2相关工作

VLA 的 RL 后训练。在稀疏二元奖励下微调预训练 VLA 在大规模下具有挑战性(tan2025interactive, (https://arxiv.org/html/2607.08837#bib.bib40);liu2026what, (https://arxiv.org/html/2607.08837#bib.bib27);li2026simplevlarl, (https://arxiv.org/html/2607.08837#bib.bib24))。最近的工作减少了 RL 需要更新的内容:冻结骨干网络,只在其上训练一个小模块,例如带有 actor-critic 头的 RL 标记(xu2025rlt, (https://arxiv.org/html/2607.08837#bib.bib50)) 或残差离策略 actor 蒸馏回基础策略(xiao2026selfimproving, (https://arxiv.org/html/2607.08837#bib.bib48));或在预训练扩散策略的潜在空间中优化(wagenmaker2025steering, (https://arxiv.org/html/2607.08837#bib.bib43))。这些改变了策略更新的*方式*;我们改变了*要求它做什么*。

基础奖励模型。一条互补的路线是通过训练文本条件化的进度模型来稠密化奖励,无论是作为目标达成价值函数(ma2022vip, (https://arxiv.org/html/2607.08837#bib.bib30);ma2023liv, (https://arxiv.org/html/2607.08837#bib.bib29))、来自演示上插值进度标签(ma2024vision, (https://arxiv.org/html/2607.08837#bib.bib28);liang2026robometer, (https://arxiv.org/html/2607.08837#bib.bib25);zhai2025vision, (https://arxiv.org/html/2607.08837#bib.bib53)) 还是来自偏好(wang2024rl, (https://arxiv.org/html/2607.08837#bib.bib45))。这些为给定的轨迹分布重塑奖励;PDE 则改变轨迹分布本身,两者是兼容的。

提示优化。LLM 可以作为提示优化器,迭代优化提示(yang2023large, (https://arxiv.org/html/2607.08837#bib.bib52);zhou2022large, (https://arxiv.org/html/2607.08837#bib.bib56)),类似的 VLM 方法通过视觉基础的离散优化(du2024ipo, (https://arxiv.org/html/2607.08837#bib.bib12)) 和连续上下文嵌入(zhou2022learning, (https://arxiv.org/html/2607.08837#bib.bib54)) 存在。与我们设置最接近的是 CoVer-VLA(kwok2026scalingverificationeffectivescaling, (https://arxiv.org/html/2607.08837#bib.bib23)),它使用训练好的验证器在测试时优化 VLA 指令。相反,我们在训练期间使用提示多样性作为探索机制。

RL 探索策略。动作噪声的经典替代方案包括基于计数的奖励(bellemare2016unifying, (https://arxiv.org/html/2607.08837#bib.bib4))、好奇心驱动的内在动机(pathak2017curiosity, (https://arxiv.org/html/2607.08837#bib.bib34))、熵正则化(haarnoja2018soft, (https://arxiv.org/html/2607.08837#bib.bib15)) 和参数空间噪声(plappert2018parameter, (https://arxiv.org/html/2607.08837#bib.bib35))。这些在 VLA 后训练中应用有限,因为在数十亿参数的策略旁边训练高维视觉输入的辅助密度或前向模型成本高昂。PDE 转而探索任务规范空间,利用预训练 VLA 中已经存在的语言条件。

## 3预备知识

我们使用强化学习(RL)(kaelbling1996reinforcement, (https://arxiv.org/html/2607.08837#bib.bib20)) 在多任务设置中微调视觉-语言-动作(VLA)策略(black2024pi0, (https://arxiv.org/html/2607.08837#bib.bib5);kim2024openvla, (https://arxiv.org/html/2607.08837#bib.bib22))。标准的 RL 流程在手工制作的任务分布上训练策略 \(\pi_\theta\)。每个任务 \(g\) 配有一个规范提示 \(p_g\)。每次轨迹开始时,采样一个任务 \(g\) 并给 \(\pi_\theta\) 一个提示 \(p\)。在每个时间步 \(t\),策略接收环境观测 \(o_t\)(例如,文本、RGB 图像等)并输出动作 \(a_t\),直到 horizon \(T\)。我们将生成的轨迹记为 \(\tau_p = (o_0, a_0, \dots, o_{T-1}, a_{T

相似文章

乱码也有效:提示空间扰动拓宽推理探索

Hugging Face Daily Papers

本文介绍了 LoPE,这是一种利用提示空间扰动来解决可验证奖励强化学习中“零优势问题”的训练框架,从而增强大语言模型的推理探索能力。

基于重试的策略梯度强化学习中探索的涌现

arXiv cs.LG

本文提出ReMax,一种新的强化学习目标函数,通过基于多个样本的期望最大回报来评估策略,从而将探索作为涌现属性引入,无需显式的探索奖励。作者推导了策略梯度公式,并提出了RePPO,一种PPO变体,在MinAtar和Craftax基准测试上实现了高效探索。