从演示到奖励:VLM奖励模型的测试时提示优化
摘要
提出Demo2Reward,一种针对VLM奖励模型的测试时提示优化技术,利用少量专家演示,显著减少误报,并在无需额外模型训练的情况下改进机器人策略学习。
arXiv:2606.00083v1 公告类型:新
摘要:强化学习依赖于准确的奖励函数,而在机器人等现实应用中,这些函数往往是手工设计的,甚至不可用。最近的研究探索了预训练视觉语言模型(VLM)的零样本推理能力作为奖励模型。然而,如果没有仔细的提示工程,这些方法往往会生成次优的奖励,其中误报预测会严重损害下游策略学习。在机器人领域,通常收集包含专家演示的有限数据集来启动策略学习。这种场景提供了在策略训练之前优化奖励模型的机会。我们提出Demo2Reward,一种测试时自适应技术,基于少量演示(3-10条轨迹)优化奖励模型的语言指令,以减少误报同时保留真阳性。关键在于,这在策略学习过程中不需要额外的模型训练或计算资源。我们展示了Demo2Reward在一系列模拟机器人任务和策略主干上始终优于现有的零样本和少样本VLM奖励模型。最后,我们证明Demo2Reward能有效迁移到真实世界的机器人学习场景,无需手动设计奖励函数即可进行策略学习。
查看缓存全文
缓存时间: 2026/06/02 15:39
# 从演示到奖励:VLM奖励模型的测试时提示优化 来源:https://arxiv.org/abs/2606.00083 查看 PDF (https://arxiv.org/pdf/2606.00083) > 摘要:强化学习依赖于准确的奖励函数,而在机器人等实际应用中,这些函数往往需要手动设计甚至无法获得。近期研究探索了预训练视觉语言模型(VLM)的零样本推理能力,将其用作奖励模型。然而,若缺乏细致的提示工程,这些方法容易产生次优奖励,其中假阳性预测会严重破坏后续的策略学习。在机器人领域,通常收集少量包含专家演示的数据集来引导策略学习。这种场景为我们提供了在策略训练之前优化奖励模型的机会。我们提出 Demo2Reward——一种测试时自适应技术,可基于少量演示(3-10 条轨迹)优化奖励模型的语言指令,在保留真阳性预测的同时减少假阳性。关键在于,该方法在策略学习过程中无需额外的模型训练或计算资源。我们证明,在一系列模拟机器人任务和策略主干中,Demo2Reward 的表现始终优于现有的零样本和少样本 VLM 奖励模型。最后,我们展示了 Demo2Reward 能够有效迁移至真实世界的机器人学习场景,无需人工设计奖励函数即可实现策略学习。 ## 提交历史 来自:Christian Gumbsch [查看邮件 (https://arxiv.org/show-email/d24a5fb9/2606.00083)] **\[v1\]**2026年5月22日,星期五,16:04:22 UTC(2,393 KB)
相似文章
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。
@RyanBoldi: 您的 RL 后训练可能正在破坏您的 LLM 的测试时扩展!传统 RL 假装您可以将所有奖励信号压缩为...
介绍了向量策略优化(VPO),一种新的 RL 方法,通过处理向量值奖励来改进 LLM 的测试时扩展,优于传统的标量奖励方法。
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。
TEMPO:通过模式分离策略优化实现时间强制,用于可信的大语言模型回测
提出TEMPO,一种策略优化方法,通过使用双模式奖励和基于GRPO的训练,训练大语言模型仅依据截止日期前的信息进行推理,将知识泄露降低2–13%,同时将任务性能提升6–13%。
向量策略优化:面向多样性的训练提升测试时搜索性能
本文介绍了一种名为向量策略优化(Vector Policy Optimization, VPO)的强化学习算法,该算法通过优化多个奖励维度来训练大语言模型生成多样化的解决方案,与标量强化学习基线相比,显著提升了测试时搜索性能。