DeliveryGym:用于自适应课程的长期具身智能体规划强化学习环境

arXiv cs.LG 论文

摘要

DeliveryGym是一个用于自适应课程的长期具身智能体规划的3D强化学习环境,通过强化学习展示了性能提升。

arXiv:2609.19801v1 公告类型:新 摘要:可执行环境使LLM智能体能够从其行为的后果中学习。对于具身智能体,这些后果不仅限于当前任务是否成功:完成一次配送可能消耗后续工作所需的时间、能量或金钱。因此,学习规划需要能够保留这些依赖关系并将其转化为整个轨迹反馈的环境。我们推出了DeliveryGym,一个用于评估和训练智能体在连续快递轮班中的3D环境。它将多模态工具交互与持续的世界动态相结合,并从模拟器事件计算轨迹奖励,使智能体决策的成本可用于强化学习(RL)。该环境还会根据策略观察到的弱点调整未来的训练轮班,同时保持评估固定。在六个模型和13个城市地图中,评估揭示了在可靠执行分配的配送与在一个轮班中选择和排序工作之间的差距。在固定测试套件上,强化学习将Qwen3-VL-4B的净收入提高了54.3%,表明从完整轮班中学习可以在这些耦合约束下提高性能。调整训练环境在相同的展开预算下,比均匀采样将测试收入提高了16.5%,表明智能体练习哪些情况也很重要。DeliveryGym提供了一个可执行设置,用于研究智能体如何在单个情节中学习协调配送并为后续订单保留资源。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:07

# 用于长时程具身智能体规划与自适应课程的强化学习环境  
来源:https://arxiv.org/html/2609.19801  

## DeliveryGym:一个用于长时程具身智能体规划与自适应课程的强化学习环境  

**作者**:Yiming Zhang²、Yiyang Guo¹、Chuying Li¹、Jianzhi Shen³、Tianruo Rose Xu⁴、Xiaokang Ye¹、Lianhui Qin¹  
**单位**:¹加州大学圣迭戈分校 ²独立研究者 ³约翰斯·霍普金斯大学 ⁴康奈尔大学  

###### 摘要  

可执行环境使大语言模型智能体能够从其行动后果中学习。对于具身智能体而言,这些后果不仅限于当前任务是否成功:完成一次配送可能消耗后续工作所需的时间、精力或资金。因此,学习规划需要能够保持这些依赖关系并在完整轨迹中将其转化为反馈的环境。我们推出了 **DeliveryGym**,一个用于评估和训练智能体执行连续快递班次任务的三维环境。它将多模态工具交互与持久化世界动态相结合,并根据模拟器事件计算轨迹奖励,从而使智能体决策的成本可被强化学习利用。该环境还能根据策略观察到的弱点调整后续训练班次,同时保持评估固定。在六个模型和十三个城市的地图上,评估揭示了可靠执行指定配送任务与在整班次中选择和排序工作之间的差距。  
在固定测试集上,强化学习使 Qwen3-VL-4B 的净收入提高了 54.3%,表明在耦合约束下从完整班次中学习能提升性能。  
在相同策略训练回合预算下,自适应课程比均匀采样在测试收入上提高了 16.5%,说明智能体练习的情境类型同样重要。  
DeliveryGym 提供了一个可执行环境,用于研究智能体如何在单个情节内学习协调配送并为后续订单保留资源。  

**图表说明**  
图 1:以巴黎快递班次为例展示 DeliveryGym。智能体在时间、资源、食品质量和安全约束下选择和配送订单。订单之间共享时钟、资源余额和当前承诺。事件轨迹记录执行的操作;模拟器事件确定约束检查和净收入。  

## 1 引言  

可执行环境已成为大语言模型智能体进步的重要驱动力。在软件工程和计算机使用中,智能体通过工具执行真实任务、观察执行结果并获得可验证的反馈。这些环境将交互转化为训练数据,并通过强化学习支持策略改进。  
这一进展对具身人工智能提出了一个平行问题:模拟世界能否提供类似基于现实且可扩展的学习经验?  
长时程具身推理使这个问题尤其具有挑战性。行动的价值往往取决于它如何改变未来世界的状态。现实世界的活动通过空间、时间、资源、物理动力学、安全和成本将决策耦合在一起。绕路消耗能量并延迟后续承诺;充电恢复移动能力但需要时间和成本;接受一项任务会改变哪些未来任务仍然可行。因此,学习此类行为不仅需要识别成功的最终状态,还需要能够确定每个行动如何改变下一步可能性的可执行动力学。  
模拟通过可重复的转换、基于真实的状态以及完整的行动和后果轨迹提供了这样的基础。  
具身人工智能已经提供了强大的模拟器,用于导航、操作、家居活动、开放世界交互和城市移动。具身基准也定义了越来越真实的任务来评估规划和推理。  
然而,真实的基准并不自动等同于强化学习环境。基准规定智能体应完成什么以及如何衡量其性能。强化学习环境还必须定义智能体如何观察世界、在其中行动、到达下一个状态以及为学习接收反馈。对于长时程任务,这些组件不能独立设计,因为奖励取决于在相互作用的约束下累积的后果。  

我们研究的假设是:**当具有操作结构的任务与可执行世界动态和可验证轨迹奖励相结合时,可以通过强化学习改进长时程具身规划和推理。**  

我们使用 **DeliveryGym** 测试这一假设。它是一个用于长时程配送智能体的、可验证且可扩展的三维强化学习环境,具有 Unreal Engine 5 模拟后端。  
在 DeliveryBench 的配送任务和城市模拟基础上,DeliveryGym 的重点从评估智能体转向通过在线强化学习改进其策略。它支持带有可重置并行回滚和可验证轨迹奖励的重复策略更新,同时自适应课程根据学习者调整训练内容。  
智能体接收多模态上下文并通过工具行动;模拟器执行其操作并记录产生的任务结果和约束事件。每次交互都会改变持久化物理和运营状态,因此一个局部有效的操作仍可能导致较差的长期回报。这创造了一个长时程强化学习问题,其中工具使用需要对延迟后果进行规划,并且模拟器事件轨迹扮演着可执行测试在软件智能体中所扮演的角色:提供轨迹实际完成情况的基于现实的证据。  

固定的任务分布在学习的整个过程中并不具有同等的信息量。随着策略的改进,重复抽样已掌握的案例提供的新信号很少,而远超其能力的案例可能产生难以利用的失败。因此,DeliveryGym 通过自适应课程闭合了学习循环。它从已执行的轨迹中诊断反复出现的失败,并调整后续任务配置以针对当前限制策略的能力。  
训练经验适应策略,而独立的任务和保留城市保持固定用于评估。这形成了一个从工具交互到基于现实的结果、可验证奖励、策略更新,最终到有针对性的未来经验的闭环。  

我们的实验首先评估了六个基础模型,揭示了视觉定位的困难以及可靠单订单执行与盈利班次级规划之间的差距。  
仅靠高配送成功率并不能确保智能体在整班次中很好地选择和排序工作。  
接下来,我们测试这些能力是否可以通过在线强化学习提高:训练使 Qwen3-VL-4B 的测试净收入提高了 54.3%,其中安全感知奖励在收入和交通合规性方面均优于仅考虑收益的奖励。  
随后,在相同策略训练回合预算下,针对策略当前弱点的自适应课程比均匀采样提高了 16.5% 的测试收入,比固定课程提高了 8.7%。  
最后,扩大训练地图和任务池在不收集更多轨迹的情况下提高了班次收入,表明更广泛训练情境可以使固定量的交互对学习更有用。  

## 2 DeliveryGym  

DeliveryGym 研究在持续的快递班次中进行的规划:选择和排序订单、选择路线以及管理后续工作所需的时间和资源(图1)。我们首先定义任务和连接连续配送的约束(2.1节),然后描述 DeliveryAgent 如何观察世界并在其中行动(2.2节)。这些交互支持用于衡量班次性能的固定评估协议(2.3节)以及从执行结果中学习的强化学习循环(2.4节)。最后,我们根据策略的弱点调整未来的训练班次(2.5节),闭合如图2所示的循环。  

**图表说明**  
图 2:DeliveryGym 中的在线训练循环。(1)智能体观察街景、路线图和结构化状态。(2)工具操作在多轮回滚中改变订单、能量和收入。(3)验证器根据模拟器事件计算奖励,(4)为策略更新提供反馈。(5)自适应课程利用回滚失败来调整后续训练的任务难度和多样性,包括订单负荷、截止时间、电池水平和交通状况。  

### 2.1 任务  

#### 自主快递班次。智能体作为快递员工作一个连续的班次。订单随时间到达,智能体选择接受哪些订单,前往餐厅,收集食物,并将其送达客户。为了捕捉真实快递工作的结构,我们将整个班次表示为一个多回合的情节,并且在每次配送后不重置世界。  
每个操作返回结构化反馈。无效操作消耗一个回合;执行的操作也会更新时间、资源和安全性。位置、活动订单、资源和收益会延续到下一个决策。目标是最大化整个班次的净收入。智能体可以步行或使用滑板车。  

#### 模拟后端。配送工作依赖于街道布局、交通和障碍物。为了模拟这些条件,我们使用基于 Unreal Engine 5 构建的 SimWorld Studio 作为模拟后端。DeliveryGym 使用 13 个预定义的固定城市地图,包括巴黎和纽约,包含渲染的街景、可行走区域、导航、移动、碰撞、交通灯、障碍物、餐厅、客户、资源站点和途经点。DeliveryGym 在此配送设置中增加了在线强化学习训练和自适应任务配置。  
我们可以在另一个兼容的地图上运行相同的任务,前提是注册了其服务位置和导航数据。  

#### 订单系统。快递员在整个班次中从到达的订单中进行选择。我们用一个变化的订单流来模拟这一点,每个订单具有取货地点、目的地、报酬、截止时间和食品类型。班次种子决定了订单的到达、地点和属性,使得产生的流可重放。  
不同的食品类型需要不同的照料:冰淇淋需要保温,易碎食品对颠簸运输敏感,时间敏感的餐点在长路线上会变质。多个配送任务可以重叠,因此智能体必须选择和排序其工作。  

#### 持久化约束。配送工作将时间、精力、金钱、食品状况和安全联系在一起。为了捕捉这些依赖关系,我们保持一个时钟和快递员状态跨所有订单。移动消耗体力或滑板车电量;恢复消耗时间或金钱;食品状况随延迟和处理而变化;交通灯和障碍物影响安全移动。事故和资源耗尽可能触发医院恢复,消耗时间和金钱。附录A中的表4详细说明了环境暴露的六种持久化约束。  

### 2.2 DeliveryAgent  

DeliveryAgent 结合了基础多模态策略和固定工具集。对于每个策略,我们都使用相同的工具集。在每个回合,它格式化观察,验证一个结构化操作,执行它,并返回环境反馈。工具集不选择订单、规划路线或修复失败的操作。提供者适配器仅翻译消息和工具语法;它们不添加规划或导航。  

#### 观察。策略接收自我中心 RGB 视图、路线图和结构化快递员状态,包括时间、订单、能量、余额和上一个操作结果。最近的回合和持久笔记本提供上下文。  

#### 工具、操作和移动。工具涵盖订单选择、取货和配送、导航和资源管理。使用 *Any-Point*,策略选择一个图像像素,该像素被投影到可到达的三维点;使用 *Waypoint*,它选择一个可见的注册目的地。两者都需要路线选择、危险处理和恢复。Waypoint 训练和评估使用缓存的 RGB 视图;Any-Point 评估使用在线渲染。附录A详细说明了观察和工具模式。  

### 2.3 评估  

#### 评估集构建。我们构建了一个固定的 DeliveryGym 评估集,包含 13 个地图上 130 个可重放的班次。每个班次固定了起始状态、订单机会、截止时间、食品要求、危险、资源、评级规则和随机种子,但不固定智能体的操作。训练配置在十个地图上使用独立的种子,单独的验证集支持检查点选择,三个评估地图完全排除在训练之外。附录B详细说明了协议。  

#### 评估协议和指标。所有智能体接收相同的工具集、观察、工具、班次和回合预算。净收入通过收入、成本和罚金联合评估规划和执行。完成的订单、及时性、安全事件和规划诊断解释了决策如何影响该结果。基于搜索的预言机提供参考收入;在线规划器干预测试订单选择,同时保持执行策略固定。附录B给出了协议。  

### 2.4 交互式强化学习训练  

强化学习训练策略在一个完整班次内联合选择订单、路线和资源使用。每个工具操作改变下一个决策可用的状态,最终回报对整个回滚进行评分。  

#### 从班次结果中学习。每次回滚从生成的班次开始。模拟器根据执行的事件计算净收益:  
\( E(\tau) = \text{基本报酬} + \text{小费} - \text{延迟/食品扣减} - \text{直接开支} \)  
小费取决于配送评级;低评级扣减计入扣减项,直接开支包括资源购买和医院恢复费用。我们使用终端回报 \( R(\tau) = E(\tau) - \lambda_{\text{light}} \cdot \text{闯红灯次数} - \lambda_{\text{obstacle}} \cdot \text{障碍物碰撞次数} \) 进行训练。  
权重在仅收益训练中为零,在安全变体中启用。评估始终使用 \( E(\tau) \)。所有项均来自模拟器事件;无需操作标签或大语言模型判断。  

#### 智能体强化学习系统。我们运行实时训练...

相似文章

ClawGym II:基于代理工具的黑箱强化学习探索

Hugging Face Daily Papers

本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。

Ecom-RLVE:面向电商对话代理的自适应可验证环境

Hugging Face Blog

Huggingface 推出 EcomRLVE-GYM,这是一个提供八个可验证环境的框架,用于在复杂电商任务上训练强化学习智能体。该工具具备自适应难度课程和算法化奖励机制,以提升购物助手的任务完成率,并已通过训练 Qwen 3 8B 模型进行了验证。

MemGym:面向LLM智能体的长时记忆环境

arXiv cs.CL

MemGym是一个基准测试,用于评估LLM智能体在长时任务中的记忆形成,它统一了现有的智能体gym和合成流水线,并采用记忆隔离得分。它涵盖工具使用对话、多轮搜索、编码和计算机使用,并包含一个轻量级奖励模型(MemRM)以实现高效评估。

AutoGym:蓝图优先的可验证智能体训练环境生成

arXiv cs.AI

AutoGym提出一个框架,通过蓝图优先生成,从最小种子自动生成完整的智能体训练环境(包括任务、可执行环境和验证器),以确保可解性并实现主动课程综合,用于自适应难度调控。

面向长时程工具使用智能体任务的高效强化学习

arXiv cs.LG

本文介绍了 SinkFlex-RL,一个用于长时程工具使用智能体任务中内存可行的强化学习的模块化训练系统。它结合了兼容 Gymnasium 的环境封装、基于 GRPO 的策略优化,以及 sink 感知的 FlexAttention 路径,在 4096 个 token 时峰值显存降低 19.7%,并能在 eager attention 内存溢出的情况下支持 8192 个 token 的运行。