扩展网络视频预训练是否有助于真实机器人完成实际工作?(36分钟阅读)

TLDR AI 论文

摘要

本研究严格检验了扩展网络视频预训练能否提升机器人任务性能,发现更大模型和更多计算资源在真实工业任务中持续产出更优策略,且预训练质量与性能表现呈正相关。

通过直接视频-动作模型验证,扩大视频模型规模与增加预训练计算量确实能提升机器人任务性能。性能提升源于对网络留白视频更精准的预测,更大模型在复杂工业拆包等现实任务中表现尤为突出。经DINO FD指标衡量的预训练质量可预测下游机器人工作效率,为真实场景部署提供了可扩展性保障。
查看原文
查看缓存全文

缓存时间: 2026/09/11 14:12

# 扩展网络视频预训练能否帮助真实机器人完成实际工作?| Rhoda AI 来源:https://www.rhoda.ai/research/scaling-web-video-pretraining 视频预训练已成为机器人基础模型的基石,随之而来的一个普遍信念是:**扩展网络视频预训练规模能提升下游机器人任务性能。** 这一信念尚未经过严格验证。很少有研究深入探究模型规模和计算量的扩展效应,通常仅将其与从头训练的模型进行二元对比。更少有研究超越替代指标和简单实验室任务,去探索在复杂、长周期的真实世界应用场景任务中的扩展效果。 我们使用直接视频-动作模型对这一信念进行了验证。网络视频资源充足,供给从不构成约束,因此对其进行预训练只需团队考虑两项决策:训练多大规模的模型,以及投入多少计算资源进行训练。我们对两者均进行了变化,用相同工业任务的机器人演示数据对每个预训练模型进行后训练,并采用对客户有意义的指标在真实机器人上评估所得策略。 **我们的发现:** - 更大的预训练视频模型始终能生成更优的机器人策略,且该趋势在我们测试的最大规模模型中依然成立。 - 在后训练所用的每种机器人演示数据量下,增加预训练计算量都能提升机器人策略性能,在机器人数据稀缺时增益最为显著。 - 在预训练检查点处对未见过网络视频的预测能力,与我们测试的所有模型规模和计算预算下的机器人策略性能均存在相关性(参见图1)。 这些发现耗费了超过200小时的真实机器人评估时间。由于物理评估可能因多种与策略无关的原因失败,我们将评估协议本身也视为本项工作的成果。该协议总结在“评估执行方式”中,完整内容见附录A。 图1:预训练质量与任务性能对比 **图1。***七个预训练检查点,每个检查点在完整机器人演示集上进行一次后训练。标签为模型规模,从XS到L。四个M点代表同一模型分别使用0.08×、0.18×、0.37×和1×完整预训练计算量的结果。X轴:DINO FD(弗雷歇距离),衡量模型在预训练检查点处预测未见过网络视频的能力,方向反转后越靠右质量越高。Y轴:实时完成率,指在时限内满足所有要求的试验占比。误差线为95%可信区间。* ## 研究问题 业界普遍相信扩展视频预训练能提升机器人任务性能。我们旨在深入探究这一假设。形式上,我们提出问题: 在其它条件不变的情况下,扩展**通用网络视频预训练**是否能显著提升**真实部署中的复杂操作任务**性能? - **预训练数据。** 我们在通用网络视频上进行预训练,而非选用与操作相关的视频(如第一人称视角或机器人视频)。1我们的预训练数据仅包含视频,不包含动作信息。 - **任务。** 我们在真实客户用例的复杂操作任务上进行测量,评分标准采用该客户要求的更严格版本。 - **预训练指标。** 我们使用DINO FD(弗雷歇距离)对每个预训练视频模型预测未见过网络视频的能力进行评分(定义见“预训练质量度量”),并检验该指标是否能预测机器人任务性能。 ## 测试内容 ### 模型设置 所有实验均使用**直接视频-动作模型**完成。DVA的核心是一个因果视频模型,在通用网络视频上进行预训练,并在特定任务的机器人视频上进行后训练。一个独立的动力学模型将其预测帧转换为机器人动作。 本文研究了影响网络视频预训练成本的两个关键量——视频模型参数数量和预训练计算量——的扩展如何影响机器人任务性能。动力学模型在一个更广泛的多机器人数据集上训练一次,并在所有实验中与任务、后训练流程和评估协议保持固定。所有模型也以相同的推理频率运行。 图2:DVA训练与评估流程 **图2。***我们的训练与评估流程。第一阶段在通用网络视频上预训练视频模型,第二阶段在轴承拆包任务的机器人演示数据上进行后训练。评估时,后训练模型根据机器人视野预测未来帧,独立的动力学模型将其转换为动作,循环往复。本文所有评估均使用相同的动力学模型。变化的仅为预训练视频模型的规模和预训练计算量。实验2还变化了后训练数据量。* ### 预训练质量度量 语言模型领域的扩展研究表明,预训练损失随规模扩大可预测地降低,且下游任务性能与之相关。视频模型需要同类指标,在后训练之前、接触任务之前评估预训练检查点的质量。我们采用DINO FD。计算该指标时,我们使用模型训练时保留的网络视频片段,让模型基于前置帧预测后续内容,通过固定的DINOv2编码器嵌入预测帧和真实帧,测量两个特征分布间的距离。指标值越低越好。保留的片段不含任何模型后续后训练的任务内容,且评分成本足够低,可在整个预训练过程中持续记录。详细计算方法见附录F。本文所有策略均标注了其后训练所用预训练检查点的DINO FD值。 ### 真实工业任务 我们研究在**对应真实世界客户用例的复杂操作任务**上的预训练扩展效果。代表性案例是*工业拆包*:从纸箱、板条箱和袋子中取出产品、原材料或零件。我们从客户处采用的一个具体任务是拆分轴承并分类包装废料。本文所有机器人评估均基于该任务进行,视频展示了具体任务过程。 除作为真实用例外,工业拆包任务还具备以下适合评估的特性: **任务周期长。** 完整任务需要数十次独立操作,即使专家操作机器人也需一分钟以上。由于周期较长,前期错误会传播至后续子任务。例如,任务初期错误旋转纸箱会使后续操作更加困难。 **所需动作复杂,要求精度与灵巧性兼具。** 抓取扁平薄带、旋转纸箱、打开纸箱和袋子、从轴承包装中取出纸张等操作均超出简单拾取放置的范畴。 **后训练数据质量高。** 几乎所有轨迹均由经验丰富的机器人操作员在研究人员观察下采集,并刻意覆盖边缘情况和失败恢复行为。如果演示编码了不良策略,拟合度更高的模型可能表现*更差*,这将违背本研究初衷。 ### 试验评分标准 在真实部署中,我们至少需要跟踪两项指标: 1. **完成度。** 是否*全部*达成目标(例如物品已拆包*且*废料正确分类),无需人工干预? 2. **循环时间。** 处理一个包裹需要多长时间? 因此我们报告**实时完成率**:机器人完成且在时限内完成的试验比例。本文中*任务性能*即指该数字。试验只有在任务所有目标达成且无人工干预时才计为*完成*。对于轴承拆包,这意味着轴承被倒入正确的料箱,无轴承遗失,且所有包装废料分拣至正确容器。试验只有在循环时间低于100秒时才计为*实时*,我们设定该阈值是为了区分模型性能而非使其饱和。未满足完成标准或速度标准的试验均计为失败。 我们发现实时完成率比平均循环时间或简单完成率更具区分度。平均循环时间易受少数灾难性试验主导,而简单完成率在后训练数据包含良好失败恢复行为时会掩盖差异(因策略会重试直至成功)。 为进行更细粒度分析,我们在任务自然停顿处分割为任务框中列出的六个子任务,采用相同方式和各自时限对每个子任务进行评分。标记†的两个子任务仅适用于部分纸箱,因此子任务评分数据仅报告其余四个。 ### 选择评估检查点 同一后训练运行的不同检查点在任务性能上可能存在显著差异。在M规模模型的一次运行中,两个检查点的实时完成率相差28个百分点(图12),其他研究也报告了类似差异。因此选择哪个检查点进行评估是经过深思熟虑的。通常,验证损失是较差的检查点选择指标。他人研究发现其与真实机器人成功率相关性弱或无关,我们的实验也证实了这一点。因此我们在后训练期间跟踪替代指标,且该指标无需机器人试验。我们在机器人上评估替代指标最低的检查点。当替代指标在多个检查点上平稳或波动时,我们对这些检查点均进行机器人评估并报告最佳结果。附录D展示了图12中的该次运行,包含五个评估检查点在两种指标上的对比。 ### 评估执行方式 以下结果中的每个数据均在以下条件下产生: - 总计超过200小时的真实机器人评估,每个策略进行数百次试验。 - 每个评估会话遵循相同的标准操作程序,从硬件校准、物品准备到评分和干预规则,并以预检清单开始。 - 评估员在首次正式试验前完成认证,并在研究人员监督下完成练习试验。 - 每次试验均被记录,可供事后复核。 - 由评估员标记和统计异常的试验会根据记录进行审核。排除决定基于试验设置方式,而非结果。 附录A提供了完整协议和试验计数规则。 ### 图表解读方式 许多已发表的机器人操作研究仅基于每个实验设置数十次试验。我们对每个策略进行数百次试验,并采用丰田研究所《大型行为模型》论文的方式展示结果:用小提琴图表示真实实时完成率的分布,柱状条表示观测率,字母标注数据可区分的策略组。图3以本研究中的三个真实策略为例演示图表元素。附录B提供统计细节。 图3:小提琴图解读示例 **图3。***本文小提琴图的解读方法,以研究中的三个真实策略为例。每个小提琴图表示在n次试验中达成k次实时完成后,策略真实实时完成率的Beta(k+1, n−k+1)后验分布,绘制其99.75%可信区间。柱状条为观测率k/n,标签标注该比率和n。字母为通过配对双侧Fisher精确检验(图内进行Holm校正)得出的显著性分组:无共同字母的策略在95%置信水平上存在差异。共享字母的策略在该水平上无显著差异,但这不等同于性能相同。* ## 结果1:更大模型性能更优 我们首先研究模型规模。我们使用相同配方预训练了四个规模递增的模型(XS、S、M、L),每个模型在足够大的数据集上训练至收敛。基于我们内部的扩展定律分析,四个模型的训练均超过其计算最优点。以这种方式过度训练小模型也符合现代实践——训练小模型远超计算最优以降低推理成本。完整的预训练设置见附录C。每个模型随后在相同的轴承拆包数据集上进行后训练,检查点选择如“选择评估检查点”所述。 图4:任务性能 **图4。***四个视频模型(XS、S、M、L)使用相同配方预训练,并在完整演示集上分别进行一次后训练。小提琴图为真实比率的后验分布。无共同字母的策略在95%置信水平上存在差异(图3解释)。* 横向滚动查看其余面板。 **图5。***图4中四个策略在四个必要子任务上的评分,每个子任务采用各自时限。每个子任务独立评分...*

相似文章