τ_0-VLA:基于世界模型引导的测试时计算的分层机器人基础模型

Hugging Face Daily Papers 论文

摘要

分层视觉-语言-动作模型通过世界模型引导的测试时搜索扩展计算,用于高级子任务决策,从而提升长期机器人操作的性能。

长期机器人操作要求机器人既能可靠地执行单个技能,又能在扩展任务中连贯地排序它们。大多数分层视觉-语言-动作(VLA)模型通过单次前向传播做出每个此类决策,没有机制为困难或重要的选择分配额外计算。我们引入τ_0-VLA,一种分层机器人基础模型,它通过世界模型引导的测试时计算,将高级子任务生成表述为一个计算可扩展的推理问题。在每个推理步骤中,高级策略使用执行记忆生成子任务,并在需要时搜索备选方案,然后才确定输出。然后,低级策略在多个机器人实体上执行生成的子任务。该策略在40,115小时的异构真实世界数据上训练,采用多模态联合训练。在域内和分布偏移设置中,分配额外的测试时计算显著提高了下一个子任务预测的准确性,这些收益转化为长期机器人操作任务中更高的闭环成功率。
查看原文
查看缓存全文

缓存时间: 2026/08/21 16:10

论文页面 - τ_0-VLA:一种基于世界模型引导的测试时计算分层机器人基础模型

来源:https://huggingface.co/papers/2608.16885 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

一种分层的视觉-语言-动作模型,通过使用世界模型引导的测试时搜索,为高层子任务决策扩展计算,从而改善长程机器人操作。

长程机器人操作要求机器人既能可靠地执行单个技能,又能在扩展的任务中连贯地将它们排序。大多数分层视觉-语言-动作(https://huggingface.co/papers?q=vision-language-action)(VLA)模型通过单次前向传递做出每个此类决策,没有为困难或关键的选择分配额外计算的机制。我们介绍了 τ_0-VLA,一个分层的机器人基础模型,它通过世界模型引导的测试时计算(https://huggingface.co/papers?q=world-model-guided%20test-time%20computation),将高层子任务生成(https://huggingface.co/papers?q=subtask%20generation)制定为一个可扩展计算的推理问题。在每个推理步骤中,高层策略使用执行记忆(https://huggingface.co/papers?q=execution%20memory)生成一个子任务,并在需要时,搜索备选方案,然后才确定输出。然后,一个底层策略(https://huggingface.co/papers?q=low-level%20policy)在多个机器人实体上执行生成的子任务。该策略在 40,115 小时的异构真实世界数据上使用多模态联合训练(https://huggingface.co/papers?q=multimodal%20co-training)进行训练。在域内和分布偏移的设置中,分配额外的测试时计算显著提高了下一个子任务预测的准确性,这些收益转化为长程机器人操作任务中更高的闭环成功率。

查看 arXiv 页面 (https://arxiv.org/abs/2608.16885)查看 PDF (https://arxiv.org/pdf/2608.16885)项目页面 (https://tau0-vla.github.io/)GitHub (https://github.com/sii-research/tau-0-vla)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16885)

将此论文获取到您的智能体:

hf papers read 2608\.16885

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

sii-research/tau-0-vla 机器人• 3B• 更新于3天前 • 196 • 3 (https://huggingface.co/sii-research/tau-0-vla)

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.16885 以从此页面链接。

引用此论文的空间0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.16885 以从此页面链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

HiVLA: 一种以视觉接地为中心的分层具身操作系统

Hugging Face Daily Papers

HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。