τ_0-VLA:基于世界模型引导的测试时计算的分层机器人基础模型
摘要
分层视觉-语言-动作模型通过世界模型引导的测试时搜索扩展计算,用于高级子任务决策,从而提升长期机器人操作的性能。
查看缓存全文
缓存时间: 2026/08/21 16:10
论文页面 - τ_0-VLA:一种基于世界模型引导的测试时计算分层机器人基础模型
来源:https://huggingface.co/papers/2608.16885 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一种分层的视觉-语言-动作模型,通过使用世界模型引导的测试时搜索,为高层子任务决策扩展计算,从而改善长程机器人操作。
长程机器人操作要求机器人既能可靠地执行单个技能,又能在扩展的任务中连贯地将它们排序。大多数分层视觉-语言-动作(https://huggingface.co/papers?q=vision-language-action)(VLA)模型通过单次前向传递做出每个此类决策,没有为困难或关键的选择分配额外计算的机制。我们介绍了 τ_0-VLA,一个分层的机器人基础模型,它通过世界模型引导的测试时计算(https://huggingface.co/papers?q=world-model-guided%20test-time%20computation),将高层子任务生成(https://huggingface.co/papers?q=subtask%20generation)制定为一个可扩展计算的推理问题。在每个推理步骤中,高层策略使用执行记忆(https://huggingface.co/papers?q=execution%20memory)生成一个子任务,并在需要时,搜索备选方案,然后才确定输出。然后,一个底层策略(https://huggingface.co/papers?q=low-level%20policy)在多个机器人实体上执行生成的子任务。该策略在 40,115 小时的异构真实世界数据上使用多模态联合训练(https://huggingface.co/papers?q=multimodal%20co-training)进行训练。在域内和分布偏移的设置中,分配额外的测试时计算显著提高了下一个子任务预测的准确性,这些收益转化为长程机器人操作任务中更高的闭环成功率。
查看 arXiv 页面 (https://arxiv.org/abs/2608.16885)查看 PDF (https://arxiv.org/pdf/2608.16885)项目页面 (https://tau0-vla.github.io/)GitHub (https://github.com/sii-research/tau-0-vla)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16885)
将此论文获取到您的智能体:
hf papers read 2608\.16885
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
sii-research/tau-0-vla 机器人• 3B• 更新于3天前 • 196 • 3 (https://huggingface.co/sii-research/tau-0-vla)
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.16885 以从此页面链接。
引用此论文的空间0
无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.16885 以从此页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
HiVLA: 一种以视觉接地为中心的分层具身操作系统
HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
Hy-Embodied-0.5-VLA: 从视觉-语言-动作模型到真实世界机器人学习栈
HyVLA-0.5 是一个端到端机器人学习系统,整合了数据收集、模型设计、预训练、微调和强化学习,用于真实世界部署。
InternVLA-A1.5: 统一理解、潜在预见与行动以实现组合泛化
InternVLA-A1.5 将预训练的视觉语言模型与潜在空间中的未来预测相结合,以实现具有组合泛化和长视界执行能力的高效机器人操作,在模拟基准测试中取得了最先进的结果。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。