RxBrain:具有联合语言-视觉推理与想象力的具身认知基础模型

Hugging Face Daily Papers 论文

摘要

RxBrain是一个具身认知基础模型,它通过语言和视觉想象联合推理来表征具身规划,采用统一的多模态混合Transformer架构。无需大规模动作数据即可在真实机器人上取得良好表现。

具身认知要求智能体将高层任务推理与待实现的物理状态相连接。我们提出了Hy-Embodied-RxBrain,一个具有联合语言-视觉推理与想象力的具身认知基础模型。与强调场景理解和文本决策的视觉语言模型,或主要预测未来视觉状态的生成式世界模型不同,RxBrain在单个规划序列中表征具身规划,其中语言和视觉想象扮演互补角色。语言提供规划的抽象结构,包括任务分解、规划原语、约束、时间顺序和决策逻辑;而视觉想象则通过世界状态预测和联合子目标规划来夯实该结构,将每个规划步骤与中间和最终物理状态相关联。RxBrain采用统一的多模态混合Transformer架构,支持在一个模型内进行语言、图像和视频的理解与生成。为训练这一能力,我们构建了一个自动流水线,通过将视频分解为规划步骤并使其与视觉状态转换对齐,将具身视频转换为联合文本-视觉规划监督。我们进一步引入了RxBrain-Bench,用于评估模型是否能够通过联合文本与视觉组件(而非单独的理解或生成)来表征具身规划。实验表明,RxBrain保持了具身理解与生成能力,并产生具有耦合文本推理、世界状态预测和联合子目标规划的规划方案。我们还将RxBrain扩展到连续机器人动作生成,无需大规模动作数据预训练即可在真实机器人上取得良好表现。这些结果为迈向具身认知基础模型迈出了第一步。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:41

论文页面 - RxBrain:联合语言-视觉推理与想象的具身认知基础模型

来源:https://huggingface.co/papers/2607.14187 作者:

摘要

具身认知要求智能体将高层任务推理与待达成的物理状态相连接。我们提出Hy-Embodied-RxBrain,一个具有联合语言-视觉推理与想象能力的具身认知基础模型。与强调场景理解和文本决策的视觉语言模型,或主要预测未来视觉状态的生成式世界模型不同,RxBrain将具身规划表示为单个规划序列,其中语言和视觉想象发挥互补作用。语言提供规划的抽象结构,包括任务分解、规划原语、约束、时序顺序和决策逻辑,而视觉想象则通过世界状态预测和联合子目标规划将该结构具象化,将每个规划步骤与中间和最终物理状态关联起来。RxBrain采用统一的混合Transformer多模态架构,支持在单一模型内进行语言、图像和视频的理解与生成。为训练该能力,我们构建了一条自动化流水线,通过将视频分解为规划步骤并将其与视觉状态转换对齐,将具身视频转换为联合文本-视觉规划监督。我们进一步引入RxBrain-Bench,以评估模型能否通过联合文本和视觉组件表示具身规划,而非分离的理解或生成任务。实验表明,RxBrain保持了具身理解和生成能力,并能生成包含耦合的文本推理、世界状态预测和联合子目标规划的规划。我们还将RxBrain扩展到连续机器人动作生成,在无需大规模动作数据预训练的情况下展示了有前景的真实机器人性能。这些结果为面向具身认知的基础模型迈出了初步一步。

查看arXiv页面 (https://arxiv.org/abs/2607.14187) 查看PDF (https://arxiv.org/pdf/2607.14187) 项目页面 (https://tairos.tencent.com/openSourceModels/hy-embodied-rxbrain-1.0) GitHub90 (https://github.com/Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14187)

引用本论文的模型1

tencent/Hy-Embodied-RxBrain-1.0 Any-to-Any • 6B • 更新于2天前 • 174 • 42 (https://huggingface.co/tencent/Hy-Embodied-RxBrain-1.0)

引用本论文的数据集0

没有数据集链接本论文

在数据集README.md中引用 arxiv.org/abs/2607.14187 以从此页面链接。

引用本论文的空间2

包含本论文的集合0

没有集合包含本论文

添加本论文到一个集合 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face

Reddit r/LocalLLaMA

腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。

Embodied-R1.5: 通过具身基础模型进化物理智能

Hugging Face Daily Papers

Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。

PhysBrain 1.0 技术报告

Hugging Face Daily Papers

PhysBrain 1.0 是一份技术报告,提出了一种利用人类自我中心视频为视觉-语言-动作模型生成物理常识监督的方法,在ERQA、PhysBench、SimplerEnv-WidowX、LIBERO和RoboCasa等具身控制基准上取得了最先进的结果。

将交错多模态推理桥接为统一决策过程

arXiv cs.AI

BRAID是一个框架,它将交错文本-图像-文本推理形式化为统一的马尔可夫决策过程,通过强化学习实现文本和视觉生成的联合优化,并由VLM裁判提供密集的轮次级反馈。