RynnBrain 1.1:迈向更强大、更具泛化能力的具身基础模型
摘要
RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - RynnBrain 1.1:迈向更具能力与通用性的具身基础模型
来源:https://huggingface.co/papers/2607.17977 发布于 7 月 20 日
#3 当日论文 (https://huggingface.co/papers/date/2026-07-21) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们提出 RynnBrain 1.1,一个覆盖 2B、9B 和 122B-A10B 规模的具身基础模型系列。通过统一时空与物理接地框架进行训练,RynnBrain 1.1 支持具身感知、空间推理、定位与规划。与 RynnBrain 1.0 相比,它在整个模型系列中进一步引入了接触点预测,并为 2B 和 9B 模型提供了原生 3D 接地能力,从而生成更直接对齐机器人操作的表征和输出。我们还开发了 RynnBrain-VLA,采用统一的跨本体动作空间和本体特定掩码,并将其部署在 Unitree G1、Astribot-S1 和 Tianji-Wuji 上。RynnBrain 1.1 在具身认知、定位和 3D 接地方面均取得了强劲结果,其中 122B-A10B 模型在 VSI-Bench、MMSI 和 RefSpatial-Bench 上超越了所有评估的专有和开源模型。真实机器人实验表明,由 RynnBrain 初始化的策略优于基于 Qwen 及代表性通用 VLA,而联合多任务和多本体训练在过程得分与成功率上均优于按任务单独训练。
查看 arXiv 页面 (https://arxiv.org/abs/2607.17977)查看 PDF (https://arxiv.org/pdf/2607.17977)项目页面 (https://alibaba-damo-academy.github.io/RynnBrain/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17977)
在你的智能体中获取这篇论文:
hf papers read 2607.17977
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.17977 以在此页面建立链接。
引用本文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.17977 以在此页面建立链接。
引用本文的 Spaces0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.17977 以在此页面建立链接。
包含本文的收藏集0
没有收藏集包含此论文
请将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 中以在此页面建立链接。
相似文章
Embodied-R1.5: 通过具身基础模型进化物理智能
Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。
RxBrain:具有联合语言-视觉推理与想象力的具身认知基础模型
RxBrain是一个具身认知基础模型,它通过语言和视觉想象联合推理来表征具身规划,采用统一的多模态混合Transformer架构。无需大规模动作数据即可在真实机器人上取得良好表现。
tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face
腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。
GigaBrain-0.7:通过三系统架构将具身基础模型扩展至涌现能力
GigaBrain-0.7是一个具身基础模型,采用三系统架构和大规模异构预训练,以提升跨多样机器人具身的泛化能力,实现增强的零样本能力和任务成功率。
RynnWorld-4D: 面向机器人操作的4D具身世界模型
RynnWorld-4D是一个生成式世界模型,它通过统一的扩散过程,从单张RGB-D图像和语言指令中联合生成未来的RGB、深度和光流,通过逆动力学策略学习实现高效的机器人操作。该模型在真实世界的双手操作任务上达到了最先进水平。