Embodied-R1.5: 通过具身基础模型进化物理智能
摘要
Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。
查看缓存全文
缓存时间: 2026/06/11 13:40
论文页面 - Embodied-R1.5:通过具身基础模型进化物理智能
来源:https://huggingface.co/papers/2606.11324 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Embodied-R1.5 是一个统一的具身基础模型,它整合了具身推理能力,并通过多任务平衡强化学习方法在具身视觉-语言基准测试中达到了最先进的性能。
我们提出了 Embodied-R1.5,这是一个统一的具身基础模型(EFM),它在单一架构中整合了全面的具身推理能力,涵盖具身认知、任务规划、修正和指代,旨在实现通用物理智能。借助三条自动化数据构建流水线来显著扩展关键能力的数据覆盖范围,我们构建了一个超过150亿 token 的大规模数据系统,并设计了一种多任务平衡的强化学习配方来缓解异构任务冲突。我们还引入了 Planner-Grounder-Corrector(PGC)闭环框架,使单个模型能够自主执行并自我修正长周期任务。仅凭80亿参数,Embodied-R1.5 在24个具身 VLM 基准测试中的16个上达到了 SOTA,超越了 Gemini-Robotics-ER-1.5 和 GPT-5.4 等领先模型。得益于内化的具身能力,Embodied-R1.5 可以通过少量数据微调为 VLA,在4个主流操作基准套件上优于 π_{0.5} 等领先 VLA 模型。我们进一步进行了广泛的零样本真实机器人实验,验证了指令跟随、可供性基础、铰接物体操作和长周期复杂任务方面的性能,展现出对物理世界的强大泛化能力。我们开源了模型权重、数据集、训练代码以及针对具身任务定制的评估框架 EmbodiedEvalKit,以促进 EFM 的未来研究。
查看 arXiv 页面 (https://arxiv.org/abs/2606.11324) 查看 PDF (https://arxiv.org/pdf/2606.11324) 项目页面 (https://embodied-r.github.io/) GitHub17 (https://github.com/pickxiguapi/Embodied-R1.5) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11324)
在您的 agent 中获取此论文:
hf papers read 2606\.11324
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.11324 以从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.11324 以从此页面链接。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.11324 以从此页面链接。
包含此论文的收藏集1
相似文章
RynnBrain 1.1:迈向更强大、更具泛化能力的具身基础模型
RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。
tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face
腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。
RxBrain:具有联合语言-视觉推理与想象力的具身认知基础模型
RxBrain是一个具身认知基础模型,它通过语言和视觉想象联合推理来表征具身规划,采用统一的多模态混合Transformer架构。无需大规模动作数据即可在真实机器人上取得良好表现。
Enfold:将世界模型想象折叠为预测表示,实现超高效具身控制
提出Enfold方法,将世界模型中的多层级未来生成状态转移到预测表示中,用于超高效具身控制,在LIBERO和RoboTwin基准测试中取得高分,并显著降低动作延迟。
Capek 0.5:面向具身智能的以执行为中心的视觉-语言模型
本文介绍了 Capek 0.5,一个以执行能力分类法为核心的具身视觉-语言模型,通过强化学习进行专家训练,随后采用权重空间融合和路由策略空间蒸馏。它提出了一个新的状态验证基准,并在2B和35B-A3B规模上展示了在具身和通用能力上的强劲性能。