GigaBrain-0.7:通过三系统架构将具身基础模型扩展至涌现能力
摘要
GigaBrain-0.7是一个具身基础模型,采用三系统架构和大规模异构预训练,以提升跨多样机器人具身的泛化能力,实现增强的零样本能力和任务成功率。
查看缓存全文
缓存时间: 2026/08/26 15:16
论文页面 - GigaBrain-0.7:通过三系统架构将具身基础模型扩展到涌现能力
来源:https://huggingface.co/papers/2608.15875 作者: 、 、 、 、 、 、 、 、 、 、 、 、 、 、 、 、 、 、 、 、 、 、
摘要
GigaBrain-0.7 是一种视觉-语言-动作模型,它通过三系统架构、大规模异构预训练和联合对齐训练来提升具身泛化能力。
视觉-语言-动作(VLA)模型已成为通用具身智能体的主流范式,在结构化环境中展现出强大的复杂及长时程任务完成能力。然而,当前的 VLA 系统能否从更有效的架构设计中受益、扩展到更大规模且更异构的数据集,并实现跨任务与跨具身形态的更广泛泛化,仍是一个开放问题。为此,我们提出了 GigaBrain-0.7,一个具有跨多样机器人具身形态显著提升泛化能力的具身基础模型(https://huggingface.co/papers?q=embodied%20foundation%20model)。具体而言,GigaBrain-0.7 通过三系统架构(https://huggingface.co/papers?q=three-system%20architecture)统一了理解、预测和行动,将预训练扩展到超过 37,000 小时的异构具身数据,并引入了单阶段对齐训练(https://huggingface.co/papers?q=one-stage%20alignment%20training),该训练联合优化视觉-语言理解和多具身形态动作生成(https://huggingface.co/papers?q=multi-embodiment%20action%20generation)。与先前的 GigaBrain-0 系列及包括 π_{0.5} 在内的最新先进模型相比,GigaBrain-0.7 在基础零样本能力(https://huggingface.co/papers?q=zero-shot%20capabilities)、语言条件指令遵循和训练后任务成功率方面实现了显著改进。特别是在我们自有的 Maker H01 平台及主流机器人具身形态上,GigaBrain-0.7 在家庭和工业场景中均展现了强大的任务适应性和完成能力。所有训练代码和预训练模型权重都将开源。
查看 arXiv 页面 (https://arxiv.org/abs/2608.15875) 查看 PDF (https://arxiv.org/pdf/2608.15875) 项目页面 (https://gigaai.cc/blog/gigabrain07) GitHub2.61k (https://github.com/open-gigaai/giga-brain-0) 添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15875)
在你的智能体中获取本文:
hf papers read 2608\.15875
尚未安装最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
open-gigaai/GigaBrain-0.7-3.5B-Base Robotics• 4B• 大约19小时前更新 • 165 • 8 (https://huggingface.co/open-gigaai/GigaBrain-0.7-3.5B-Base)
引用本文的数据集1
open-gigaai/GigaBrain-0.7-SampleData 查看器• 大约19小时前更新 • 120 • 64 • 4 (https://huggingface.co/datasets/open-gigaai/GigaBrain-0.7-SampleData)
引用本文的 Spaces1
包含本文的收藏集1
相似文章
RynnBrain 1.1:迈向更强大、更具泛化能力的具身基础模型
RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。
Embodied-R1.5: 通过具身基础模型进化物理智能
Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。
tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face
腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。
@himanshutwtxs: Garry Tan 的 GBrain 完整架构
Garry Tan 分享了 GBrain 的完整架构,这是一个 AI 模型。
tencent/HY-Embodied-0.5
腾讯发布了HY-Embodied-0.5,这是一套为具身AI智能体设计的基础模型套件,采用混合变换器(MoT)架构,提供高效的2B和强大的32B变体,用于真实世界的机器人控制和时空推理。