GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
摘要
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
查看缓存全文
缓存时间: 2026/07/07 06:42
论文页面 - GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
来源:https://huggingface.co/papers/2607.02642
发布于 7 月 2 日
#3 今日论文 (https://huggingface.co/papers/date/2026-07-07)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们通过一个新的基准对用于机器人策略评估的世界模型进行了系统研究,结果表明:对于可靠的策略评估而言,长时域推演的一致性和机器人特有的可控性比短期视觉逼真度更为重要。
评估具身机器人基础模型仍然是一个关键瓶颈;与可通过数字基准高效评估的大语言模型不同,机器人策略 (https://huggingface.co/papers?q=robotic%20policies) 需要缓慢且昂贵的现实世界推演,受限于硬件和人工监督,这促使研究者对作为替代策略评估器的世界模型 (https://huggingface.co/papers?q=world%20models) 产生兴趣,然而,使世界模型可靠用于策略评估的关键特性仍未被充分理解。本文对用于机器人策略评估 (https://huggingface.co/papers?q=policy%20evaluation) 的世界模型 (https://huggingface.co/papers?q=world%20models) 进行了系统研究,并提出了 WMBench 基准,该基准由真实机器人遥操作 (https://huggingface.co/papers?q=real-robot%20teleoperation) 数据和匹配的策略推演数据构建而成,涵盖了多种操作任务,以实现对模型系列、动作编码、推演时域 (https://huggingface.co/papers?q=rollout%20horizons) 和评估指标的受控比较。利用 WMBench,我们分析了 7 个视频世界模型 (https://huggingface.co/papers?q=video%20world%20models)、4 种动作表示方案 (https://huggingface.co/papers?q=action%20representation%20schemes) 以及超过 324,000 次模拟策略推演(与真实机器人执行相匹配),并进一步通过来自 CVPR 2026 GigaBrain Challenge 的大规模社区提交、精心策划的合成轨迹以及超过 12,000 小时的训练视频丰富了我们的分析。我们的实验揭示了三个核心见解:评估器质量主要取决于长时域、动作保真度高的推演一致性,而非短期视觉逼真度;预训练的增益不仅来自数据规模,还来自通用世界知识与机器人特有可控性之间的平衡;架构选择(包括动作编码、记忆设计和以评估器为重点的后训练)强烈决定了与现实世界机器人行为 (https://huggingface.co/papers?q=real-world%20robot%20behavior) 的对齐程度。基于这些结果,我们总结出一条实用的设计路线图,并实现了 GigaWorld-1 (https://huggingface.co/papers?q=GigaWorld-1),一个专门针对策略评估 (https://huggingface.co/papers?q=policy%20evaluation) 优化的世界模型。我们完全开源了代码、模型、数据集和工具包,以推动具身基础模型的可扩展评估研究。
查看 arXiv 页面 (https://arxiv.org/abs/2607.02642)
查看 PDF (https://arxiv.org/pdf/2607.02642)
项目页面 (https://open-gigaai.github.io/giga-world-1/)
GitHub118 (https://github.com/open-gigaai/giga-world-1)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02642)
在你的 agent 中获取本文:
hf papers read 2607\.02642
没有最新的 CLI?
curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.02642 即可从本页面链接。
引用本文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.02642 即可从本页面链接。
引用本文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.02642 即可从本页面链接。
包含本文的收藏 0
没有收藏包含此论文
将本文添加到收藏 (https://huggingface.co/new-collection) 即可从本页面链接。
相似文章
机器人学习中的世界模型:全面综述
本综述全面回顾了机器人学习中世界模型的文献,涵盖其在策略学习、规划和模拟中的作用。文章突出了预测建模在具身智能体中的关键范式、基准测试及未来发展方向。
世界模型的定义与路线图
这篇学术论文提供了世界模型的科学定义,讨论了关键技术方面,并提出了一个分阶段路线图,用于在人工智能子领域(如基于模型的强化学习、视频生成和具身机器人)中开发有效的世界模型。
GigaWorld-Policy-0.5:由AutoResearch赋能的更快更强的WAM
GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。
世界模型应如何评估?一种以决策为中心的立场
本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。
用于机器人操作的 World Value Models
本文提出了World Value Model (WVM),一种通用机器人价值模型,它将世界模型与价值估计相结合,以准确评估任务进展,并从混合质量数据中改进机器人策略学习,在标准基准和新的次优数据基准上取得了最先进的结果。