可操作的世界表示
摘要
WorldString是一种神经架构,能够从点云或RGB-D视频流中建模物体状态流形,作为物理世界模型的基础组件,其可微结构便于与策略学习集成。
查看缓存全文
缓存时间: 2026/05/19 06:30
论文页面 - 可操作世界表示
来源:https://huggingface.co/papers/2605.18743
摘要
WorldString 是一种从点云或 RGB-D 视频流中建模对象状态流形的神经网络架构,作为具有可微结构、可集成策略学习的物理世界模型的基石。
受大型语言模型中涌现出的类人智能行为的启发,研究社区正在探索世界模型(https://huggingface.co/papers?q=world%20models)中类似的涌现能力,重点聚焦于物理世界的建模。在物理世界模型的范畴内,对象是构成物理现实的基本基元。从人类到计算机,我们几乎与之交互的一切都是对象。这些对象很少是静态的;它们是可操作的实体,其状态由其内在属性决定。虽然当前的方法通过视频生成或动态场景重建来处理对象动作状态,但没有任何方法以一种统一、有原则的方式显式建模这一基本元素,以构建可操作的对象表示(https://huggingface.co/papers?q=object%20representation)。我们提出 WorldString,一种神经网络架构(https://huggingface.co/papers?q=neural%20architecture),能够通过直接从点云(https://huggingface.co/papers?q=point%20clouds)或 RGB-D 视频流(https://huggingface.co/papers?q=RGB-D%20video%20streams)学习,对真实世界对象的状态流形(https://huggingface.co/papers?q=state%20manifold)进行建模。作为一种通用的数字孪生(https://huggingface.co/papers?q=digital%20twin),它作为物理世界模型(https://huggingface.co/papers?q=world%20models)的基础构建模块;因此我们将其命名为 WorldString。更妙的是,其完全可微的结构无缝地实现了与策略学习(https://huggingface.co/papers?q=policy%20learning)和神经动力学(https://huggingface.co/papers?q=neural%20dynamics)的未来集成。
查看 arXiv 页面(https://arxiv.org/abs/2605.18743)查看 PDF(https://arxiv.org/pdf/2605.18743)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.18743)
在你的代理中获取这篇论文:
hf papers read 2605\.18743
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2605.18743 即可从此页面链接。
引用该论文的数据集0
没有数据集链接到这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2605.18743 即可从此页面链接。
引用该论文的 Spaces0
没有 Space 链接到这篇论文
在 Space README.md 中引用 arxiv.org/abs/2605.18743 即可从此页面链接。
包含该论文的收藏集0
没有收藏集包含这篇论文
将这篇论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
通过物理交互涌现的世界模型语义表征,无需语言监督
本文表明,通过随机物理探索训练世界模型,能够在不依赖任何语言监督的情况下,使潜在表征编码出空间语义结构(方向和位置),突显物理几何作为组织原则。
WALL-WM:在事件节点上雕琢世界动作建模
WALL-WM 通过使用语义事件作为学习单元而非固定动作块,推进了视频-动作学习,实现了更灵活和可扩展的视觉-语言-动作训练与推理。
World-Language-Action模型:统一世界建模、语言推理与动作合成
本文介绍了World-Language-Action(WLA)模型,这是一种具身基础模型,能够从文本、图像和机器人状态中联合预测文本子任务、子目标图像和机器人动作,在模拟和真实环境中实现了最先进的多任务与长周期学习能力。