AnchorWorld: 具身自我中心世界模拟与基于视角的演化定制
摘要
AnchorWorld是一个用于自我中心世界模拟的框架,通过3D人体运动和锚点视角定义增强了交互完整性并实现了灵活的世界定制,性能优于最先进的基线。
查看缓存全文
缓存时间: 2026/06/08 07:14
论文页面 - AnchorWorld: 基于视角演化定制的情境化自我中心世界模拟
来源:https://huggingface.co/papers/2606.07326
摘要
AnchorWorld 通过增强交互完整性,并利用 3D 人体运动和锚点视角定义实现灵活的世界定制,推进了自我中心模拟的发展。
尽管交互式世界建模是一个关键前沿,但在实际场景所需的灵活可控性方面仍探索不足。为填补这一空白,我们提出 AnchorWorld 框架,通过增强交互完整性以及一种灵活的世界定制机制,推动自我中心模拟(https://huggingface.co/papers?q=egocentric%20simulation)的进步。首先,我们采用 3D 人体运动(https://huggingface.co/papers?q=3D%20human%20motion)作为主要交互模态。为补充自我中心视角中视线外或被截断的身体部位,我们引入一种辅助训练监督(https://huggingface.co/papers?q=auxiliary%20training%20supervision),它融合了与智能体第一人称感知解耦的外源视角(https://huggingface.co/papers?q=exogenous%20viewpoints)。这使得模型能够观察智能体相对于环境的全身定位,从而促进人-世界交互中更稳健的空间接地(https://huggingface.co/papers?q=spatial%20grounding)。此外,我们提出一种简单而有效的机制用于定制自我演化世界(https://huggingface.co/papers?q=self-evolving%20worlds)。这是通过在统一的世界坐标系(https://huggingface.co/papers?q=world%20coordinate%20system)中定义锚点视角(https://huggingface.co/papers?q=anchor%20views),并结合描述局部场景动态演化(https://huggingface.co/papers?q=dynamic%20evolution)的文本描述(https://huggingface.co/papers?q=textual%20descriptions)来实现的。实验结果表明,AnchorWorld 显著优于现有最先进基线,而消融研究验证了我们关键设计的有效性。值得注意的是,我们的定制方案展现出具有前景的时空几何一致性,并严格遵守规定的演化动力学。
查看 arXiv 页面(https://arxiv.org/abs/2606.07326)查看 PDF(https://arxiv.org/pdf/2606.07326)项目页面(https://yuli0103.github.io/AnchorWorld/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.07326)
将这篇论文放入你的智能体:
hf papers read 2606\.07326
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
尚无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.07326 以从本页链接。
引用此论文的数据集0
尚无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.07326 以从本页链接。
引用此论文的 Spaces0
尚无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.07326 以从本页链接。
包含此论文的收藏集0
尚无收藏集包含此论文
添加此论文到收藏集(https://huggingface.co/new-collection)以从本页链接。
相似文章
WorldAct: 将单体3D世界激活为可交互的以对象为中心的场景
WorldAct是一个框架,利用多模态智能体和几何重建技术,将静态的3D生成环境转换为可编辑、可交互的以对象为中心的场景,支持对象级编辑和具身任务执行。
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
WorldCraft:从相机导航到交互式视频世界模型中的物体操控
WorldCraft扩展了交互式视频世界模型,通过专门的控制流水线,在保持相机导航能力的同时实现物体级别的轨迹控制。
EvolvingWorld:一种用于互动文学世界中角色扮演智能体与世界模型共同演化的开放模式框架
介绍EvolvingWorld,这是一个用于互动文学世界中角色扮演智能体与世界模型共同演化的开放模式框架与基准,支持具有持久角色和世界状态更新的长时程模拟。
世界行动模型:具身智能的下一个前沿
本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。