scene-generation

标签

Cards List
#scene-generation

SceneMosaic:通过混合代理布局演化实现高效多样的仿真就绪场景生成

Hugging Face Daily Papers · 2026-09-04 缓存

SceneMosaic结合了学习的图像先验与视觉语言代理,高效生成多样且物理有效的室内场景,相较于现有方法实现了24倍加速和物理有效性的提升。

0 人收藏 0 人点赞
#scene-generation

AI代理创建虚拟游乐场,帮助机器人获取关键训练数据

MIT News — Artificial Intelligence · 2026-07-13 缓存

MIT CSAIL与丰田研究所推出SceneSmith,该系统利用GPT-5.2驱动的AI代理自动生成丰富的3D虚拟场景,为机器人训练提供多样化的模拟环境,无需大量真实世界测试。

0 人收藏 0 人点赞
#scene-generation

Xiaomi-Robotics-U0: 基于世界基础模型的统一具身合成

Hugging Face Daily Papers · 2026-07-13 缓存

小米机器人推出U0,这是一个380亿参数的多模态自回归模型,用于统一具身合成,将具身生成视为图像和视频生成的扩展。它在多个具身任务上取得了最先进的结果,超越了GPT-Image-2.0,并提高了真实世界操作的成功率。

0 人收藏 0 人点赞
#scene-generation

MAGIC:基于大语言模型的可导航多场景游戏世界的过渡感知生成

Hugging Face Daily Papers · 2026-07-13 缓存

MAGIC是一个系统,利用大语言模型从单个自然语言提示生成相互连接且可导航的多场景游戏世界,解决了跨场景一致性、场景内可导航性及过渡评估问题。在包含100个多场景案例的基准测试中,该系统实现了高精确率和召回率。

0 人收藏 0 人点赞
#scene-generation

SynCity 3000: 自举场景级3D扩散

Hugging Face Daily Papers · 2026-07-06 缓存

SynCity 3000 提出了一种框架,用于生成大规模、全局一致的3D场景,该框架通过将图像到3D生成器适配为卷积算子,并在来自新数据引擎的合成场景数据上进行微调来实现。

0 人收藏 0 人点赞
#scene-generation

SimFoundry:模块化与自动化场景生成用于策略学习与评估

Hugging Face Daily Papers · 2026-06-26 缓存

SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。

0 人收藏 0 人点赞
#scene-generation

从视频扩散潜变量生成三角片元(5分钟阅读)

TLDR AI · 2026-06-25 缓存

FLAT 是一种方法,能够直接从压缩的视频扩散潜变量中,通过单次前向传递解码出显式的三角片元,从而提升几何精度,同时支持快速光栅化和基于物理的交互。

0 人收藏 0 人点赞
#scene-generation

FLAT: 面向几何精确场景生成的前馈潜在三角形溅射

Hugging Face Daily Papers · 2026-06-23 缓存

FLAT提出了一种方法,直接从视频扩散潜在表示中解码显式三角形溅射,用于几何精确的3D场景生成。它引入了以射线为中心的旋转参数化和乘积窗口函数来改善梯度流,实现了比先前前馈方法更好的几何精度,同时支持实时渲染。

0 人收藏 0 人点赞
#scene-generation

Sat3DGen:基于单张卫星图像的全面街景级3D场景生成

Hugging Face Daily Papers · 2026-05-14 缓存

Sat3DGen采用几何优先的方法,从单张卫星图像生成街景级3D场景,通过新颖的约束条件和训练策略,提高了几何精度和照片级真实感。该方法在VIGOR-OOD基准测试上相比先前工作有显著改进。

0 人收藏 0 人点赞
#scene-generation

HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型

Hugging Face Daily Papers · 2026-04-15 缓存

HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。

0 人收藏 0 人点赞
#scene-generation

MetaSpatial:强化VLMs在元宇宙中的3D空间推理

Papers with Code Trending · 2025-03-24 缓存

MetaSpatial是一个强化学习框架,旨在增强视觉语言模型(VLMs)的3D空间推理能力,能够生成连贯且物理上合理的3D场景,无需硬编码优化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈