SPARGen: 通过原生多模态生成统一空间感知与推理
摘要
SPARGen引入了一个统一的多模态框架,将3D重建、稠密对应和空间推理视为指令条件生成任务,从而实现共享空间表示。
查看缓存全文
缓存时间: 2026/08/17 03:45
论文页面 - SPARGen:通过原生多模态生成统一空间感知与推理
来源:https://huggingface.co/papers/2608.14138
摘要
SPARGen 将三维重建、稠密对应和空间推理统一到一个单一的、由指令条件化的多模态生成模型中,该模型联合学习共享的空间表征。
从视觉观测中进行空间感知与推理,需要恢复几何结构、建立对应关系并理解空间关系。现有方法通常采用针对特定任务的架构或外部几何模块分别处理这些能力,这限制了同一物理场景互补表征之间的知识迁移。我们提出了 SPARGen,这是一个统一的多模态框架(https://huggingface.co/papers?q=multimodal%20framework),它将三维重建(https://huggingface.co/papers?q=3D%20reconstruction)、稠密对应(https://huggingface.co/papers?q=dense%20correspondence)和空间推理(https://huggingface.co/papers?q=spatial%20reasoning)视为由指令条件化的生成(https://huggingface.co/papers?q=instruction-conditioned%20generation)任务。SPARGen 将紧凑的结构化和语言输出序列化为词元序列(https://huggingface.co/papers?q=token%20sequences),同时以图像对齐的形式生成稠密几何场(https://huggingface.co/papers?q=geometric%20fields),使得空间监督(https://huggingface.co/papers?q=spatial%20supervision)能够在原生多模态生成模型(https://huggingface.co/papers?q=native%20multimodal%20generative%20model)内共同塑造共享表征。在三维重建(https://huggingface.co/papers?q=3D%20reconstruction)、对应关系和空间推理(https://huggingface.co/papers?q=spatial%20reasoning)的基准测试实验表明,SPARGen 在单一的原生多模态生成框架内,在异构空间任务上取得了有竞争力的性能。
查看 arXiv 页面 (https://arxiv.org/abs/2608.14138) 查看 PDF (https://arxiv.org/pdf/2608.14138) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14138)
获取此论文到您的代理:
hf papers read 2608\.14138
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.14138 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.14138 以从此页面链接它。
引用此论文的空间 0
没有空间链接此论文
在空间的 README.md 中引用 arxiv.org/abs/2608.14138 以从此页面链接它。
包含此论文的收藏夹 0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
展示而非讲述:在生成像素而非LLM文本中评估空间认知
提出了ProVisE,一个与基准无关的框架,用于利用像素空间输出评估图像生成模型的空间认知,并引入了SpatialGen-Bench,用于跨14个空间子任务的统一评估。
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
推理,然后重新推理:跨视角回顾提升空间推理
一种无需训练的空间推理框架,它利用由预测3D几何生成的合成新视角视频,实现对自我中心视频中结论的重新审视。
SpaR3D-MoE: 面向稀疏视图的自适应3D空间推理与几何归纳混合专家模型
介绍SpaR3D-MoE,这是一个端到端框架,用于从稀疏RGB视图中进行自适应3D空间推理,利用流形采样和几何归纳混合专家,在VSI-Bench、ScanQA和SQA3D上取得了最先进的性能。
将3D建模与空间推理解耦
本文提出DiSR,一个将3D感知与推理分离的框架,利用现成的感知模型重建显式3D证据,并通过LoRA微调LLM进行空间推理,在提升可解释性和效率的同时取得了具有竞争力的性能。