Chat-Edit-3D++: 通过大语言模型实现交互式3D和4D场景编辑

Hugging Face Daily Papers 论文

摘要

CE3D++ 通过哈希图集网络将2D编辑与3D重建解耦,并利用大语言模型自主调用视觉工具,实现了灵活的对话驱动式3D和4D场景编辑。

近年来,基于视觉-语言预训练模型的图像内容操作研究已有效扩展到文本驱动的3D场景编辑。然而,现有的3D场景编辑方案仍存在一些不足,阻碍了其作为交互式设计工具的进一步发展。此类方案通常遵循固定的输入模式,限制了文本输入的灵活性。此外,其编辑能力受限于单一或少数2D视觉模型,并且需要复杂的流程设计将这些模型集成到3D重建过程中。为解决上述问题,我们提出了哈希图集网络,该网络将3D场景编辑重新定义为对2D图集图像的操作,从而实现了2D编辑与3D重建过程的工作流解耦。在此基础上,我们引入了一种基于对话的3D场景编辑方法,称为CE3D++,该方法以大语言模型(LLM)为核心,允许用户输入任意文本并解释其意图,随后促进相应视觉模型的自主调用。此外,我们通过施加运动约束将CE3D++扩展到单目4D场景,并通过创建与编辑任务相关的轨迹数据集对LLM进行进一步微调,使较小的LLM能够准确调度多达30种不同的视觉工具。实验结果表明,CE3D++有效集成了多个视觉模型,实现了多样化的视觉编辑效果,具有强大的场景理解和多轮对话能力。源代码和训练模型可在 https://github.com/Fangkang515/CE3D 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:42

论文页面 - Chat-Edit-3D++:通过大语言模型实现交互式3D与4D场景编辑

来源:https://huggingface.co/papers/2608.29137

摘要

CE3D++ 通过哈希图谱网络将二维编辑与三维重建解耦,并利用大语言模型自主调用视觉工具,实现了灵活的对话驱动式三维与四维场景编辑。

基于视觉-语言预训练模型的图像内容操控相关研究,已成功拓展至文本驱动的三维场景编辑领域。然而,现有的三维场景编辑方案仍存在某些不足,阻碍了其作为交互式设计工具的进一步发展。这些方案通常遵循固定的输入模式,限制了文本输入的灵活性。此外,其编辑能力受限于单一或少数几个二维视觉模型,并且需要复杂的流程设计才能将这些模型整合到三维重建过程中。为解决上述问题,我们提出了哈希图谱网络,将三维场景编辑重构为对二维图谱图像的操作,从而实现了二维编辑与三维重建流程的工作流解耦。在此基础上,我们引入了一种基于对话的三维场景编辑方法——CE3D++,其核心是一个大语言模型,允许用户进行任意文本输入并理解其意图,进而促进相应视觉模型的自主调用。此外,我们通过为运动物体施加运动约束,并进一步通过创建与编辑任务相关的轨迹数据集来微调大语言模型,将CE3D++扩展至单目四维场景,这使得较小的语言模型也能准确调度多达30种不同的视觉工具。实验结果表明,CE3D++能有效整合多种视觉模型以实现多样化的视觉编辑效果,具备强大的场景理解能力和多轮对话能力。源代码与训练好的模型可在 https://github.com/Fangkang515/CE3D 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.29137) 查看 PDF (https://arxiv.org/pdf/2608.29137) 项目主页 (https://sk-fun.fun/CE3D/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.29137)

在您的代理中获取此论文:

hf papers read 2608.29137

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2608.29137 以从此页面链接到它。

引用本文的数据集0

无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2608.29137 以从此页面链接到它。

引用本文的 Space0

无 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.29137 以从此页面链接到它。

包含本文的收藏0

无收藏包含本文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到它。

相似文章

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。

Procedura: 代理式三维建模与程序化控制

Hugging Face Daily Papers

Procedura 引入了一个新颖的三维建模代理,它使用 LLMs 从文本提示创建可编辑的、部件结构化的组件,在质量和可编辑性方面优于现有方法。