Chat-Edit-3D++: 通过大语言模型实现交互式3D和4D场景编辑
摘要
CE3D++ 通过哈希图集网络将2D编辑与3D重建解耦,并利用大语言模型自主调用视觉工具,实现了灵活的对话驱动式3D和4D场景编辑。
查看缓存全文
缓存时间: 2026/09/01 11:42
论文页面 - Chat-Edit-3D++:通过大语言模型实现交互式3D与4D场景编辑
来源:https://huggingface.co/papers/2608.29137
摘要
CE3D++ 通过哈希图谱网络将二维编辑与三维重建解耦,并利用大语言模型自主调用视觉工具,实现了灵活的对话驱动式三维与四维场景编辑。
基于视觉-语言预训练模型的图像内容操控相关研究,已成功拓展至文本驱动的三维场景编辑领域。然而,现有的三维场景编辑方案仍存在某些不足,阻碍了其作为交互式设计工具的进一步发展。这些方案通常遵循固定的输入模式,限制了文本输入的灵活性。此外,其编辑能力受限于单一或少数几个二维视觉模型,并且需要复杂的流程设计才能将这些模型整合到三维重建过程中。为解决上述问题,我们提出了哈希图谱网络,将三维场景编辑重构为对二维图谱图像的操作,从而实现了二维编辑与三维重建流程的工作流解耦。在此基础上,我们引入了一种基于对话的三维场景编辑方法——CE3D++,其核心是一个大语言模型,允许用户进行任意文本输入并理解其意图,进而促进相应视觉模型的自主调用。此外,我们通过为运动物体施加运动约束,并进一步通过创建与编辑任务相关的轨迹数据集来微调大语言模型,将CE3D++扩展至单目四维场景,这使得较小的语言模型也能准确调度多达30种不同的视觉工具。实验结果表明,CE3D++能有效整合多种视觉模型以实现多样化的视觉编辑效果,具备强大的场景理解能力和多轮对话能力。源代码与训练好的模型可在 https://github.com/Fangkang515/CE3D 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.29137) 查看 PDF (https://arxiv.org/pdf/2608.29137) 项目主页 (https://sk-fun.fun/CE3D/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.29137)
在您的代理中获取此论文:
hf papers read 2608.29137
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
无模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2608.29137 以从此页面链接到它。
引用本文的数据集0
无数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2608.29137 以从此页面链接到它。
引用本文的 Space0
无 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.29137 以从此页面链接到它。
包含本文的收藏0
无收藏包含本文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
VGGT-Edit: 基于残差场预测的前馈原生3D场景编辑
VGGT-Edit 提出了一种基于深度同步文本注入和残差场预测的前馈框架,用于文本驱动的原生3D场景编辑,相较于2D提升方法,实现了更优的质量和效率。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。
CEAA:一种面向交互式计算系统的认知具身智能体架构
本文提出了CEAA,一种模块化的认知架构,用于具身智能虚拟代理,将高层推理模型与实时交互3D环境中的具身执行相结合。
Procedura: 代理式三维建模与程序化控制
Procedura 引入了一个新颖的三维建模代理,它使用 LLMs 从文本提示创建可编辑的、部件结构化的组件,在质量和可编辑性方面优于现有方法。
EVA01:通过混合变换器实现统一原生3D理解与生成
EVA01是一个统一框架,通过混合变换器架构将3D网格作为原生模态集成到多模态语言模型中,实现了先进的文本到3D生成以及长上下文多轮几何编辑。