Hallo4D: 多模态幻觉缓解实现一致时空生成

Hugging Face Daily Papers 论文

摘要

Hallo4D是一个模型无关框架,利用大型多模态语言模型检测和纠正3D与4D生成中的空间和时间幻觉,在无需重新训练的情况下改善跨视角和时间的一致性。

尽管近期3D生成领域的进展已能实现令人印象深刻的视觉合成,现有方法通常依赖2D扩散监督,缺乏明确的几何一致性机制,从而产生重复结构和几何错位等空间幻觉。这些问题在4D生成中更为严重——维持跨视角和时间演变的一致性会引入额外挑战,包括抖动、身份闪烁和结构漂移。我们提出Hallo4D,一个用于缓解3D和4D内容生成中时空幻觉的统一且模型无关的框架。Hallo4D引入生成-检测-纠正范式,利用大型多模态语言模型(LMM)从多视图和多帧渲染中识别并总结空间与时间不一致性。这些洞察指导了一种共识驱动的图像空间一致性优化:基于LMM的选择器通过多模型投票评估候选修正方案,无需重新训练或修改架构。为进一步提升时间一致性和优化效率,Hallo4D整合了运动感知的关键帧采样、LMM引导的初始化和外观对齐。此外,我们引入曝光感知优化和可见性剪枝,以增强在挑战性视角下的鲁棒性。大量实验表明,Hallo4D在多种3D和4D生成设置中持续优于强基线方法,为一致性感知的内容生成提供了可扩展且泛化性强的解决方案。
查看原文
查看缓存全文

缓存时间: 2026/07/16 05:41

论文页面 - Hallo4D:多模态幻觉缓解以实现一致的时空生成

来源:https://huggingface.co/papers/2607.12752

摘要

尽管近期3D生成的进展已实现令人印象深刻的视觉合成,但现有方法往往依赖2D扩散监督,缺乏显式的几何一致性机制,导致空间幻觉,如重复结构和几何错位。这些问题在4D生成中变得更为严重,因为跨视角和时间演化的连续性维护引入了额外挑战,包括抖动、身份闪烁和结构漂移。我们提出Hallo4D,一个统一且模型无关的框架,用于缓解3D和4D内容生成中的时空幻觉。Hallo4D引入了一个“生成-检测-纠正“范式,利用大型多模态语言模型(LMMs)从多视角和多帧渲染中识别并总结空间与时间上的不一致性。这些洞察指导了一种基于共识的图像空间一致性优化,其中LMM驱动的选择器通过多模型投票评估候选修正,无需重新训练或架构修改。为了进一步提升时间一致性和优化效率,Hallo4D集成了运动感知关键帧采样、LMM引导的初始化和外观对齐。我们还引入了曝光感知优化和可见性剪枝,以增强在挑战性视点下的鲁棒性。大量实验表明,Hallo4D在多种3D和4D生成设置中持续优于强基线,为一致性感知的内容生成提供了可扩展且可泛化的解决方案。

查看 arXiv 页面 (https://arxiv.org/abs/2607.12752)查看 PDF (https://arxiv.org/pdf/2607.12752)项目页面 (https://wafer-bob.github.io/Hallo3D-4D/)GitHub13 (https://github.com/wafer-bob/Hallo4D)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.12752)

在您的代理中获取此论文:

hf papers read 2607.12752

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.12752 以从本页链接。

引用此论文的数据集0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.12752 以从本页链接。

引用此论文的 Spaces0

暂无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.12752 以从本页链接。

包含此论文的收藏集0

暂无收藏集包含此论文

将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉

arXiv cs.CL

北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。

HalluWorld:基于参考世界模型的可控幻觉基准

arXiv cs.CL

HalluWorld 是一个可控基准框架,通过显式的参考世界模型在网格世界、国际象棋和实际终端任务等合成环境中评估大型语言模型中的幻觉。它可以细粒度分析各种故障模式,例如感知幻觉、多步状态追踪和因果模拟,揭示出前沿模型在处理扩展思维无法解决的复杂推理时仍然存在困难。