Hallo4D: 多模态幻觉缓解实现一致时空生成
摘要
Hallo4D是一个模型无关框架,利用大型多模态语言模型检测和纠正3D与4D生成中的空间和时间幻觉,在无需重新训练的情况下改善跨视角和时间的一致性。
查看缓存全文
缓存时间: 2026/07/16 05:41
论文页面 - Hallo4D:多模态幻觉缓解以实现一致的时空生成
来源:https://huggingface.co/papers/2607.12752
摘要
尽管近期3D生成的进展已实现令人印象深刻的视觉合成,但现有方法往往依赖2D扩散监督,缺乏显式的几何一致性机制,导致空间幻觉,如重复结构和几何错位。这些问题在4D生成中变得更为严重,因为跨视角和时间演化的连续性维护引入了额外挑战,包括抖动、身份闪烁和结构漂移。我们提出Hallo4D,一个统一且模型无关的框架,用于缓解3D和4D内容生成中的时空幻觉。Hallo4D引入了一个“生成-检测-纠正“范式,利用大型多模态语言模型(LMMs)从多视角和多帧渲染中识别并总结空间与时间上的不一致性。这些洞察指导了一种基于共识的图像空间一致性优化,其中LMM驱动的选择器通过多模型投票评估候选修正,无需重新训练或架构修改。为了进一步提升时间一致性和优化效率,Hallo4D集成了运动感知关键帧采样、LMM引导的初始化和外观对齐。我们还引入了曝光感知优化和可见性剪枝,以增强在挑战性视点下的鲁棒性。大量实验表明,Hallo4D在多种3D和4D生成设置中持续优于强基线,为一致性感知的内容生成提供了可扩展且可泛化的解决方案。
查看 arXiv 页面 (https://arxiv.org/abs/2607.12752)查看 PDF (https://arxiv.org/pdf/2607.12752)项目页面 (https://wafer-bob.github.io/Hallo3D-4D/)GitHub13 (https://github.com/wafer-bob/Hallo4D)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.12752)
在您的代理中获取此论文:
hf papers read 2607.12752
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.12752 以从本页链接。
引用此论文的数据集0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.12752 以从本页链接。
引用此论文的 Spaces0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.12752 以从本页链接。
包含此论文的收藏集0
暂无收藏集包含此论文
将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
OpenHalDet:一种针对多样生成场景下幻觉检测的统一基准
OpenHalDet 是一个用于大语言模型幻觉检测的统一基准,它标准化了跨不同生成场景的评估,并支持黑盒、灰盒和白盒检测方法。
HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉
北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。
HalluWorld:基于参考世界模型的可控幻觉基准
HalluWorld 是一个可控基准框架,通过显式的参考世界模型在网格世界、国际象棋和实际终端任务等合成环境中评估大型语言模型中的幻觉。它可以细粒度分析各种故障模式,例如感知幻觉、多步状态追踪和因果模拟,揭示出前沿模型在处理扩展思维无法解决的复杂推理时仍然存在困难。
从架构到输出:大型语言模型中幻觉的结构根源及数据的放大作用
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
ClinHallu:用于诊断医疗多模态大语言模型推理中阶段性幻觉的基准
ClinHallu是一个基准,通过将推理分解为视觉识别、知识回忆和推理整合阶段,并使用轨迹监督微调来减少错误,从而诊断和缓解医疗多模态大语言模型中的幻觉。