世界模型中的幻觉是可预测且可预防的

Hugging Face Daily Papers 论文

摘要

本文证明世界模型中的幻觉是一个数据覆盖问题,并提出基于数据的信号来检测它们,以及利用新的MMBench2数据集采用覆盖感知采样技术来减轻幻觉。

现代生成式世界模型生成的未来场景越来越逼真且可控,但它们经常出现幻觉:生成的连续帧视觉上流畅,但偏离了真实动态。我们假设幻觉集中在状态-动作空间的低覆盖区域,轻量级的数据中心信号可以检测并指导缓解。为了验证这一点,我们引入了MMBench2,这是一个包含427小时、210个任务的视觉世界建模数据集,具有真实动作、奖励和实时模拟器,并在其上训练了一个350M参数的世界模型。我们识别出三种不同的幻觉模式:感知、动作边缘化和场景发散——每个模式对应不同管道阶段,并开发了三种信号来准确预测模型将在哪里失败。为了在训练时弥补覆盖缺口,我们开发了一种覆盖感知采样技术;为了在线弥补,我们的幻觉预测器作为好奇心奖励用于目标数据收集,从而得到一种数据高效的微调方案,该方案使预训练的世界模型适应完全未见过的环境,仅需50条真实环境轨迹。总体而言,我们的发现表明,世界模型中的幻觉本质上是一个数据覆盖问题,用于检测它的信号也可以用于缓解。 本论文的交互式网页版可在 https://www.nicklashansen.com/mmbench2 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/26 06:05

论文页面 - 世界模型中的幻觉可预测且可避免

来源:https://huggingface.co/papers/2606.27326

摘要

世界模型在状态-动作空间的低数据区域会出现幻觉,这可通过数据驱动的信号和覆盖感知采样技术进行检测和缓解。

现代生成式世界模型能够渲染出日益逼真、可控制动作的未来场景,但它们经常产生幻觉:生成的轨迹在视觉上保持流畅,却偏离了真实的动力学机制。我们假设幻觉集中在状态-动作空间的低覆盖区域,轻量级的数据驱动信号既能检测幻觉,也能指导缓解措施。为验证这一点,我们提出了 MMBench2——一个包含 427 小时、210 个任务的视觉世界建模数据集,配有真实动作、奖励和实时模拟器,并在其上训练了一个 3.5 亿参数的世界模型。我们识别出三种不同的幻觉模式:感知型、动作边缘化型和场景发散型——每种对应流程的不同阶段,并开发了三种能准确预测模型失败位置的信号。为在训练时覆盖缺口,我们开发了一种覆盖感知采样技术;为在线覆盖缺口,我们的幻觉预测器充当好奇心奖励,用于针对性数据收集,从而得到一种数据高效的微调方法,使预训练的世界模型在仅需 50 条真实环境轨迹的情况下适配完全未见过的环境。总体而言,我们的发现表明,世界模型中的幻觉本质上是一个数据覆盖问题,而用于检测幻觉的信号也可用于缓解幻觉。论文的交互式网页版参见 https://www.nicklashansen.com/mmbench2

查看 arXiv 页面 (https://arxiv.org/abs/2606.27326)查看 PDF (https://arxiv.org/pdf/2606.27326)项目页面 (https://www.nicklashansen.com/mmbench2)GitHub5 (https://github.com/nicklashansen/mmbench2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.27326)

在你的代理中获取这篇论文:

hf papers read 2606\.27326

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.27326 即可从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.27326 即可从此页面链接。

引用此论文的 Space0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.27326 即可从此页面链接。

包含此论文的收藏0

无收藏包含此论文

将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中即可从此页面链接。

相似文章

HalluWorld:基于参考世界模型的可控幻觉基准

arXiv cs.CL

HalluWorld 是一个可控基准框架,通过显式的参考世界模型在网格世界、国际象棋和实际终端任务等合成环境中评估大型语言模型中的幻觉。它可以细粒度分析各种故障模式,例如感知幻觉、多步状态追踪和因果模拟,揭示出前沿模型在处理扩展思维无法解决的复杂推理时仍然存在困难。

PARALLAX: 区分真实幻觉检测与基准构建伪影

arXiv cs.CL

本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。

基于开权重代理分析器激活的幻觉检测

arXiv cs.CL

本文介绍了一种代理分析器框架,通过分析小型开权重模型的内部激活状态而非生成模型本身,来检测大型语言模型中的幻觉。与 ReDeEP 等现有方法相比,该方法在 RAGTruth 等基准测试中表现出更优越的性能,证明了分析方法的优劣比模型大小更为关键。