世界模型中的幻觉是可预测且可预防的
摘要
本文证明世界模型中的幻觉是一个数据覆盖问题,并提出基于数据的信号来检测它们,以及利用新的MMBench2数据集采用覆盖感知采样技术来减轻幻觉。
查看缓存全文
缓存时间: 2026/06/26 06:05
论文页面 - 世界模型中的幻觉可预测且可避免
来源:https://huggingface.co/papers/2606.27326
摘要
世界模型在状态-动作空间的低数据区域会出现幻觉,这可通过数据驱动的信号和覆盖感知采样技术进行检测和缓解。
现代生成式世界模型能够渲染出日益逼真、可控制动作的未来场景,但它们经常产生幻觉:生成的轨迹在视觉上保持流畅,却偏离了真实的动力学机制。我们假设幻觉集中在状态-动作空间的低覆盖区域,轻量级的数据驱动信号既能检测幻觉,也能指导缓解措施。为验证这一点,我们提出了 MMBench2——一个包含 427 小时、210 个任务的视觉世界建模数据集,配有真实动作、奖励和实时模拟器,并在其上训练了一个 3.5 亿参数的世界模型。我们识别出三种不同的幻觉模式:感知型、动作边缘化型和场景发散型——每种对应流程的不同阶段,并开发了三种能准确预测模型失败位置的信号。为在训练时覆盖缺口,我们开发了一种覆盖感知采样技术;为在线覆盖缺口,我们的幻觉预测器充当好奇心奖励,用于针对性数据收集,从而得到一种数据高效的微调方法,使预训练的世界模型在仅需 50 条真实环境轨迹的情况下适配完全未见过的环境。总体而言,我们的发现表明,世界模型中的幻觉本质上是一个数据覆盖问题,而用于检测幻觉的信号也可用于缓解幻觉。论文的交互式网页版参见 https://www.nicklashansen.com/mmbench2
查看 arXiv 页面 (https://arxiv.org/abs/2606.27326)查看 PDF (https://arxiv.org/pdf/2606.27326)项目页面 (https://www.nicklashansen.com/mmbench2)GitHub5 (https://github.com/nicklashansen/mmbench2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.27326)
在你的代理中获取这篇论文:
hf papers read 2606\.27326
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.27326 即可从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.27326 即可从此页面链接。
引用此论文的 Space0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.27326 即可从此页面链接。
包含此论文的收藏0
无收藏包含此论文
将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中即可从此页面链接。
相似文章
HalluWorld:基于参考世界模型的可控幻觉基准
HalluWorld 是一个可控基准框架,通过显式的参考世界模型在网格世界、国际象棋和实际终端任务等合成环境中评估大型语言模型中的幻觉。它可以细粒度分析各种故障模式,例如感知幻觉、多步状态追踪和因果模拟,揭示出前沿模型在处理扩展思维无法解决的复杂推理时仍然存在困难。
从架构到输出:大型语言模型中幻觉的结构根源及数据的放大作用
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
PARALLAX: 区分真实幻觉检测与基准构建伪影
本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。
基于开权重代理分析器激活的幻觉检测
本文介绍了一种代理分析器框架,通过分析小型开权重模型的内部激活状态而非生成模型本身,来检测大型语言模型中的幻觉。与 ReDeEP 等现有方法相比,该方法在 RAGTruth 等基准测试中表现出更优越的性能,证明了分析方法的优劣比模型大小更为关键。
幻觉起始的最快检测:延迟界与学习型CUSUM统计量
将词元级幻觉检测重新表述为最快变化检测问题,建立了检测延迟的理论下界,并表明因果循环模型实现了接近最优的性能,优于线性基线。