世界模型与语言模型相遇:论具体推理与抽象推理的互补性
摘要
本文提出特权未来在策略自蒸馏(PF-OPSD)方法,用于受控具体推理,结合世界模型的视觉模拟与语言模型的抽象推理,在两个新基准上提升预测准确性和鲁棒性。
查看缓存全文
缓存时间: 2026/06/03 07:36
论文页面 - 世界模型遇上语言模型:论具体推理与抽象推理的互补性
来源:https://huggingface.co/papers/2606.03603
摘要
受控具体推理结合了视觉模拟与抽象推理,通过一种利用特权未来信息的训练方法来提高预测准确性和鲁棒性。
世界模型 (World models) (https://huggingface.co/papers?q=World%20models) 与多模态大语言模型 (Multimodal Large Language Models, MLLMs) (https://huggingface.co/papers?q=multimodal%20large%20language%20models) 为从静态视觉观测预测未来结果提供了互补的能力。世界模型可以生成关于可能未来的具体视觉推演 (visual rollouts) (https://huggingface.co/papers?q=visual%20rollouts),而 MLLMs 能够对问题、目标和规则进行抽象推理。然而,生成的推演是随机的,可能在视觉上合理但与任务不符,因此需要判断视觉模拟 (visual simulation) (https://huggingface.co/papers?q=visual%20simulation) 何时有用、推演是否可信以及它应如何影响最终答案。我们将此问题定义为受控具体推理 (controlled concrete reasoning) (https://huggingface.co/papers?q=controlled%20concrete%20reasoning),即模型学习在抽象推理 (abstract reasoning) (https://huggingface.co/papers?q=abstract%20reasoning) 的同时调用、验证并整合视觉未来模拟。为了研究这一设定,我们构建了两个人验证的基准:VRQABench(用于可控空间前瞻)和 OpenWorldQA(用于开放域物理预测),并提出了基于策略的自我蒸馏特权未来 (Privileged-Future On-Policy Self-Distillation, PF-OPSD) (https://huggingface.co/papers?q=PF-OPSD) 方法。在训练过程中,PF-OPSD 仅使用真实未来视频和答案作为教师侧的特权上下文 (privileged context) (https://huggingface.co/papers?q=privileged%20context) 来评估基于策略的具体推理轨迹,而部署的学生模型在测试时从不观测真实未来。实验结果显示,PF-OPSD 在 VRQABench 和 OpenWorldQA 上分别比基线高出 10.6% 和 10.9%,同时增强了对于噪声或冲突推演的鲁棒性。我们的代码和数据集可在 https://github.com/yczhou001/PF-OPSD (https://github.com/yczhou001/PF-OPSD) 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2606.03603)查看 PDF (https://arxiv.org/pdf/2606.03603)GitHub1 (https://github.com/yczhou001/PF-OPSD)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.03603)
在你的智能体中获取此论文:
hf papers read 2606\.03603
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.03603 以从本页链接。
引用此论文的数据集2
YCZhou/vrqa_bench 更新于约1小时前 (https://huggingface.co/datasets/YCZhou/vrqa_bench)
YCZhou/openworld_qa 更新于约1小时前 (https://huggingface.co/datasets/YCZhou/openworld_qa)
引用此论文的空间0
无空间关联此论文
请在空间 README.md 中引用 arxiv.org/abs/2606.03603 以从本页链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
为何通用人工智能需要世界模型:大型语言模型的不足与世界模型的潜在优势
本文认为,大型语言模型在因果推理和长时域规划方面存在困难,其原因在于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配,并引入了潜在动态推断视角以及Flux环境来研究这些局限性。
无理解的趋同:语言模型表征一致但推理分歧
本文通过考察来自8个家族的16个语言模型在800个推理问题上的表现,探究了Platonic Representation Hypothesis。研究发现,虽然模型在内部表征上趋于一致,但在推理过程中,尤其是决策后阶段,它们出现分歧,而且共享的表征对预测的因果影响极小。
AI能否像城市规划师一样推理?基于专业判断对大型语言模型进行基准测试
本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。
更多推理,更低准确性?论视觉语言模型中推理的双重性
本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。
基于强化学习后训练的语言模型组合推理
本文提出一个依赖图框架以形式化语言模型中的组合推理,并评估强化学习后训练的影响,发现了一种不对称性:组合技能训练向分解任务的迁移比反向更为容易。