超越视觉思维链:内化视觉思维的主动视频推理

Hugging Face Daily Papers 论文

摘要

本文介绍了内化视觉思维(IVT),一个后训练框架,该框架训练多模态模型预测未来帧嵌入,从而无需合成中间图像即可直接生成答案,将主动视频推理的延迟降低5倍以上。

多模态大型语言模型越来越多地使用视觉思维链(Visual CoT)来推理空间、时间和具身环境。通过生成中间推理图像,Visual CoT为视觉预判提供了直观机制,但引入了显著的推理开销,这对主动视频推理尤其成问题。我们探究模型是否能在训练期间学会视觉思考,同时在推理时直接推理。我们引入内化视觉思维(IVT),一个后训练框架,它联合优化文本预测和下一嵌入预测,基于无标签视频。给定部分观察的视频,IVT预测未来帧的潜在表示以及目标文本答案,鼓励模型捕捉运动、物体转换、交互和潜在意图。在推理时,IVT直接生成答案,无需合成或重新编码未来帧。我们针对目标表示、解码器设计、预测范围、数据混合、训练课程和预测目标进行了对照研究。IVT在所有六种评估设置中均优于直接答案微调,同时保持相同的推理路径。与显式Visual CoT相比,IVT实现了相当或更好的性能,并将平均端到端延迟降低了5倍以上。总之,我们的发现表明,如视觉思维链中使用的推理时显式像素空间生成,对于有效的主动视频推理可能并非必要。预测性世界模型可以在训练期间内化,从而产生既更准确又更高效的多模态推理器。
查看原文
查看缓存全文

缓存时间: 2026/08/18 19:53

论文页面 - 超越视觉CoT:面向主动视频推理的内化视觉思维

来源:https://huggingface.co/papers/2608.15869

摘要

内化视觉思维训练多模态模型在后训练阶段预测未来帧嵌入,从而在推理时直接生成答案,无需合成中间图像,将延迟降低超过五倍。

多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20large%20language%20models)日益采用视觉链式思维(视觉CoT (https://huggingface.co/papers?q=Visual%20CoT))来推理空间、时间和具身环境。通过生成中间推理图像,视觉CoT (https://huggingface.co/papers?q=Visual%20CoT)为视觉预见提供了一种直观机制,但引入了显著的推理开销,这对于主动视频推理(https://huggingface.co/papers?q=proactive%20video%20reasoning)尤为突出。我们探究模型能否在训练期间学习进行视觉思考,而在推理时直接进行推理。我们引入了内化视觉思维(https://huggingface.co/papers?q=Internalized%20Visual%20Thinking)(IVT),这是一个后训练框架,可在无标签视频上联合优化文本预测和下一嵌入预测(https://huggingface.co/papers?q=next-embedding%20prediction)。给定部分观察到的视频,IVT会预测未来帧的潜在表示以及目标文本答案,鼓励模型捕获运动、物体转换、交互和潜在意图。在推理时,IVT直接生成答案,无需合成或重新编码未来帧。我们在目标表示、解码器设计、预测时长、数据混合、训练课程和预测目标等多个方面进行了对照研究。IVT在所有六项评估设置上均优于直接答案微调,同时保持相同的推理路径。与显式视觉CoT (https://huggingface.co/papers?q=Visual%20CoT)相比,IVT取得了相当或更好的性能,并将平均端到端延迟降低了超过5倍。我们的研究结果共同表明,在推理时进行显式的像素空间生成(如视觉链式思维中所用的)对于有效的主动视频推理(https://huggingface.co/papers?q=proactive%20video%20reasoning)可能并非必需。预测性世界建模(https://huggingface.co/papers?q=Predictive%20world%20modeling)可以在训练期间被内化,从而产生既更精确又更高效的多模态推理器。

查看arXiv页面 (https://arxiv.org/abs/2608.15869)查看PDF (https://arxiv.org/pdf/2608.15869)项目页面 (https://zgzxy001.github.io/blog/internalized-visual-thinking.html)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.15869)

在你的代理中获取本文:

hf papers read 2608\.15869

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接本文

在一个模型的README.md中引用 arxiv.org/abs/2608.15869 以将其链接到此页面。

引用本文的数据集0

没有数据集链接本文

在一个数据集的README.md中引用 arxiv.org/abs/2608.15869 以将其链接到此页面。

引用本文的Space0

没有Space链接本文

在一个Space的README.md中引用 arxiv.org/abs/2608.15869 以将其链接到此页面。

包含本文的合集0

没有合集包含本文

将本文添加到合集(https://huggingface.co/new-collection)以将其链接到此页面。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。