超越视觉思维链:内化视觉思维的主动视频推理
摘要
本文介绍了内化视觉思维(IVT),一个后训练框架,该框架训练多模态模型预测未来帧嵌入,从而无需合成中间图像即可直接生成答案,将主动视频推理的延迟降低5倍以上。
查看缓存全文
缓存时间: 2026/08/18 19:53
论文页面 - 超越视觉CoT:面向主动视频推理的内化视觉思维
来源:https://huggingface.co/papers/2608.15869
摘要
内化视觉思维训练多模态模型在后训练阶段预测未来帧嵌入,从而在推理时直接生成答案,无需合成中间图像,将延迟降低超过五倍。
多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20large%20language%20models)日益采用视觉链式思维(视觉CoT (https://huggingface.co/papers?q=Visual%20CoT))来推理空间、时间和具身环境。通过生成中间推理图像,视觉CoT (https://huggingface.co/papers?q=Visual%20CoT)为视觉预见提供了一种直观机制,但引入了显著的推理开销,这对于主动视频推理(https://huggingface.co/papers?q=proactive%20video%20reasoning)尤为突出。我们探究模型能否在训练期间学习进行视觉思考,而在推理时直接进行推理。我们引入了内化视觉思维(https://huggingface.co/papers?q=Internalized%20Visual%20Thinking)(IVT),这是一个后训练框架,可在无标签视频上联合优化文本预测和下一嵌入预测(https://huggingface.co/papers?q=next-embedding%20prediction)。给定部分观察到的视频,IVT会预测未来帧的潜在表示以及目标文本答案,鼓励模型捕获运动、物体转换、交互和潜在意图。在推理时,IVT直接生成答案,无需合成或重新编码未来帧。我们在目标表示、解码器设计、预测时长、数据混合、训练课程和预测目标等多个方面进行了对照研究。IVT在所有六项评估设置上均优于直接答案微调,同时保持相同的推理路径。与显式视觉CoT (https://huggingface.co/papers?q=Visual%20CoT)相比,IVT取得了相当或更好的性能,并将平均端到端延迟降低了超过5倍。我们的研究结果共同表明,在推理时进行显式的像素空间生成(如视觉链式思维中所用的)对于有效的主动视频推理(https://huggingface.co/papers?q=proactive%20video%20reasoning)可能并非必需。预测性世界建模(https://huggingface.co/papers?q=Predictive%20world%20modeling)可以在训练期间被内化,从而产生既更精确又更高效的多模态推理器。
查看arXiv页面 (https://arxiv.org/abs/2608.15869)查看PDF (https://arxiv.org/pdf/2608.15869)项目页面 (https://zgzxy001.github.io/blog/internalized-visual-thinking.html)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.15869)
在你的代理中获取本文:
hf papers read 2608\.15869
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接本文
在一个模型的README.md中引用 arxiv.org/abs/2608.15869 以将其链接到此页面。
引用本文的数据集0
没有数据集链接本文
在一个数据集的README.md中引用 arxiv.org/abs/2608.15869 以将其链接到此页面。
引用本文的Space0
没有Space链接本文
在一个Space的README.md中引用 arxiv.org/abs/2608.15869 以将其链接到此页面。
包含本文的合集0
没有合集包含本文
将本文添加到合集(https://huggingface.co/new-collection)以将其链接到此页面。
相似文章
IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成
IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
先想象后预测:用于视频事件预测的交错潜在视觉推理
介绍了Future-L1,一种交错潜在视觉推理框架,通过在潜在空间中保持视觉语义来改进视频事件预测。在FutureBench和TwiFF-Bench基准上取得了最先进的结果。
视频模型中的视觉提示(阅读时间8分钟)
视觉提示工程(VIPE)自动修改任务图像以提升视频模型的推理性能,通常比基于文本的提示或测试时缩放更为有效。
TTE-Flash:通过先思后嵌入令牌加速基于推理的多模态表示
论文介绍了TTE-Flash,一种用潜在思考令牌替换显式思维链推理的方法,以恒定推理成本生成推理感知的多模态表示,在MMEB-v2基准测试上优于显式CoT基线。