先想象后预测:用于视频事件预测的交错潜在视觉推理

Hugging Face Daily Papers 论文

摘要

介绍了Future-L1,一种交错潜在视觉推理框架,通过在潜在空间中保持视觉语义来改进视频事件预测。在FutureBench和TwiFF-Bench基准上取得了最先进的结果。

视频事件预测(VEP)要求模型从部分视频证据中推断未观察到的未来状态。现有的视频多模态大语言模型(MLLMs)通常在文本空间中用语言表达中间的未来推理:一旦视觉证据被语言化,细粒度的运动、几何和交互线索可能会丢失,导致看似合理但缺乏视觉依据的幻觉。我们提出了Future-L1,一种交错潜在视觉推理框架,允许MLLM在自回归解码过程中在语言标记和连续的潜在视觉跨度之间交替。为了训练这种能力,我们构建了Future-L1-50K数据集,选择未来视觉线索有助于预测的示例,并将潜在状态与未来帧嵌入对齐,然后使用LA-DAPO(一种具有结果对比和时序多样性奖励的潜在感知强化学习目标)进一步优化采样的潜在轨迹。Future-L1在两个基准测试上都取得了新的最先进结果:在FutureBench上,它将Qwen3-VL-8B的得分从61.0提高到85.4,并超过了之前最好的Video-CoE 10.4分;在TwiFF-Bench上,它将平均得分从2.44提高到3.04。这些结果表明,面向未来的视频推理受益于在潜在空间中保留中间视觉语义,而不是将每个推理步骤都转化为文本。
查看原文
查看缓存全文

缓存时间: 2026/06/05 06:07

论文页面 - 先想象再预测:交错潜在视觉推理用于视频事件预测

来源: https://huggingface.co/papers/2606.05769

摘要

Future-L1 是一种交错潜在视觉推理框架,通过在自回归解码过程中保持潜在空间中的视觉语义,提升了视频事件预测能力,并在 FutureBench 和 TwiFF-Bench 基准上取得了最先进的结果。

视频事件预测 (https://huggingface.co/papers?q=Video%20event%20prediction) 要求模型从部分视频证据中推断未观察到的未来状态。现有的视频多模态大语言模型 (https://huggingface.co/papers?q=video%20MLLMs) 通常将中间的未来推理过程用文本空间的语言表达出来:一旦视觉证据被语言化,细粒度的运动、几何和交互线索就可能丢失,导致看似合理但缺乏视觉依据的幻觉。我们提出了 Future-L1,一种交错潜在视觉推理 (https://huggingface.co/papers?q=latent%20visual%20reasoning) 框架,它让多模态大语言模型在自回归解码 (https://huggingface.co/papers?q=autoregressive%20decoding) 过程中,能够在语言 token (https://huggingface.co/papers?q=language%20tokens) 和连续的潜在视觉片段之间交替生成。为了训练这种能力,我们构建了 Future-L1-50K 数据集,选取那些未来视觉线索有助于预测的例子,并将潜在状态与未来帧嵌入对齐,然后利用 LA-DAPO (https://huggingface.co/papers?q=LA-DAPO)(一种具有结果对比和时序多样性奖励 (https://huggingface.co/papers?q=temporal-diversity%20rewards) 的潜在感知强化学习目标 (https://huggingface.co/papers?q=latent-aware%20RL%20objective))进一步优化采样的潜在轨迹。Future-L1 在两个基准上都取得了新的最先进结果:在 FutureBench (https://huggingface.co/papers?q=FutureBench) 上,它将 Qwen3-VL-8B 从 61.0 提升至 85.4,并超过了此前最佳模型 Video-CoE 10.4 个点;在 TwiFF-Bench (https://huggingface.co/papers?q=TwiFF-Bench) 上,它将平均分数从 2.44 提升至 3.04。这些结果表明,面向未来的视频推理受益于在潜在空间中保留中间视觉语义,而不是将每一个推理步骤都转化为文本。

查看 arXiv 页面 (https://arxiv.org/abs/2606.05769) 查看 PDF (https://arxiv.org/pdf/2606.05769) GitHub 2 (https://github.com/OpenGVLab/Future-L1) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05769)

在你的智能体中获取此论文:

hf papers read 2606\.05769

尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.05769 即可从本页链接它。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.05769 即可从本页链接它。

引用此论文的 Spaces 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.05769 即可从本页链接它。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从本页链接它。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。

OneVL:基于视觉语言解释的单步隐式推理与规划

Hugging Face Daily Papers

# 论文页面 - OneVL:基于视觉语言解释的单步隐式推理与规划 来源:[https://huggingface.co/papers/2604.18486](https://huggingface.co/papers/2604.18486) 发布于 4月20日 [\#1 每日论文](https://huggingface.co/papers/date/2026-04-21) 作者:, , , , , , , , , , , , , , , , , , , , ## 摘要 OneVL 提出了一个统一的视觉-语言-行动框架,通过整合语言和 v