ChronoVision:通过潜在状态重建进行时间推理
摘要
ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。
查看缓存全文
缓存时间: 2026/08/07 05:56
论文页面 - ChronoVision:通过潜在状态重建实现时间推理
来源:https://huggingface.co/papers/2608.05631
摘要
多模态大语言模型在被动感知方面表现出色,但在需要多步骤时间推理的复杂视觉认知任务上却力不从心。这种性能退化很大程度上源于基于语言的推理固有的歧义性,它往往无法准确描述连续的视觉变换。为解决这一问题,我们提出了 ChronoVision,一个将视觉逻辑与潜在意象对齐的多模态框架。在监督微调阶段,一个重建式视觉头(Reconstructive Visual Head)预测最终变换状态的潜在表示,而一个 ROI 注意力定位模块(ROIAttentionLocating)通过语义跨度查询将模型聚焦于关键视觉证据。在后训练阶段,我们应用带隐式过程接地机制的强化学习,并由一个复合奖励函数引导,该函数评估结果正确性、潜在过程对齐以及无监督视觉聚焦。此外,我们引入了 Vbvr-VQA,一个通过将视频推理重构为严格的图像排序任务来评估时间追踪能力的新数据集。实验表明,ChronoVision 在 Vbvr-VQA 上取得了最先进的性能,领域内准确率为 74.8%,领域外准确率为 71.6%,同时在高挑战性的跨领域基准 IntPhys2 上取得了 55.0% 的强劲准确率。
查看 arXiv 页面 (https://arxiv.org/abs/2608.05631)查看 PDF (https://arxiv.org/pdf/2608.05631)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05631)
引用该论文的模型0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2608.05631,即可从本页面链接到该模型。
引用该论文的数据集0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2608.05631,即可从本页面链接到该数据集。
引用该论文的 Space0
暂无 Space 关联此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2608.05631,即可从本页面链接到该 Space。
包含该论文的收藏集0
暂无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到该收藏集。
相似文章
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
先想象后预测:用于视频事件预测的交错潜在视觉推理
介绍了Future-L1,一种交错潜在视觉推理框架,通过在潜在空间中保持视觉语义来改进视频事件预测。在FutureBench和TwiFF-Bench基准上取得了最先进的结果。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
OneVL:基于视觉语言解释的单步隐式推理与规划
# 论文页面 - OneVL:基于视觉语言解释的单步隐式推理与规划 来源:[https://huggingface.co/papers/2604.18486](https://huggingface.co/papers/2604.18486) 发布于 4月20日 [\#1 每日论文](https://huggingface.co/papers/date/2026-04-21) 作者:, , , , , , , , , , , , , , , , , , , , ## 摘要 OneVL 提出了一个统一的视觉-语言-行动框架,通过整合语言和 v
SVoT: 基于强化学习的状态感知思维可视化空间推理
论文提出了SVoT,一种用于多模态大语言模型(MLLMs)中多跳空间推理的强化学习框架,该框架生成交错、可验证的中间状态和可视化,在涉及多对象交互和数值推理的新基准测试上取得了显著的准确性提升。