ChronoVision:通过潜在状态重建进行时间推理

Hugging Face Daily Papers 论文

摘要

ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。

多模态大语言模型擅长被动感知,但在需要多步时间推理的复杂视觉认知任务上表现不佳。这种退化很大程度上源于基于语言的推理固有的模糊性,其往往难以准确描述连续的视觉变换。为解决这一问题,我们提出 ChronoVision,一个旨在将视觉逻辑与潜在图像对齐的多模态框架。在监督微调阶段,重构视觉头预测最终变换状态的潜在表示,而 ROI 注意力定位模块通过语义跨度查询使模型聚焦于关键视觉证据。在后训练阶段,我们应用带有隐式过程基础机制的强化学习,并由一个复合奖励函数引导,该函数评估结果正确性、潜在过程对齐以及无监督视觉聚焦。此外,我们引入了 Vbvr-VQA,一个新数据集,通过将视频推理重构为严格的图像排序任务来评估时间跟踪。实验表明,ChronoVision 在 Vbvr-VQA 上取得了 SOTA 性能,域内准确率为 74.8%,域外准确率为 71.6%,并在极具挑战性的跨域基准 IntPhys2 上取得了 55.0% 的强劲准确率。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:56

论文页面 - ChronoVision:通过潜在状态重建实现时间推理

来源:https://huggingface.co/papers/2608.05631

摘要

多模态大语言模型在被动感知方面表现出色,但在需要多步骤时间推理的复杂视觉认知任务上却力不从心。这种性能退化很大程度上源于基于语言的推理固有的歧义性,它往往无法准确描述连续的视觉变换。为解决这一问题,我们提出了 ChronoVision,一个将视觉逻辑与潜在意象对齐的多模态框架。在监督微调阶段,一个重建式视觉头(Reconstructive Visual Head)预测最终变换状态的潜在表示,而一个 ROI 注意力定位模块(ROIAttentionLocating)通过语义跨度查询将模型聚焦于关键视觉证据。在后训练阶段,我们应用带隐式过程接地机制的强化学习,并由一个复合奖励函数引导,该函数评估结果正确性、潜在过程对齐以及无监督视觉聚焦。此外,我们引入了 Vbvr-VQA,一个通过将视频推理重构为严格的图像排序任务来评估时间追踪能力的新数据集。实验表明,ChronoVision 在 Vbvr-VQA 上取得了最先进的性能,领域内准确率为 74.8%,领域外准确率为 71.6%,同时在高挑战性的跨领域基准 IntPhys2 上取得了 55.0% 的强劲准确率。

查看 arXiv 页面 (https://arxiv.org/abs/2608.05631)查看 PDF (https://arxiv.org/pdf/2608.05631)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05631)

引用该论文的模型0

暂无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2608.05631,即可从本页面链接到该模型。

引用该论文的数据集0

暂无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2608.05631,即可从本页面链接到该数据集。

引用该论文的 Space0

暂无 Space 关联此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2608.05631,即可从本页面链接到该 Space。

包含该论文的收藏集0

暂无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到该收藏集。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。

OneVL:基于视觉语言解释的单步隐式推理与规划

Hugging Face Daily Papers

# 论文页面 - OneVL:基于视觉语言解释的单步隐式推理与规划 来源:[https://huggingface.co/papers/2604.18486](https://huggingface.co/papers/2604.18486) 发布于 4月20日 [\#1 每日论文](https://huggingface.co/papers/date/2026-04-21) 作者:, , , , , , , , , , , , , , , , , , , , ## 摘要 OneVL 提出了一个统一的视觉-语言-行动框架,通过整合语言和 v

SVoT: 基于强化学习的状态感知思维可视化空间推理

arXiv cs.AI

论文提出了SVoT,一种用于多模态大语言模型(MLLMs)中多跳空间推理的强化学习框架,该框架生成交错、可验证的中间状态和可视化,在涉及多对象交互和数值推理的新基准测试上取得了显著的准确性提升。