video-reasoning

标签

Cards List
#video-reasoning

SCOUT:用于超长自我中心视频推理的自检查与恢复感知工具思维智能体

arXiv cs.AI · 2026-08-11 缓存

SCOUT 提出了一种恢复感知的智能体框架,采用自适应探索-利用策略,用于超长自我中心视频推理。该框架通过 UPS-GRPO 训练,这是一种不确定性优先的强化学习方法,具备回合级优势分解。它在超长自我中心基准上取得了最先进的结果,并在较短的长时间视频场景中保持竞争力。

0 人收藏 0 人点赞
#video-reasoning

ChronoVision:通过潜在状态重建进行时间推理

Hugging Face Daily Papers · 2026-08-06 缓存

ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。

0 人收藏 0 人点赞
#video-reasoning

Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准

Hugging Face Daily Papers · 2026-06-26 缓存

提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。

0 人收藏 0 人点赞
#video-reasoning

VideoKR:面向知识和推理密集型视频理解

Hugging Face Daily Papers · 2026-06-03 缓存

VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。

0 人收藏 0 人点赞
#video-reasoning

VLM是通过自适应测试时优化进行视频推理的优秀教师

Hugging Face Daily Papers · 2026-06-01 缓存

本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。

0 人收藏 0 人点赞
#video-reasoning

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers · 2026-05-14 缓存

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。

0 人收藏 0 人点赞
#video-reasoning

@perceptroninc: 今天,我们发布了 Perceptron Mk1:前沿视频与具身推理。

X AI KOLs Following · 2026-05-12 缓存

Perceptron Inc. 发布了 Perceptron Mk1,这是一款专为视频和具身推理任务设计的前沿 AI 模型。

0 人收藏 0 人点赞
#video-reasoning

CollabVR:基于视觉语言模型与视频生成模型的协作式视频推理

Hugging Face Daily Papers · 2026-05-09 缓存

CollabVR 是一篇研究论文,提出了一种闭环框架,该框架通过协作整合视觉语言模型与视频生成模型,以改善视觉推理并实时纠正推理失败。

0 人收藏 0 人点赞
#video-reasoning

LiconStudio/Ltx2.3-VBVR-lora-I2V

Hugging Face Models Trending · 2026-04-08 缓存

LiconStudio 发布了一个针对 LTX-2.3 的 LoRA 适配器,该适配器在 VBVR 数据集上进行了微调,以增强视频生成能力,改善提示理解、运动动态和时间一致性,用于复杂的视频推理任务。

0 人收藏 0 人点赞
#video-reasoning

超大视频推理套件

Papers with Code Trending · 2026-02-23 缓存

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈