InternVideo3: 使用多模态上下文推理将基础模型智能体化
摘要
InternVideo3 引入了多模态上下文推理(MCR)和高效注意力机制,以增强长时域多模态任务,在视频理解基准上取得了强劲的结果,并展示了视频智能体能力。
查看缓存全文
缓存时间: 2026/06/11 13:40
论文页面 - InternVideo3:通过多模态上下文推理实现基础模型的智能体化
来源:https://huggingface.co/papers/2606.12195
作者:
、
、
、
、
、
、
、
、
、
摘要
InternVideo3 通过多模态上下文推理和高效注意力机制增强了长程多模态任务,在视频理解基准测试和视频智能体能力上展现出强劲表现。
近年来基础模型的进展已转向涉及多步推理和工具使用的智能体行为。然而,开源工作主要集中在文本主导的场景,长程多模态任务仍未被充分探索。这一差距在需要持续时间理解和迭代交互的视频任务中尤为明显。我们提出了 InternVideo3,这是一个通过多模态上下文推理(MCR)增强此类能力的框架。MCR 将理解视为一个闭环过程,作用于共享且不断演化的上下文,其中包含观察、指令、推理、工具操作和记忆。这便将长视频理解框架为证据积累与验证。为确保效率,我们引入了多模态多头潜在注意力(M^2LA),这是一种保留 token 的重参数化方法,在压缩 KV 缓存状态的同时保留完整的 token 流。我们的分阶段训练包括:继续预训练、短到长监督微调、基于规则的强化学习以及在策略蒸馏。实验表明,InternVideo3 在 Video-MME、MLVU 和 EgoSchema 等基准测试中取得了强劲性能。我们进一步将模型实例化为一个配备检索工具的视频智能体,展示了稳健的基于证据的行为。我们的结果表明,高效的上下文处理和闭环推理对于将开放多模态模型适应到长程视觉驱动的智能体行为至关重要。
查看 arXiv 页面 (https://arxiv.org/abs/2606.12195)
查看 PDF (https://arxiv.org/pdf/2606.12195)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.12195)
在您的智能体中获取此论文:
hf papers read 2606.12195
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 1
yanziang/InternVideo3-8B-Instruct 视频-文本到文本 • 9B • 更新于约11小时前 • 105 • 2 (https://huggingface.co/yanziang/InternVideo3-8B-Instruct)
引用此论文的数据集 1
yanziang/InternVideo3_Dataset 查看器 • 更新于约11小时前 • 380k • 28 • 1 (https://huggingface.co/datasets/yanziang/InternVideo3_Dataset)
引用此论文的 Space 0
没有链接此论文的 Space
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.12195,以便在此页面链接它。
包含此论文的收藏集 3
相似文章
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
VLX-VR:一种智能体感知的视频推理模型
VLX-VR是一种智能体感知的视频推理模型,它使用思考-记忆-观察循环和强化学习来自适应地收集证据,在MINERVA基准测试中达到了最先进的性能。
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。
Light-Omni:带长期记忆的智能体视频理解中反射优先于推理
Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。