Light-Omni:带长期记忆的智能体视频理解中反射优先于推理
摘要
Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。
查看缓存全文
缓存时间: 2026/07/08 02:47
论文页面 - Light-Omni:基于长时记忆的智能体视频理解中的反射优于推理
来源:https://huggingface.co/papers/2607.05511
摘要
Light-Omni 是一个多模态智能体框架,通过双重上下文状态实现高效视频理解,在保持语义对齐的同时,消除迭代推理,从而达成更快、更准确的视频处理。
智能体视频理解为模型配备长时记忆,使其能够自主处理并响应连续的、长时跨度的多模态流。然而,先进的视频智能体往往依赖“侦探式”迭代推理(https://huggingface.co/papers?q=iterative%20reasoning)来控制动作(例如搜索)和聚合证据,导致高昂的成本和延迟。我们认为,这种繁重的推理主要是在弥补全局上下文的缺失以及检索中的语义错位。本文介绍了 Light-Omni,一个用于反射式、轻量化视频理解的多模态智能体框架(https://huggingface.co/papers?q=multimodal%20agent%20framework)。它通过双重上下文状态,在单次前向传播中即时构建所需上下文。首先,我们维护一个全局状态(https://huggingface.co/papers?q=global%20state),这是一个从情景记忆(https://huggingface.co/papers?q=episodic%20memory)中持续整合而成的有限大小的多模态脚本,作为 Light-Omni 的全局上下文。通过层次化合并(https://huggingface.co/papers?q=hierarchical%20merging),它在保留近期细节的同时总结过去事件。其次,基于这个全局上下文,我们生成一个参数化隐状态(https://huggingface.co/papers?q=parametric%20latent%20state),它直接驱动自主动作并产生检索嵌入(https://huggingface.co/papers?q=retrieval%20embeddings),延迟极低。得益于这种耦合设计,Light-Omni 实现了语义对齐的检索和反射式响应,同时避免了迭代推理(https://huggingface.co/papers?q=iterative%20reasoning)。大量实验验证了 Light-Omni 在多个视频基准(https://huggingface.co/papers?q=video%20benchmarks)上的有效性。值得注意的是,它以平均 2.4% 的准确率提升、12.1 倍的速度提升以及 2.6 倍的 GPU 内存效率提升,超越了 M3-Agent。此外,它还可作为记忆系统,增强现有 MLLM(https://huggingface.co/papers?q=MLLMs)的性能和效率。项目页面:https://clare-nie.github.io/Light-Omni。
查看 arXiv 页面(https://arxiv.org/abs/2607.05511) 查看 PDF(https://arxiv.org/pdf/2607.05511) 项目页面(https://clare-nie.github.io/Light-Omni) GitHub 17(https://github.com/Clare-Nie/Light-Omni) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.05511)
通过你的智能体获取本论文:
hf papers read 2607.05511
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 1
ClareNie/Light-Omni 图像-文本到文本 • 12B • 更新于约2小时前 • 4 • 5(https://huggingface.co/ClareNie/Light-Omni)
引用本论文的数据集 1
ClareNie/Light-Omni-Training 查看器 • 更新于约1小时前 • 511k • 71 • 2(https://huggingface.co/datasets/ClareNie/Light-Omni-Training)
引用本论文的空间 1
包含本论文的收藏 0
暂无包含本论文的收藏
添加本论文到收藏(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
OmniVideo-100K:一个通过结构化脚本和证据链进行音视频推理的数据集
OmniVideo-100K介绍了一个自动化的数据引擎,通过实体锚定脚本和线索引导的问答生成来提升音视频推理和时间一致性,在多个基准测试上实现了显著的性能提升。
InternVideo3: 使用多模态上下文推理将基础模型智能体化
InternVideo3 引入了多模态上下文推理(MCR)和高效注意力机制,以增强长时域多模态任务,在视频理解基准上取得了强劲的结果,并展示了视频智能体能力。