Light-Omni:带长期记忆的智能体视频理解中反射优先于推理

Hugging Face Daily Papers 论文

摘要

Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。

智能体视频理解赋予模型长期记忆,使其能够自主处理并响应连续的、长时程的多模态流。然而,先进的视频智能体往往依赖``侦探式''迭代推理进行动作控制(例如搜索)和证据聚合,导致高昂的成本和延迟。我们认为,这种繁重推理主要是为了弥补检索中全局上下文的缺失和语义对齐不足。本文介绍Light-Omni,一个用于反射式轻量级视频理解的多模态智能体框架。它通过双上下文状态在单次前向传递中即时构建所需上下文。首先,我们维护一个全局状态,即从情景记忆中持续整合的有限大小多模态脚本,作为Light-Omni的全局上下文。通过层次化合并,它在总结过去事件的同时保留近期细节。其次,基于此全局上下文,我们生成一个参数化潜在状态,直接驱动自主行动并生成检索嵌入,延迟极低。得益于这种耦合设计,Light-Omni实现了语义对齐的检索和反射式响应,同时避免了迭代推理。大量实验验证了Light-Omni在多个视频基准上的有效性。值得注意的是,它在平均准确率上比M3-Agent高出2.4%,速度提升12.1倍,GPU内存效率提升2.6倍。此外,它作为内存系统可增强现有MLLMs的性能和效率。项目页面:https://clare-nie.github.io/Light-Omni。
查看原文
查看缓存全文

缓存时间: 2026/07/08 02:47

论文页面 - Light-Omni:基于长时记忆的智能体视频理解中的反射优于推理

来源:https://huggingface.co/papers/2607.05511

摘要

Light-Omni 是一个多模态智能体框架,通过双重上下文状态实现高效视频理解,在保持语义对齐的同时,消除迭代推理,从而达成更快、更准确的视频处理。

智能体视频理解为模型配备长时记忆,使其能够自主处理并响应连续的、长时跨度的多模态流。然而,先进的视频智能体往往依赖“侦探式”迭代推理(https://huggingface.co/papers?q=iterative%20reasoning)来控制动作(例如搜索)和聚合证据,导致高昂的成本和延迟。我们认为,这种繁重的推理主要是在弥补全局上下文的缺失以及检索中的语义错位。本文介绍了 Light-Omni,一个用于反射式、轻量化视频理解的多模态智能体框架(https://huggingface.co/papers?q=multimodal%20agent%20framework)。它通过双重上下文状态,在单次前向传播中即时构建所需上下文。首先,我们维护一个全局状态(https://huggingface.co/papers?q=global%20state),这是一个从情景记忆(https://huggingface.co/papers?q=episodic%20memory)中持续整合而成的有限大小的多模态脚本,作为 Light-Omni 的全局上下文。通过层次化合并(https://huggingface.co/papers?q=hierarchical%20merging),它在保留近期细节的同时总结过去事件。其次,基于这个全局上下文,我们生成一个参数化隐状态(https://huggingface.co/papers?q=parametric%20latent%20state),它直接驱动自主动作并产生检索嵌入(https://huggingface.co/papers?q=retrieval%20embeddings),延迟极低。得益于这种耦合设计,Light-Omni 实现了语义对齐的检索和反射式响应,同时避免了迭代推理(https://huggingface.co/papers?q=iterative%20reasoning)。大量实验验证了 Light-Omni 在多个视频基准(https://huggingface.co/papers?q=video%20benchmarks)上的有效性。值得注意的是,它以平均 2.4% 的准确率提升、12.1 倍的速度提升以及 2.6 倍的 GPU 内存效率提升,超越了 M3-Agent。此外,它还可作为记忆系统,增强现有 MLLM(https://huggingface.co/papers?q=MLLMs)的性能和效率。项目页面:https://clare-nie.github.io/Light-Omni。

查看 arXiv 页面(https://arxiv.org/abs/2607.05511) 查看 PDF(https://arxiv.org/pdf/2607.05511) 项目页面(https://clare-nie.github.io/Light-Omni) GitHub 17(https://github.com/Clare-Nie/Light-Omni) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.05511)

通过你的智能体获取本论文:

hf papers read 2607.05511

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 1

ClareNie/Light-Omni 图像-文本到文本 • 12B • 更新于约2小时前 • 4 • 5(https://huggingface.co/ClareNie/Light-Omni)

引用本论文的数据集 1

ClareNie/Light-Omni-Training 查看器 • 更新于约1小时前 • 511k • 71 • 2(https://huggingface.co/datasets/ClareNie/Light-Omni-Training)

引用本论文的空间 1

包含本论文的收藏 0

暂无包含本论文的收藏

添加本论文到收藏(https://huggingface.co/new-collection)以从此页面链接它。

相似文章

原生主动感知作为全模态理解的推理方式

Hugging Face Daily Papers

介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。