StreamArena:迈向连续、交互式且长时程的智能体流式视频理解

Hugging Face Daily Papers 论文

摘要

StreamArena 是一个用于小时级交互式流式视频理解的基准测试,并配套了一种名为 StreamMind 的两层架构。该架构在实时感知、历史回顾、主动交互和工具使用方面均优于现有的流式基线方法。

在连续的真实世界环境中部署自主多模态智能体,要求其能够接收无界的音视频流并维持小时级的记忆。然而,当前的评估主要依赖短视频片段和多项选择格式。这种设计使得仅处理最后四帧的最小基线方法也能达到甚至超越复杂的流式模型,同时答案选项也暴露了语言捷径。我们提出了 StreamArena,一个用于小时级交互式流式视频理解的基准测试。StreamArena 包含 243 个完整视频,平均时长为 88.8 分钟,以及 3,646 个经过严格标注的开放式问答对,用于评估实时感知、历史回顾、主动交互和多模态工具利用能力。对不同系统的评估揭示了连续交互与长时程多模态理解之间的矛盾。仅保留最近帧的方法无法恢复遥远事件,将过去观察转换为文本的方法会丢失视觉证据,而反复压缩视觉记忆的方法则难以随时间保留细粒度细节。我们通过 StreamMind 解决了这一矛盾,这是一种两层架构,将延迟关键型交互和主动监控分配给独立调度的前端工作器,而后端工作器则异步构建持久多模态记忆并执行历史回顾和外部搜索。StreamMind 在所有四项能力上均优于现有的流式基线方法,并通过重用持久状态降低了从查询到回答的延迟。
查看原文
查看缓存全文

缓存时间: 2026/08/10 06:14

论文页面 - StreamArena:迈向连续、交互、长时程智能体流式视频理解

来源:https://huggingface.co/papers/2608.05703

摘要

在连续、真实世界的环境中部署自主多模态智能体,要求它们能够摄取无界的音视频流,并维持小时级别的记忆。然而,当前的评估主要依赖于短视频片段和选择题格式。这种设计使得仅处理最后四帧的最小基线方法也能媲美甚至超越复杂的流式模型,同时答案选项也暴露了语言捷径。我们提出了StreamArena,一个用于小时级、交互式流式视频理解的基准。StreamArena包含243个完整视频,平均时长88.8分钟,以及3,646个经过严格标注的开放式问答对,用于评估实时感知、历史回顾、主动交互和多模态工具使用能力。对多种系统的评估揭示了连续交互与长时程多模态理解之间的张力。仅保留近期帧的方法无法恢复遥远事件,将过去观察转换为文本的方法丢失了视觉证据,而反复压缩视觉记忆的方法难以随时间保留细粒度细节。我们通过StreamMind解决了这一张力,这是一种双层架构,将延迟关键型交互和主动监控分配给独立调度的前端工作器,而后端工作器异步构建持久的多模态记忆,并执行历史回忆和外部搜索。StreamMind在全部四项能力上优于现有流式基线,并通过复用持久状态降低了查询到答案的延迟。

查看arXiv页面 (https://arxiv.org/abs/2608.05703)查看PDF (https://arxiv.org/pdf/2608.05703)项目页面 (https://hkuzxc.github.io/StreamArena_web/)GitHub0 (https://github.com/JIA-Lab-research/StreamArena)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05703)

在你的智能体中获取这篇论文:

hf papers read 2608\.05703

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文

在模型的README.md中引用arxiv.org/abs/2608.05703,即可在此页面建立关联。

引用此论文的数据集1

hkuzxc/StreamArena 查看器• 3天前更新 • 7.78k • 126 (https://huggingface.co/datasets/hkuzxc/StreamArena)

引用此论文的Space0

暂无Space关联此论文

在Space的README.md中引用arxiv.org/abs/2608.05703,即可在此页面建立关联。

包含此论文的收藏集0

暂无收藏集包含此论文

将这篇论文添加到收藏集 (https://huggingface.co/new-collection)中,即可在此页面建立关联。

相似文章

HorizonStream: 长视界注意力用于流式三维重建

Hugging Face Daily Papers

HorizonStream 提出一种用于流式三维重建的长视界注意力机制,该机制通过证据影响核显式建模几何传播,在恒定内存和线性时间复杂度下实现稳定、可扩展的重建,并能泛化到超过10,000帧的序列。

视频 = 世界 + 事件流

Hugging Face Daily Papers

Wan-Streamer v0.3 将视频重新定义为世界加事件流,引入了一个用于实时音视频交互的通用预训练任务。它实现了低延迟的全双工交互,模型端响应延迟为 200 毫秒。

多智能体推理中的流式通信

Hugging Face Daily Papers

StreamMA 提出了一种用于多智能体推理的流式通信范式,通过管道化中间结果来降低延迟,并利用更可靠的早期步骤提升效果,在多个基准测试中优于基线方法,同时揭示了步骤级别的缩放定律。

StreamMemBench:面向未来辅助的代理记忆流式评估

arXiv cs.AI

StreamMemBench是一个新的流式基准测试,用于评估个人代理记忆系统如何利用观察到的证据和用户反馈来实现面向未来的辅助。实验表明,当前系统通常无法将存储的信息转化为可靠的后续行为。