StreamPI: 视觉-语言-动作模型的流式多模态时序建模
摘要
StreamPI 引入了一个流式多模态时序建模框架,用于视觉-语言-动作模型,通过指令锚定注意力和随机间隔训练来改进机器人操作,无需额外参数。
查看缓存全文
缓存时间: 2026/08/27 07:20
论文页面 - StreamPI:面向视觉-语言-动作模型的流式多模态时序建模
来源:https://huggingface.co/papers/2608.26067
摘要
StreamPI 通过基于指令锚定的注意力机制与随机间隔训练,为单帧视觉-语言-动作模型赋予流式时序推理能力,在不增加额外参数的情况下提升了机器人操作性能。
视觉-语言-动作模型在机器人操作中已展现出有效性,但包括 pi0.5 在内的先进模型仍采用单帧范式,限制了其保留历史观测信息和发展精确空间感知的能力。本文提出 StreamPI,一种流式多模态时序建模框架,能够在不引入任何额外参数的前提下,为单帧视觉-语言-动作模型赋予时序推理能力。其核心设计之一是指令锚定时序建模。该方法将每个(视觉观测,语言指令)配对视为一个原子时序单元:配对内的双向注意力实现跨模态融合,而配对间的因果注意力则保持自回归流式推理。这确保了语言指令在整个任务执行过程中作为持久的语义锚点。为弥合同步训练与异步真实机器人部署之间的差距,我们引入了随机间隔流式训练策略:适当的帧间间隔(例如每 3 帧)能够实现更快、更流畅的动作执行。此外,随机化间隔进一步提升了对帧时序扰动的鲁棒性,支持实际中的异步部署。进一步地,通过利用大语言模型骨干的长度外推能力,StreamPI 无缝继承了预训练的单帧权重,并支持灵活的单帧和多帧推理。在涵盖记忆依赖和精确感知场景的真实机器人任务以及仿真基准 LIBERO 上的实验表明,StreamPI 在各类任务上均优于 pi0.5。
查看 arXiv 页面 (https://arxiv.org/abs/2608.26067)查看 PDF (https://arxiv.org/pdf/2608.26067)项目主页 (https://happinesslz.github.io/projects/StreamPI/)GitHub2 (https://github.com/hku-sail/StreamPI)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.26067)
获取您代理中的论文:
hf papers read 2608\.26067
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无关联此论文的模型
在模型的 README.md 中引用 arxiv.org/abs/2608.26067 即可从本页链接。
引用此论文的数据集0
暂无关联此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2608.26067 即可从本页链接。
引用此论文的 Space0
暂无关联此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2608.26067 即可从本页链接。
包含此论文的收藏集0
暂无包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection)以从本页链接。
相似文章
Wan-Streamer v0.1:端到端实时交互基础模型
Wan-Streamer是一个统一的端到端多模态模型,用于实时音视频交互,采用因果注意力机制,并集成处理视觉、音频和文本模态,实现了亚秒级延迟。
Stream3D-VLM:基于增量几何先验的在线3D空间理解
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。
ProactiveLLM: 学习主动交互的流式大语言模型
ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。
多流大语言模型:通过并行思维、输入与输出流解锁语言模型的潜力
本文提出了多流大语言模型(Multi-Stream LLMs),将基于顺序消息的指令微调转变为并行流处理。这种方法允许语言模型在多个并发数据流中同时进行读取、思考和生成,解决了自主智能体应用中的瓶颈问题。
像机器人一样看:面向视觉-语言-动作模型的机器人中心点云图
本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。