StreamPI: 视觉-语言-动作模型的流式多模态时序建模

Hugging Face Daily Papers 论文

摘要

StreamPI 引入了一个流式多模态时序建模框架,用于视觉-语言-动作模型,通过指令锚定注意力和随机间隔训练来改进机器人操作,无需额外参数。

视觉-语言-动作(VLA)模型在机器人操作中已展现出有效性,然而最先进的模型如 pi0.5 采用单帧范式,限制了它们保留过往观测和形成精确空间感知的能力。本文提出 StreamPI,一个流式多模态时序建模框架,为单帧 VLA 赋予时序推理能力,无需引入任何额外参数。一个核心设计是指令锚定时序建模。它将每个(视觉观测,语言指令)对视为一个原子时序单元:每对内的双向注意力实现跨模态融合,而跨对的因果注意力保持自回归流式推理。这确保了语言指令在整个任务执行中作为持久的语义锚点。为了解决同步训练与异步真实机器人部署之间的差距,我们引入了随机间隔流式训练策略:适当的帧间间隔(例如,每 3 帧)可以实现更快、更平滑的动作执行。此外,随机化间隔进一步提高了对帧时序扰动的鲁棒性,支持实际中的异步部署。此外,通过利用 LLM 骨干的长度外推能力,StreamPI 无缝继承了预训练的单帧权重,并支持灵活的单帧和多帧推理。在涵盖记忆依赖和精确感知场景的真实机器人任务以及仿真基准 LIBERO 上的实验表明,StreamPI 在多样化任务中优于 pi0.5。
查看原文
查看缓存全文

缓存时间: 2026/08/27 07:20

论文页面 - StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

来源:https://huggingface.co/papers/2608.26067

摘要

StreamPI 通过基于指令锚定的注意力机制与随机间隔训练,为单帧视觉-语言-动作模型赋予流式时序推理能力,在不增加额外参数的情况下提升了机器人操作性能。

视觉-语言-动作模型在机器人操作中已展现出有效性,但包括 pi0.5 在内的先进模型仍采用单帧范式,限制了其保留历史观测信息和发展精确空间感知的能力。本文提出 StreamPI,一种流式多模态时序建模框架,能够在不引入任何额外参数的前提下,为单帧视觉-语言-动作模型赋予时序推理能力。其核心设计之一是指令锚定时序建模。该方法将每个(视觉观测,语言指令)配对视为一个原子时序单元:配对内的双向注意力实现跨模态融合,而配对间的因果注意力则保持自回归流式推理。这确保了语言指令在整个任务执行过程中作为持久的语义锚点。为弥合同步训练与异步真实机器人部署之间的差距,我们引入了随机间隔流式训练策略:适当的帧间间隔(例如每 3 帧)能够实现更快、更流畅的动作执行。此外,随机化间隔进一步提升了对帧时序扰动的鲁棒性,支持实际中的异步部署。进一步地,通过利用大语言模型骨干长度外推能力,StreamPI 无缝继承了预训练的单帧权重,并支持灵活的单帧和多帧推理。在涵盖记忆依赖和精确感知场景的真实机器人任务以及仿真基准 LIBERO 上的实验表明,StreamPI 在各类任务上均优于 pi0.5。

查看 arXiv 页面 (https://arxiv.org/abs/2608.26067)查看 PDF (https://arxiv.org/pdf/2608.26067)项目主页 (https://happinesslz.github.io/projects/StreamPI/)GitHub2 (https://github.com/hku-sail/StreamPI)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.26067)

获取您代理中的论文:

hf papers read 2608\.26067

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无关联此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2608.26067 即可从本页链接。

引用此论文的数据集0

暂无关联此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2608.26067 即可从本页链接。

引用此论文的 Space0

暂无关联此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2608.26067 即可从本页链接。

包含此论文的收藏集0

暂无包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection)以从本页链接。

相似文章

Wan-Streamer v0.1:端到端实时交互基础模型

Hugging Face Daily Papers

Wan-Streamer是一个统一的端到端多模态模型,用于实时音视频交互,采用因果注意力机制,并集成处理视觉、音频和文本模态,实现了亚秒级延迟。

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hugging Face Daily Papers

Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。

ProactiveLLM: 学习主动交互的流式大语言模型

arXiv cs.CL

ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。

像机器人一样看:面向视觉-语言-动作模型的机器人中心点云图

Hugging Face Daily Papers

本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。