multimodal-temporal-modeling

Tag

Cards List
#multimodal-temporal-modeling

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

Hugging Face Daily Papers · 2d ago Cached

StreamPI introduces a streaming multimodal temporal modeling framework for vision-language-action models, improving robot manipulation through instruction-anchored attention and randomized interval training without additional parameters.

0 favorites 0 likes
← Back to home

Submit Feedback