克服动态盲视:面向VLA模型的免训练Pace-and-Path Correction
摘要
提出一种免训练推理时方法,用于VLA模型校正步调与路径动态,在动态环境中将成功率最高提升28.8%。
查看缓存全文
缓存时间: 2026/05/15 08:24
论文页面 - 克服动态盲区:面向 VLA 模型的无训练节奏与路径校正
来源:https://huggingface.co/papers/2605.11459
摘要
视觉-语言-动作模型在动态环境中存在时间盲区,但一种利用二次优化的无训练校正方法能够同时处理节奏与路径动态,从而提升性能。
视觉-语言-动作(Vision-Language-Action, VLA)模型展现出超越经典控制范式的卓越灵活性与泛化能力。然而,当前大多数主流的 VLA 模型采用单帧观测范式进行训练,这导致它们在结构上对时间动态(temporal dynamics, https://huggingface.co/papers?q=temporal%20dynamics)存在盲区。因此,这些模型在非平稳场景中性能严重下降,即便经过动态数据集的训练或微调也是如此。现有方法要么需要昂贵的重训练,要么面临延迟瓶颈以及动作片段间时间一致性差的问题。我们提出节奏与路径校正(Pace-and-Path Correction),一种无需训练的、闭式推理时操作算子,可封装任意采用分块动作(chunked-action, https://huggingface.co/papers?q=chunked-action)的 VLA 模型。从单一二次成本(quadratic cost, https://huggingface.co/papers?q=quadratic%20cost)出发,联合最小化(joint minimization, https://huggingface.co/papers?q=joint%20minimization)得到一个统一解,该解正交分解为两个不同通道:节奏通道沿规划方向压缩执行,路径通道则施加正交空间偏移,两者共同在分块窗口内吸收所感知的动态。我们在一个全面的诊断基准 MoveBench(旨在将运动作为唯一控制变量)上评估了我们的方法。实验结果表明,我们的框架始终优于最先进的无训练封装方法和动态自适应方法,在纯动态环境以及静态-动态混合环境(static-dynamic mixed environments, https://huggingface.co/papers?q=static-dynamic%20mixed%20environments)中,相较于基础 VLA 模型,成功率绝对提升分别高达 28.8% 和 25.9%。
查看 arXiv 页面 (https://arxiv.org/abs/2605.11459) 查看 PDF (https://arxiv.org/pdf/2605.11459) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.11459)
在你的 agent 中获取此论文:
hf papers read 2605\.11459
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型(0)
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.11459 以从此页面链接。
引用此论文的数据集(0)
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.11459 以从此页面链接。
引用此论文的 Space(0)
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.11459 以从此页面链接。
包含此论文的收藏集(0)
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
VLA-Corrector:一种用于自适应动作视野的轻量级检测与纠正推理框架
VLA-Corrector 提出了一种轻量级的检测与纠正推理框架,可在无需重新训练的情况下自适应调整视觉-语言-动作策略中的动作视野,提升机器人操控任务的鲁棒性和效率。
StableVLA:迈向无需额外数据的稳健视觉-语言-动作模型
本文为视觉-语言-动作(VLA)模型引入了一种信息瓶颈适配器(IB-Adapter),旨在提升模型在未见过的视觉干扰下的鲁棒性,且无需额外数据,在极小的参数开销下实现了高达30%的性能提升。
TBD-VLA: 时序块扩散视觉语言动作模型
TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。
从基础到应用:在实践中改进VLA模型
本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。
D-VLA: 面向视觉-语言-动作模型的高并发分布式异步强化学习框架
D-VLA 提出了一种高并发分布式异步强化学习框架,用于视觉-语言-动作模型,采用平面解耦和泳道管线提升大规模具身智能训练中的吞吐量和效率。