ActionPiece:重新思考自回归视觉-语言-动作模型中的动作分词
摘要
本文介绍了ActionPiece,一种用于自回归视觉-语言-动作模型的新型动作分词方法,该方法利用物理秩一致性来提高动作关系的保真度,并在LIBERO和SimplerEnv等基准测试中进行了评估。
查看缓存全文
缓存时间: 2026/09/17 06:53
论文页面 - ActionPiece:重新思考自回归视觉-语言-动作模型中的动作分词
来源:https://huggingface.co/papers/2609.18487
摘要
动作分词器在自回归视觉-语言-动作(VLA)模型中扮演核心角色,它既决定了策略训练的目标,也决定了从预测token中恢复的可执行指令。其保真度通常使用逐点重建指标(如均方误差 MSE)进行评估,但微小的单点误差无法完全表征跨示例的动作调整被忠实保留的程度。压缩后,相似动作仍可能聚类在一个代表性运动附近,而不同情境所需的调整则可能被削弱、扭曲甚至颠倒。我们引入了物理排序一致性(PRC) 来衡量分词在重建后保留局部物理距离排序的能力。评估解码后的动作在不同token词表和解码器架构间提供了一个共同的参考标准,以关系保真度度量补充了逐点准确性。我们进一步提出了 ActionPiece,它通过联合监督表示学习和量化来保留物理动作关系。物理排序保真度监督编码器和量化特征距离中的远近排序,而量化正则化则将相同的排序应用于码字分配分布。这两个目标都增强了重建过程,生成用于标准自回归策略学习和通过冻结解码器执行的离散动作token。在相同的 Qwen3-VL-4B 策略训练设置下,ActionPiece 在 LIBERO 上达到 94.8%,在未见的 LIBERO-Plus 上达到 68.8%,额外评估在 SimplerEnv 上达到 71.9%,在 VLA-Arena L0-L2 上达到 51.5%。组件消融实验表明,这两个目标共同提高了 PRC 和策略成功率,证明了物理关系监督对动作分词的价值。
查看 arXiv 页面 (https://arxiv.org/abs/2609.18487) 查看 PDF (https://arxiv.org/pdf/2609.18487) 项目页面 (https://deepcybo-physai.github.io/ActionPiece/) GitHub13 (https://github.com/DeepCybo-PhysAI/ActionPiece) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.18487)
通过代理获取此论文:
hf papers read 2609\.18487
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.18487 以将其链接到此页面。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.18487 以将其链接到此页面。
引用此论文的空间 0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.18487 以将其链接到此页面。
包含此论文的收藏集 1
相似文章
RepWAM:基于表征视觉-动作分词器的世界动作建模
RepWAM 提出了一种使用表征视觉-动作分词器的世界动作建模方法,旨在学习用于规划与控制的统一视觉和动作表征。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
重新审视复杂动作空间中的动作分解
本文提出了一项横断面研究,比较了在混合离散-连续动作空间中三种强化学习算法家族(PPO、SAC、DQN)上的各种动作分解方法(独立网络、共享编码器、VDN、QPLEX、联合、自回归),并引入了两个新的轻量级环境以及变体VDN-PPO和PPO-MIX。
基于角色条件的子令牌路由:实现高效的视觉-语言-动作策略
本文介绍了一种基于角色条件的子令牌路由(RoleSub)方法,该方法通过路由子令牌组来高效压缩视觉-语言-动作模型,在降低计算成本的同时,保持在机器人任务上的强大性能。
APT:动作专家预训练提升视觉-语言-动作策略的指令泛化能力
研究人员提出APT,一种两阶段训练方法,先在视觉-动作对上预训练动作专家,再整合语言条件,显著提升视觉-语言-动作策略在分布外指令上的泛化能力。