ActionPiece:重新思考自回归视觉-语言-动作模型中的动作分词

Hugging Face Daily Papers 论文

摘要

本文介绍了ActionPiece,一种用于自回归视觉-语言-动作模型的新型动作分词方法,该方法利用物理秩一致性来提高动作关系的保真度,并在LIBERO和SimplerEnv等基准测试中进行了评估。

动作分词器在自回归视觉-语言-动作(VLA)模型中起着核心作用,既决定了策略训练的目标,也决定了从预测令牌中恢复的可执行命令。它们的保真度通常使用逐点重建指标(如均方误差(MSE))来评估,但微小的个体误差并不能完全表征跨演示动作调整的忠实保留程度。压缩后,相似的动作仍可能聚集在代表性运动周围,而不同上下文所需的调整则可能被削弱、扭曲甚至反转。我们引入物理秩一致性(PRC)来衡量分词在重建后保留局部物理距离排序的能力。评估解码动作在不同令牌词表和解码器架构之间提供了一个共同的参考,通过关系保真度的度量补充了逐点准确性。我们进一步提出ActionPiece,它通过表示学习和量化的联合监督来保留物理动作关系。物理秩保留监督编码器和量化特征距离中的远近排序,而量化正则化则将相同的排序应用于码字分配分布。这两个目标增强了重建,为标准自回归策略学习和通过冻结解码器的执行生成离散动作令牌。在相同的Qwen3-VL-4B策略训练设置下,ActionPiece在LIBERO上达到94.8%,在未见过的LIBERO-Plus上达到68.8%,额外评估在SimplerEnv上达到71.9%,在VLA-Arena L0-L2上达到51.5%。组件消融实验表明,这两个目标共同改进了PRC和策略成功率,展示了物理关系监督对动作分词的价值。
查看原文
查看缓存全文

缓存时间: 2026/09/17 06:53

论文页面 - ActionPiece:重新思考自回归视觉-语言-动作模型中的动作分词

来源:https://huggingface.co/papers/2609.18487

摘要

动作分词器在自回归视觉-语言-动作(VLA)模型中扮演核心角色,它既决定了策略训练的目标,也决定了从预测token中恢复的可执行指令。其保真度通常使用逐点重建指标(如均方误差 MSE)进行评估,但微小的单点误差无法完全表征跨示例的动作调整被忠实保留的程度。压缩后,相似动作仍可能聚类在一个代表性运动附近,而不同情境所需的调整则可能被削弱、扭曲甚至颠倒。我们引入了物理排序一致性(PRC) 来衡量分词在重建后保留局部物理距离排序的能力。评估解码后的动作在不同token词表和解码器架构间提供了一个共同的参考标准,以关系保真度度量补充了逐点准确性。我们进一步提出了 ActionPiece,它通过联合监督表示学习和量化来保留物理动作关系。物理排序保真度监督编码器和量化特征距离中的远近排序,而量化正则化则将相同的排序应用于码字分配分布。这两个目标都增强了重建过程,生成用于标准自回归策略学习和通过冻结解码器执行的离散动作token。在相同的 Qwen3-VL-4B 策略训练设置下,ActionPiece 在 LIBERO 上达到 94.8%,在未见的 LIBERO-Plus 上达到 68.8%,额外评估在 SimplerEnv 上达到 71.9%,在 VLA-Arena L0-L2 上达到 51.5%。组件消融实验表明,这两个目标共同提高了 PRC 和策略成功率,证明了物理关系监督对动作分词的价值。

查看 arXiv 页面 (https://arxiv.org/abs/2609.18487) 查看 PDF (https://arxiv.org/pdf/2609.18487) 项目页面 (https://deepcybo-physai.github.io/ActionPiece/) GitHub13 (https://github.com/DeepCybo-PhysAI/ActionPiece) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.18487)

通过代理获取此论文:

hf papers read 2609\.18487

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.18487 以将其链接到此页面。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.18487 以将其链接到此页面。

引用此论文的空间 0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.18487 以将其链接到此页面。

包含此论文的收藏集 1

相似文章

重新审视复杂动作空间中的动作分解

arXiv cs.LG

本文提出了一项横断面研究,比较了在混合离散-连续动作空间中三种强化学习算法家族(PPO、SAC、DQN)上的各种动作分解方法(独立网络、共享编码器、VDN、QPLEX、联合、自回归),并引入了两个新的轻量级环境以及变体VDN-PPO和PPO-MIX。