语义运动锚点:弥合共语手势中的运动与意义
摘要
本文提出语义运动锚点,即共语手势检索与合成中手势运动的自然语言抽象。该方法将3D手势离散化为身体-手部运动基元,并将其与转录文本对齐,在文本到手势检索和生成中的用户偏好方面取得了显著提升。
arXiv:2605.30608v1 公告类型:新
摘要:学习口语文本与手势之间的共享表示是共语手势检索、合成和理解的核心,但对于那些仅靠运动无法捕捉其交际意图的语义手势来说,仍然具有挑战性。转录文本与连续运动嵌入之间的直接对比对齐往往过分强调低层次的运动学特征,而忽略了语义手势的符号内容。我们提出语义运动锚点,即捕捉手势物理形式和交际意图的自然语言抽象。我们的方法将3D手势离散化为身体-手部运动基元,将其表述为结构化描述,并将其与转录文本对齐,以提供辅助对比监督。在BEAT2上,我们的方法在文本到手势的R@1指标上比直接文本-运动基线提高了8.2%,并且在文本到手势和手势到文本的检索方向上均优于先前的检索方法。除了整体检索指标外,语义运动锚点监督有助于检索与口语查询语义相关的手势,而不是默认使用通用运动模式。一项下游的检索增强手势生成研究表明,用户明显更偏好由我们的方法检索到的手势,而非检索增强生成基线,这表明语义基底的检索能够产生在下游生成中更好地传达交际意图的手势。
查看缓存全文
缓存时间: 2026/06/01 09:26
# 语义运动锚点:协调伴随言语手势中行动与意义的桥梁
来源:https://arxiv.org/html/2605.30608 Varsha Suresh1,\*,Mohammad Mahdi Abootorabi3,4,5,\*, Mohamed Salman1M\. Hamza Mughal3, Christian Theobalt1,3,Ashwin Ram1,Jürgen Steimle1,Vera Demberg1,3
1萨尔兰大学,2马克斯·普朗克信息学研究所,萨尔兰信息学园区,3不列颠哥伦比亚大学,4向量研究所,5康拉德·楚泽精英学习与智能系统学院(ELIZA)
\{vsuresh,vera\}@lst\.uni\-saarland\.de,mahdi\.abootorabi@ece\.ubc\.ca
mosa00006@stud\.uni\-saarland\.de,\{ram,steimle\}@cs\.uni\-saarland\.de
\{mmughal,theobalt\}@mpi\-inf\.mpg\.de
###### 摘要
学习口语文本与手势之间的共享表征是共语手势检索、合成和理解的核心问题,但对于具有语义意义的动作而言,其交际意图并非仅靠运动就能捕捉,因此仍然具有挑战性。直接对比对齐转录文本与连续运动嵌入往往过分强调低层运动学特征,而忽略了语义手势的符号化内容。我们提出*语义运动锚点*,即手势动作的自然语言抽象,捕捉其物理形态和交际意图。我们的方法将3D手势离散化为身体-手部运动基元,将其表述为结构化描述,并基于转录文本进行落地,从而提供辅助对比监督。在BEAT2上,我们的方法在文本到手势的R@1指标上比直接文本-运动基线提升了8.2%,并且在文本到手势和手势到文本的检索方向上均优于先前的检索方法。除了总体检索指标外,语义运动锚点监督有助于检索出与口语查询语义相符的手势,而非默认返回通用运动模式。一项下游的检索增强手势生成研究表明,用户显著偏好我们的方法所检索到的手势,而非来自检索增强生成基线的方法(72.2% vs. 27.8%,p<0.0001),这表明语义化落地检索在下游生成中能更好地传达交际意图。
\*\*脚注:这些作者对本文贡献均等。††脚注:本文作者受康拉德·楚泽精英学习与智能系统学院(ELIZA)资助,该学院隶属于德国学术交流中心(DAAD)的康拉德·楚泽人工智能精英学院项目,由联邦教育与研究部赞助。
## 1 引言
手势是人类沟通的核心渠道。具有语义意义的伴随言语手势可以补充或强化口语内容,使交流更高效,并且是共语手势合成与理解等任务的核心(Nyatsanga等人,2023 (https://arxiv.org/html/2605.30608#bib.bib16))。这些任务的关键在于学习语言与手势之间的共享空间,能够有意义地将原始运动序列与口语语言对齐。然而,学习一个能充分捕捉语义手势的空间仍然具有挑战性。直接将原始运动序列与口语文本映射的方法往往无法捕捉高层语义,反而学习到以频繁击打手势为主的平均化表示(Nyatsanga等人,2023 (https://arxiv.org/html/2605.30608#bib.bib16);Zhi等人,2023 (https://arxiv.org/html/2605.30608#bib.bib27);Ao等人,2023 (https://arxiv.org/html/2605.30608#bib.bib17);Liu等人,2025 (https://arxiv.org/html/2605.30608#bib.bib26);Hegde等人,2025 (https://arxiv.org/html/2605.30608#bib.bib25);Mughal等人,2025 (https://arxiv.org/html/2605.30608#bib.bib22))。这是因为语义手势是稀疏的,处于自然人体运动分布的长尾部分(Nyatsanga等人,2023 (https://arxiv.org/html/2605.30608#bib.bib16)),尽管它们对传达交际意图至关重要,但代表性不足。因此,基于检索的方法被提出,以将语义相关的手势注入生成过程(Zhang等人,2024 (https://arxiv.org/html/2605.30608#bib.bib21);Mughal等人,2025 (https://arxiv.org/html/2605.30608#bib.bib22))。然而,这些检索策略通常基于启发式或规则匹配,或最近学习原始运动-文本映射(专门针对语义手势)(Hegde等人,2025 (https://arxiv.org/html/2605.30608#bib.bib25)),因此在有效建模语义手势对齐方面仍然有限。这些方法的核心挑战在于手势和口语语言如何表示和映射。大多数现有方法在基于重构的目标下学习运动嵌入,这强调低层运动学特征,但往往不与交际意图直接对齐,而交际意图对语义手势至关重要。例如,表示列举(“第一、第二、第三”)的语义手势在不同说话者之间的表现可能差异很大,但表达相同的含义。相反,具有相似运动模式的语义手势可能根据话语上下文编码完全不同的意图。这种不匹配凸显了当前方法的核心局限性:它们将物理运动的相似性与语义含义的相似性混为一谈,使得难以在稀疏且多样的语义手势空间中学习泛化的表示。在本文中,我们认为语义手势检索不应仅仅依赖将口语文本直接映射到连续运动空间,而应由一个语义相关的抽象来支持,以便更好地连接两种模态。为此,我们引入了语义运动锚点:结构化的自然语言描述,以物理形态和交际意图的形式重新表达抽象的运动。在这里,物理形态指的是与手势相关的属性,如利手性、空间位置、运动轨迹和手型配置(Kipp,2005 (https://arxiv.org/html/2605.30608#bib.bib18)),而不是原始帧级别的关节坐标。交际意图捕捉手势的上下文功能,如列举、自指和不确性。这些锚点共同保留了对于解释重要的运动方面,同时减少了对低层运动学变化的敏感性,而这些变化对于学习共享空间可能无关。我们的方法由三个主要部分组成:首先,我们训练一个双流RVQ-VAE(Van Den Oord等人,2017 (https://arxiv.org/html/2605.30608#bib.bib14);Liu等人,2024 (https://arxiv.org/html/2605.30608#bib.bib6)),将连续3D手势序列压缩为离散运动标记,并将每个基元确定性地映射到一个结构化的自然语言片段,描述可观察的空间和运动学属性,如手部位置、运动方向、利手性和手型配置(取自Kipp,2005 (https://arxiv.org/html/2605.30608#bib.bib18))。其次,我们使用LLM将这些标记级别的描述与语音转录文本组合成针对每个手势的语义运动锚点。第三,我们在对比文本-手势运动检索训练中将这些锚点用作辅助监督。我们假设这允许模型学习检索所需的细节,即手势形式和功能,从而使口语语言与运动之间的映射更具语义基础。在BEAT2(Liu等人,2024 (https://arxiv.org/html/2605.30608#bib.bib6))上,我们的方法将文本到手势的R@1从39.1提升到42.3,绝对增益为+3.2点,相对于直接文本-手势运动基线提升了8.2%。在一项下游的检索增强手势生成研究中,用户显著偏好我们的方法所检索到的手势,而非来自RAG-Gesture(Mughal等人,2025 (https://arxiv.org/html/2605.30608#bib.bib22))的手势(72.2% vs. 27.8%,p<0.0001),这表明语义化落地检索在实践中能更好地匹配交际意图。我们的贡献如下:(i)我们引入了用于文本-手势检索的*语义运动锚点*,通过形式和意图的自然语言描述来表示伴随言语手势。(ii)我们提出了一种锚点监督的对比学习框架,利用运动标记表达和转录文本落地来改善语言-手势对齐。(iii)我们发布了*Semantix*数据集,包含878个人工标注的TED和BEAT2片段,配有黄金形式和意图描述,用于评估语义手势理解。(iv)我们展示了在BEAT2检索、TED–BEAT2跨数据集语义检索以及下游用户偏好(相较于RAG-Gesture)上的改进。
## 2 相关工作
### 2.1 伴随言语手势
伴随言语手势是口语交流的组成部分,并与言语共同传达意义(McNeill,1992 (https://arxiv.org/html/2605.30608#bib.bib11);Kendon,2004 (https://arxiv.org/html/2605.30608#bib.bib10))。手势研究通常将表象性手势(如图标性、隐喻性和指示性手势)与主要标记节奏的击打手势区分开来(McNeill,1992 (https://arxiv.org/html/2605.30608#bib.bib11),2005 (https://arxiv.org/html/2605.30608#bib.bib9))。这种区分对于计算建模很重要:击打手势是频繁的,并且相对容易被语音同步的运动模型捕捉到,而语义手势则是稀疏的、依赖上下文的,并且通常处于自然手势分布的长尾部分(Nyatsanga等人,2023 (https://arxiv.org/html/2605.30608#bib.bib16);Ram等人,2025 (https://arxiv.org/html/2605.30608#bib.bib4);Mughal等人,2025 (https://arxiv.org/html/2605.30608#bib.bib22))。最近的共语手势生成方法通过建模语音条件运动显著提高了自然度和时间对齐,但通常产生通用或击打主导的手势(Nyatsanga等人,2023 (https://arxiv.org/html/2605.30608#bib.bib16);Zhi等人,2023 (https://arxiv.org/html/2605.30608#bib.bib27);Ao等人,2023 (https://arxiv.org/html/2605.30608#bib.bib17))。为了解决这个问题,语义感知方法引入了语言-运动对齐、语义规划或检索增强生成,以生成更好地匹配话语意义的手势(Ao等人,2023 (https://arxiv.org/html/2605.30608#bib.bib17);Zhi等人,2023 (https://arxiv.org/html/2605.30608#bib.bib27);Zhang等人,2024 (https://arxiv.org/html/2605.30608#bib.bib21);Mughal等人,2025 (https://arxiv.org/html/2605.30608#bib.bib22);Liu等人,2025 (https://arxiv.org/html/2605.30608#bib.bib26);Ram等人,2025 (https://arxiv.org/html/2605.30608#bib.bib4))。这些方法表明语义落地对于交际意义的生成很重要。然而,由于它们主要关注合成,检索通常被视为中间步骤,并使用基于规则或启发式匹配实现。相比之下,我们以语义手势检索为主要任务,研究如何通过手势形式和交际意图的自然语言描述来对齐口语语言和手势运动。
### 2.2 文本到运动检索
文本到运动检索学习自然语言描述与运动序列之间的共享嵌入空间(Petrovich等人,2023 (https://arxiv.org/html/2605.30608#bib.bib15))。现有方法如TMR和MotionGPT通常在标准人体运动基准上开发,其中字幕直接描述执行的动作,使得语言-运动关系相对直接(Guo等人,2022 (https://arxiv.org/html/2605.30608#bib.bib12);Petrovich等人,2023 (https://arxiv.org/html/2605.30608#bib.bib15);Jiang等人,2023 (https://arxiv.org/html/2605.30608#bib.bib13);Petrovich等人,2022 (https://arxiv.org/html/2605.30608#bib.bib8))。伴随言语手势检索则更为隐晦:转录文本很少描述手势,而是提供话语上下文,手势功能必须从中推断。因此,直接的转录-运动对齐可能混淆低层运动学相似性与交际相似性。JEGAL(Hegde等人,2025 (https://arxiv.org/html/2605.30608#bib.bib25))最接近我们的设置,它通过直接的多模态对比学习来学习共语手势的手势-语言对齐(Hegde等人,2025 (https://arxiv.org/html/2605.30608#bib.bib25))。与直接对比对齐不同,我们的方法引入了一种中间语言抽象:手势被表达为物理形式和交际意图的锚点。这使得检索能够由手势的符号化内容而非仅原始运动相似性来塑造。
## 3 用于文本到手势检索的语义运动锚点监督
文本到手势检索定义为成对样本\((X_i, y_i)\),其中\(X_i \in \mathbb{R}^{T \times D}\)是一个3D手势序列(\(T\)帧,\(D=114\)每帧姿态维度,对应38个上半身关节),\(y_i\)是口语转录文本。标准对比检索直接对齐\(X_i\)和\(y_i\);我们额外为每个样本构建一个语义运动锚点\(a_i\),由运动和文本生成,仅在训练期间用作辅助对比监督。
### 3.1 语义锚点生成
语义运动锚点生成的目标是将连续手势运动转换为紧凑的自然语言描述,同时捕捉手势的外观及其在上下文中扮演的交际角色。我们分三步生成每个锚点:运动标记化、标记表达和基于转录文本的推理。
**运动标记化:** 给定手势序列\(X_i\),我们首先使用双流RVQ-VAE(Van Den Oord等人,2017 (https://arxiv.org/html/2605.30608#bib.bib14))将连续3D运动序列压缩为一系列离散运动标记。我们使用上半身坐标,因为我们对手势感兴趣,并将其分为身体和手部两个流,\(X_i = (X_i^{\text{body}}, X_i^{\text{hand}})\),分别编码并使用单独的码本进行量化,遵循Liu等人(2024 (https://arxiv.org/html/2605.30608#bib.bib6))。这样,每个运动序列可以被转换为一组离散运动标记\(q_i = (q_{i1}, q_{i2}, \ldots, q_{iN})\),其中每个标记\(q_{ij} = (q_{ij}^{\text{body}}, q_{ij}^{\text{hand}})\)代表一个8帧片段,跨身体和手部流联合编码。更多架构、训练细节和超参数调优见附录A.1 (https://arxiv.org/html/2605.30608#A1.SS1)。
**通过手势属性提取进行标记表达:** 每个标记\(q_{ij}\)被映射到一个结构化的自然语言片段\(d_{ij}\),描述其双手和身体的可观察物理属性。这一步基于Kipp(2005 (https://arxiv.org/html/2605.30608#bib.bib18))对手势可见形式描述与其交际功能解释的区分。在我们的情况下,标记执行第一步:记录手和手臂的动作,而不使用转录文本或推断手势含义。遵循Kipp(2005 (https://arxiv.org/html/2605.30608#bib.bib18))的手势标注维度,我们描述每个标记的利手性、空间位置、运动轨迹、手掌方向和粗略手型。我们使用这些维度作为物理形式表征的基础,并利用数值坐标从3D骨架几何中自动推导。从身体流中,我们推导手部相对于身体的位置和运动属性——例如左手在胸部前方,或右手从肩部向左移动。对于手部流,我们根据手指弯曲程度对手型进行分类。我们定义一个粗粒度的指关节角度阈值集:如果所有手指的指间关节平均角度低于30°,则手为打开状态;如果所有角度超过60°,则手为闭合状态;否则为部分弯曲。我们使用这些规则将手部姿态映射到三个粗粒度类别:打开、闭合或部分弯曲。这些是自动确定的,无需人工标注。此外,从手部流中我们标记掌心的方向:朝上、朝下、朝向自己或远离自己。重要的是,这一步仅基于运动数据,不参考转录文本。因此,每个属性片段\(d_{ij}\)仅记录可观察的动作属性:例如“左手在胸部高度向右移动,手部呈打开状态,掌心朝内”。
**转录引导推理:** 在获得标记描述序列\(d_i = (d_{i1}, \ldots, d_{iN})\)后,我们使用大型语言模型(LLM)将这些与转录文本\(y_i\)组合,并提示模型生成语义运动锚点\(a_i\)。该锚点是一个自然语言句子,总结手势的物理形式和交际意图。我们向LLM提供转录文本和手势的逐帧属性描述序列,并指令它生成一个简洁的锚点,例如“说话者用左手进行列举动作,从左向右移动以表示一系列项”。由于\(d_{ij}\)仅描述低级运动属性,而不提供语义解释,LLM必须利用转录文本推断手势的交际功能。我们使用封闭源LLM(GPT-40)和开源LLM(LLaMA-3-70b)进行实验,发现GPT-40在一致性上略优,但开源模型也足以产生合理结果,这取决于资源考虑。附录A.2 (https://arxiv.org/html/2605.30608#A1.SS2)包含了完整的提示模板和生成示例。附录A.3 (https://arxiv.org/html/2605.30608#A1.SS3)报告了一项基于人工标注评估(59个BEAT2测试样本)的锚点质量分析:我们的自动锚点与黄金标注在形式和意图得分上都有合理的一致性。重要的是,我们观察到自动锚点本身可以作为后续检索步骤中的有监督训练信号——尽管它们是自动生成的,但我们的对比方法使用这些锚点作为辅助文本侧面,并非直接作为检索目标。因此,自动锚点中的小错误可以被对比框架容忍,并作为学习更鲁棒对齐的噪声正则化形式。
### 3.2 锚点监督对比学习框架
为了联合学习对齐三种模态——原始运动、转录文本和锚点——我们提出了一个三流对比学习框架(图2)。我们的框架将转录文本\(y_i\)和锚点\(a_i\)作为文本侧面,与运动嵌入\(z_i\)进行对齐。尽管\(a_i\)和\(y_i\)都作为对比文本,锚点监督旨在提供更丰富的语义信号,以捕获可能未被转录文本直接捕获的交际细微差别。
**运动编码器:** 我们的运动编码器\(f_{\text{motion}}\)是一个基于变换器的模型,运行在RVQ-VAE标记化后的离散标记序列\(q_i\)上。我们选择标记化的运动表示,而非连续关节坐标,原因有二:(1)离散标记序列消除了帧级运动学噪声,并捕捉更高层的运动模式;(2)标准嵌入和池化方法可以直接应用于离散标记。受MUGHAL等人(2025)启发,我们使用变换器编码器,然后进行平均池化和投影,以获得嵌入\(z_i\)。运动编码器的准确实现细节见第4.1节。
**文本编码器:** 我们使用一个共享的文本编码器\(f_{\text{text}}\)来处理转录文本和锚点。对于每个样本,转录文本\(y_i\)和锚点\(a_i\)被独立编码为嵌入\(u_i\)和\(v_i\)。编码器共享参数,因此它们操作在相同的文本表示空间中。
**对比目标:** 对于样本批次,我们计算三种对比损失:运动-转录、运动-锚点和转录-锚点:
\[
\mathcal{L}_{\text{mt}} = \text{CL}(z_i, u_i), \quad \mathcal{L}_{\text{ma}} = \text{CL}(z_i, v_i), \quad \mathcal{L}_{\text{ta}} = \text{CL}(u_i, v_i).
\]
其中\(\text{CL}\)是标准信息论噪声对比估计(InfoNCE)损失(Oord等人,2018)。总损失为加权和:\(\mathcal{L} = \mathcal{L}_{\text{mt}} + \alpha \mathcal{L}_{\text{ma}} + \beta \mathcal{L}_{\text{ta}}\),我们设置\(\alpha = 0.5\)和\(\beta = 0.3\),基于保留验证集的性能进行调整。运动-锚点损失\(\mathcal{L}_{\text{ma}}\)驱动运动嵌入与锚点之间的语义相似性,避免与转录文本的虚假相关性——例如,仅基于运动模式检索击打手势。相反,锚点监督鼓励模型区分具有不同交际功能但共享相似运动模式的语义手势。
### 3.3 逐标记物理形式嵌入作为替代锚点
为了评估锚点中语义推理成分的效果,我们比较了上述完整的语义锚点与仅使用纯物理描述的锚点:\(a_i^{\text{form}} = (d_{i1}, d_{i2}, \ldots, d_{iN})\),即简单连接的手势属性片段序列,没有任何LLM组合或转录引导推理。这种消融设置了:我们仍然计算运动-锚点损失\(\mathcal{L}_{\text{ma}}\),但仅对物理描述进行。这隔离了从转录文本中形式描述和意图推理各自的影响。相似文章
AnyMo:基于掩码建模的任意模态条件运动生成扩展
本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。
AnyMo:几何感知的安装无关的真实环境中人体运动建模
AnyMo是一个几何感知的框架,用于安装无关的人体运动建模,它利用基于物理的IMU模拟和图编码,在零样本活动识别、跨模态检索和运动描述等多个数据集上实现了显著改进。
PhysDrift:弥合人形机器人共语动作生成中的具身差距
本文识别出由以人为中心的管道导致的人形机器人共语动作生成中的具身差距,并提出PhysDrift,一种具身感知框架,直接从语音预测可执行的人形机器人关节轨迹,改善了语音-动作对齐和物理合理性。
Motion Beyond Morphology:从抽象运动表示引导跨类别运动迁移
介绍了 Motion Beyond Morphology,一个通过学习抽象运动表示来在不同形态物体间迁移运动的框架,以及用于跨类别运动迁移的新 OpenVMT 数据集和基准。
使用学习锚点和白化内积改进相对表示
本文提出通过学习鲁棒的语义锚点并使用几何感知相似度度量来改进相对表示,使得不同架构的独立训练模型之间能够实现近乎无损的信息传输和稳定的零样本通信。