低资源多模态翻译:将尼泊尔口语词语转化为情感条件手语虚拟形象
摘要
本文提出了NEST-V1,一个用于从语音输入生成情感条件尼泊尔手语虚拟形象的概念验证多模态框架,在包含50名说话者600个音频样本的数据集上实现了81.1%的ASR准确率和79.21%的情感识别准确率。
arXiv:2606.26107v1 公告类型:新\n摘要:整合情感表达的手语交流系统仍然探索不足,尤其是在低资源语言中。本初步研究提出了NEST-V1(尼泊尔情感与语音Transformer - 第一版),一个概念验证多模态框架,展示了从语音输入生成情感条件尼泊尔手语虚拟形象的可行性。作为初步调查,我们关注四个常见的尼泊尔词语(\"thank you\"、\"hello\"、\"house\"、\"me\"),涵盖三种情感状态(快乐、中性、悲伤),以验证我们的核心技术方法。我们的轻量级架构采用共享声学编码器,同时进行自动语音识别和情感分类,在包含50名说话者600个已标注音频样本的数据集上实现了81.1%的ASR准确率和79.21%的情感识别准确率。与单独模型架构相比,该系统在仅22.1M参数的轻量级规模下实现了37%的参数效率,适合边缘部署。这项初步工作为低资源环境下的情感感知手语翻译奠定了技术基础,并为未来扩展到更大词汇量和更多样化的情感表达提供了可扩展框架。初步结果表明,为听障社区提供实时、富有情感表达的手语交流系统是可行的,并明确了后续开发阶段的改进路径。
查看缓存全文
缓存时间: 2026/06/26 05:13
# 低资源尼泊尔口语词汇到情感条件手语虚拟人物的多模态翻译
来源: https://arxiv.org/html/2606.26107
11institutetext:Center for Human Mobility and Communications, Prateek Innovations, Kathmandu, Nepal
22institutetext:Sunway International Business School, Birmingham City University, Kathmandu, Nepal
22email:jbhusal@prateekinnovations\.com, jatin@sunway\.edu\.np
22email:salma\.tamang@prateekinnovations\.com
###### 摘要
整合情感表达的手语通信系统仍未得到充分探索,特别是在低资源语言中。本初步研究提出了 NEST-V1(尼泊尔情感与语音转换器 - 版本1),这是一个概念验证的多模态框架,展示了从语音输入生成带有情感条件的尼泊尔手语虚拟人物的可行性。作为初步研究,我们聚焦于四个常用尼泊尔词汇(“谢谢”、“你好”、“房子”、“我”),跨越三种情感状态(高兴、中性、悲伤),以验证我们的核心技术方法。我们的轻量级架构采用共享声学编码器,同时执行自动语音识别和情感分类,在包含50名说话人、600个标注音频样本的数据集上实现了81.1%的ASR准确率和79.21%的情感识别准确率。与独立模型架构相比,该系统在仅22.1M参数的轻量级占用下,实现了37%的参数效率,适合边缘部署。这项基础工作为低资源环境下的情感感知手语翻译奠定了技术基础,并提供了一个可扩展的框架,以便未来扩展到更大的词汇量和更多样化的情感表达。我们的初步结果表明,为听障社区实现实时、情感表达丰富的手语通信系统是可行的,并且在后续开发阶段有清晰的改进路径。
## 1 引言
语音到手势的手语系统在辅助性手语研究中至关重要。这些系统有潜力弥合口语使用者和听障社区之间的沟通鸿沟。然而,现有大多数系统仅专注于词汇翻译,忽视了口语中的情感语境——而这是自然、以人为本的沟通中必不可少的组成部分。
动态、实时的虚拟人物生成是增强手语沟通自然性和表现力的关键因素。然而,由于缺乏情感表达丰富的虚拟人物,许多现有系统更像机械的手势模仿,而非真实的人际互动。这一差距在低资源语言(如尼泊尔语及其对应的尼泊尔手语)中更为突出,这些语言的研究和数据集十分稀缺。本初步研究提出了一种低资源多模态翻译管道,将自动语音识别与情感识别相结合,以生成动态的手语虚拟人物动画。它涵盖了四个常用的尼泊尔手语词汇,并配以对应三种情感状态(高兴、悲伤、中性)的面部表情。本研究的主要贡献如下:
1. 1. 提出了首个标注情感语境的尼泊尔手语语音数据集。
2. 2. 设计了模块化、实时的管道,包含独立的ASR和情感识别组件,便于扩展和升级。
3. 3. 管道轻量级,适合低资源部署,支持边缘应用。
本文其余部分结构如下:第2节回顾相关工作。第3节介绍我们的方法、架构和模型实现。第4节展示实验结果与分析。最后,第5节总结全文,第6节讨论未来方向。
## 2 相关工作
近期研究探索了将情感表达整合到手语虚拟人物中,以增强理解和自然性。如[8]所示,Smith & Nolan评估了在爱尔兰手语中为虚拟人物增加通用情感的效果,发现基线虚拟人物与增强情感虚拟人物在理解度上差异不大。Gonçalves等人(2017)[3]提出了一种虚拟人物面部表情参数化方法,识别相关的面部标志和情感,以改进自动手语合成系统。[6]介绍了一种基于虚拟人物的韩国手语生成系统,结合了命名实体转换和上下文向量生成,以处理词汇外问题。尽管这些研究展示了整合情感表达和改进基于虚拟人物的手语系统的进展,但在实现自然且语言上准确的表示方面仍面临挑战。
先前研究[7]使用了融合数据集(SAVEE和RAVDESS,共2,459个样本,7种情感),随后采用MFCC预处理来编码谱-时特征。总体而言,他们采用CNN-LSTM混合架构进行语音情感识别,在测试集上达到61.07%的准确率,在训练集上达到75.31%。[2]提出了一个基于3D虚拟人物的手语学习系统,使用三个模块:通过IBM Watson进行语音到文本转换、通过词汇功能语法进行英语到ISL翻译,以及通过“动作列表”同步的基于Blender的3D虚拟人物动画,用于印度手语手势。情感表达丰富的AI虚拟人物能增强听障用户的沟通,提供可负担、可定制的口译服务,但也引发了伦理问题[1]。设计时考虑情感和用户独特需求至关重要,并强调将听障个体纳入开发过程[5]。
## 3 方法
### 3.1 概述
本研究提出了一种新颖且轻量级的多模态管道,用于将口语尼泊尔语翻译为带有情感感知渲染的手语手势。共享声学编码器从输入音频中同时执行自动语音识别和情感分类。系统的核心是一个统一架构,命名为 NEST-V1(尼泊尔情感与语音转换器 – 版本1),通过共享编码器对这两个任务进行联合参数化。
见图注:图1:NEST-V1 架构概览
### 3.2 数据集创建
数据集包含四个常用尼泊尔词汇——“谢谢”、“家”、“我”和“你好”——根据其对应对手语手势的性质进行选择。具体而言,“谢谢”和“我”是动态手势,涉及连续的手部动作;而“家”和“你好”是静态手势,具有固定的手部姿态。这种区分使得对以动作为中心和以姿态为中心的输出进行平衡评估成为可能。为确保鲁棒性和泛化能力,我们收集了所有手势-情感组合的音频样本。每位说话人提供12个音频样本,分别代表四个目标词汇,每个词汇以三种情感语调(高兴、悲伤、中性)说出。原始录音以 .m4a 和 .aac 格式捕获。使用 FFmpeg 和 Pydub 将文件标准化为 .wav 格式,以便与预处理和增强管道兼容。参与者的年龄范围在15至45岁之间,确保了年龄多样性。性别分布汇总于表2。
见图注:图2:动态手势:“我”和“谢谢”涉及多个手部动作。
见图注:图3:静态手势:“家”和“你好”使用单一手势。
### 3.3 数据集增强与音频特性
为增强多样性并增加音频样本数量,本研究采用了半音移位和声道长度扰动(VTLP)进行数据增强。四个手势类别的最终样本数量汇总于表4。此外,数据集可大致分为四个时长范围,详见表3。所有音频样本以 .aac 或 .m4a 格式收集,采样率分别为44,100 Hz和48,000 Hz。这些采样率在原始录音以及通过VTLP和半音移位处理后的增强样本中保持一致。
表1:各类手势的样本分布
表2:样本的情感维度和性别维度分布
表3:每个词汇类别的音频样本时长(秒)分布
#### 3.3.1 使用随机VTLP增强音频数据集
声道长度扰动(VTLP)通过扭曲音频信号的频率频谱来模拟声道长度的变化。对于每个采样率为 sr=44,100 Hz 或 48,000 Hz 的音频样本,我们使用FFT大小 N=2048 和跳跃长度 H=512 计算短时傅里叶变换(STFT)。频率轴使用随机扭曲因子 α∈{0.8, 0.9, 1.2, 1.3} 进行线性扭曲。标准声道长度归一化(VTLN)通常将 α 限制在 [0.8, 1.2] [4],而我们的目标是引入更大的多样性,因此将范围扩展到 [0.8, 1.3]。
见图注:图4:Mel频谱图对比:原始音频 vs. VTLP音频(α=0.8)
### 3.4 音频增强
1. 1. 重采样:所有音频文件从其原始采样率(44.1kHz/48kHz)重采样为16kHz。
2. 2. 固定时长:每个样本被裁剪或零填充至固定时长2秒(16kHz下32,000个样本),以处理时间变异性。
3. 3. 跳跃长度:选择跳跃长度为160个样本,相当于10ms:
$$\text{跳跃长度} = \text{采样率} \times \text{帧移} = 16,000 \times 0.010 = 160 \quad (1)$$
4. 4. FFT参数:FFT点数(n\_fft)设为320,窗口大小为20ms。
5. 5. 目标帧数:每个频谱图配置为恰好包含200帧,以确保统一尺寸。
6. 6. 归一化:每个波形归一化到范围 $[-1, 1]$。
所有频谱图随后被转换为尺寸为 $128 \times 200$ 的2D图像张量,其中:
- 128 对应Mel频率箱数量(垂直轴),
- 200 对应时间帧数量(水平轴)。
这种标准化允许在训练和推理过程中进行一致的批量处理。
表4:数据增强技术及产生的样本数量总结
### 3.5 模型架构
#### 3.5.1 概述
NEST-V1 将原始音频转换为视觉表示,使用Mel频谱图——随时间变化的频率模式的灰度图像。这些频谱图被分割成较小的块,并通过轻量级视觉转换器(ViT)主干。模型学习复杂的时间-频率关系,并使用单一统一架构执行关键词识别(如“Namaste”)和情感分类。通过将音频视为图像并利用转换器,我们在低资源条件下有效地管理多模态音频理解。
#### 3.5.2 技术实现
我们采用 ViT 风格的转换器处理音频频谱图,将其视为2D灰度图像。以下小节详细说明预处理、模型层和分类头部。
##### 输入表示
每个音频片段被转换为形状为 $128 \times 200$(Mel频带 × 时间帧)的Mel频谱图,通过双线性插值调整为 $128 \times 128$,以匹配视觉转换器的输入要求。这些频谱图被视为单通道(灰度)图像并进行归一化。
##### 块嵌入层
频谱图图像被分割成大小为 $16 \times 16$ 的不重叠块,产生64个块。使用卷积投影层(卷积核大小等于块大小 $16 \times 16$,步长16,输出通道768)对每个块进行嵌入:
```
Conv2D(1,768,kernel=16,stride=16)
```
块嵌入被展平并线性投影到维度 $D=768$。
一个可学习的 $[CLS]$ token 被预置用于分类,并添加可学习的位置嵌入以保留空间顺序:
$$\mathbf{Z}_0 = [\mathbf{z}_{\text{cls}}; \mathbf{z}_1; \dots; \mathbf{z}_{64}] + \mathbf{E}_{\text{pos}}$$
两种嵌入均使用截断正态分布初始化,标准差 $\text{std}=0.02$。
##### 转换器编码器
包含 $[CLS]$ token 的块序列通过 $L=3$ 个相同的转换器块的堆叠。每个块包含:
- 多头自注意力(12个头,每个头维度 $d=64$;总嵌入维度768)
- 注意力层和MLP前的前层归一化
- 带有GELU激活和4倍扩展的MLP(768 → 3072 → 768)
- 注意力层和MLP子层上的残差连接
- 正则化丢弃 $p=0.1$
这些层捕获时频空间中的局部和全局依赖关系,这对于理解语音和情感至关重要。
##### 分类头部
转换器编码器之后,仅使用 $[CLS]$ token 的表示进行分类。它通过最终层归一化和独立于每个任务的线性分类器:
$$\hat{\mathbf{y}}_{\text{task}} = \text{softmax}(\mathbf{W}_{\text{task}} \cdot \mathbf{z}_{\text{cls}} + \mathbf{b}_{\text{task}}) \quad (2)$$
使用两个并行头部:
- 情感分类(3类:高兴、中性、悲伤)
- 关键词分类(4类:“你好”、“谢谢”、“房子”、“我”)
这种设计支持多任务学习,同时共享公共特征提取器。
表5:用于音频-情感-虚拟人物管道的视觉转换器模型的最终超参数。
##### 为什么有效
该架构共同捕获:
- 通过Mel频率空间中的2D块捕获频谱结构
- 跨频谱图帧的时间演化
- 通过转换器自注意力捕获全局依赖关系
使其特别适用于从口语尼泊尔语音频进行情感和关键词识别等任务,即使训练数据有限。
表6:NEST-V1 与标准 ViT 的对比
### 3.6 实验设置
我们训练了一个定制的音频频谱图转换器(AST)模型用于音频分类,调整架构以平衡效率和性能。模型输入大小为 $128 \times 128$(单通道)的频谱图,分割成大小为 $16 \times 16$ 的不重叠块,线性投影为768维嵌入。转换器主干由3个编码器层组成,每层12个注意力头,后跟任务特定的分类头部。优化方面,我们使用 AdamW 优化器,初始学习率0.001,权重衰减0.1。采用余弦退火调度器(10个周期)在25个epoch上稳定训练。使用交叉熵损失作为训练相似文章
ZeroR@CHiPSAL 2026:基于对比学习的两阶段视觉-语言适配用于尼泊尔表情包分类
本文描述了一个用于尼泊尔表情包分类的两阶段视觉-语言适配系统,使用Qwen3-VL-8B-Instruct,结合LoRA微调和对比学习。该系统在CHiPSAL 2026共享任务中,在仇恨言论检测中排名第二,在情感分析中排名第四。
多语言预训练模型在尼泊尔自动语音识别中的比较分析
本文提出了一个受控基准,比较了六种多语言预训练ASR模型在尼泊尔语音上的表现,发现Whisper-Large-v3-Turbo和IndicWav2Vec表现最佳,而CTC解码器的推理速度最高可提升29倍。该研究为尼泊尔ASR提供了首个标准化的、考虑效率的参考数值。
手语对话中的情感识别
本文介绍了用于手语对话情感识别的eJSL Dialog数据集,填补了现有数据集缺乏对话上下文的空白。基准测试表明,应用通用多模态模型时存在领域差距,凸显了针对手语的上下文感知视觉提取器的必要性。
评估主动式对话智能体中的多模态情绪识别:一项用户研究
本文介绍了一个用于主动对话智能体的多模态情绪识别模块,该模块结合了面部识别与语言分析。一项涉及20名参与者的用户研究发现了一种“扑克脸”效应,即视觉线索不可靠,而语言分析则更为准确;研究还表明,智能体可以通过对话适应性来引发情绪。
NepOOC-M: 双语尼泊尔语-英语基准与多模态架构用于OOC检测的比较分析
本文介绍了NepOOC,这是首个面向尼泊尔语主导的多语言基准,用于检测脱离上下文的虚假信息,并评估了多模态架构,发现纯文本模型表现出色。