针对第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

arXiv cs.CL 论文

摘要

本文介绍了第二届MLC-SLM挑战赛的技术,包括随机前置静音裁剪和合成数据生成,以提升多语言对话语音任务,实现了准确率提升和错误率降低。

arXiv:2608.14150v1 公告类型:新 摘要:第二届多语言对话语音语言模型(MLC-SLM)挑战赛评估了两项任务,基于完整的、未分段的多语言对话:说话人分割与识别(任务1)和对话语音理解(任务2)。两项任务在评估时均不提供预言性的话语边界或说话人标签,且任务2不提供问答训练集。对于任务1,我们使用随机前置静音裁剪、一致的时间戳修正和指数移动平均(EMA)训练策略对VibeVoice-ASR-7B进行微调。对于任务2,我们通过多模态候选生成、静音音频过滤和分布匹配增强来构建合成问答对,并对Qwen3-Omni-30B-A3B-Instruct进行微调以实现标记直接回答。在任务1的评估集上,裁剪将tcpMER从18.30%降低到17.27%,EMA进一步将其降低到16.73%。在任务2的评估集上,联合应用分布匹配增强和标记直接回答将准确率从83.0%提高到86.0%。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:53

# 基于前置静音增强与多阶段合成监督的第二届 MLC-SLM 挑战赛  
来源:https://arxiv.org/html/2608.14150  

###### 摘要  
第二届多语言对话语音语言模型(MLC-SLM)挑战赛评估两项针对完整、未分段多语言对话的任务:说话人日志与识别(任务1)以及对话语音理解(任务2)。两项任务在评估时均不提供参考语音段落边界或说话人标签,且任务2不提供问答训练集。对于任务1,我们通过随机前置静音裁剪、一致的时间戳校正以及指数移动平均(EMA)训练策略对 VibeVoice-ASR-7B 进行微调。对于任务2,我们通过多模态候选生成、静音过滤与分布匹配增强构建合成问答对,并对 Qwen3-Omni-30B-A3B-Instruct 进行带标签直接回答的微调。在任务1评估集上,裁剪使 tcpMER 从 18.30% 降至 17.27%,EMA 进一步将其降至 16.73%。在任务2评估集上,联合应用分布匹配增强与带标签直接回答将准确率从 83.0% 提升至 86.0%。  

††地址:¹蚂蚁集团,²电子科技大学  
††邮箱:[email protected][email protected]  
††脚注:*这些作者对本工作贡献均等。  
索引术语:多语言对话语音,说话人日志,自动语音识别,口语理解,合成监督  

## 1 引言  
参见图注  
图1:我们的任务1系统概览,保留原始 VibeVoice-ASR 骨干网络,增加随机前置静音裁剪与一致的时间戳校正。  

第二届多语言对话语音语言模型(MLC-SLM)挑战赛评估两项针对完整、未分段多语言对话的任务。任务1结合说话人日志与识别,而任务2通过单选问答评估声学、语义及声学-语义联合理解能力。评估时,两项任务均不提供参考语音段落边界或说话人标签,且任务2仅提供开发样例而非问答训练集\[1 (https://arxiv.org/html/2608.14150#bib.bib1)\]。这些设置结合了长时说话人属性转录与监督稀缺的对话级音频理解。任务1与端到端说话人属性ASR密切相关,该模型联合预测转录文本与说话人信息,并可扩展至连续录音及词级时间戳\[2 (https://arxiv.org/html/2608.14150#bib.bib2),3 (https://arxiv.org/html/2608.14150#bib.bib3),4 (https://arxiv.org/html/2608.14150#bib.bib4)\]。缺乏参考边界的长时录音仍具挑战性\[5 (https://arxiv.org/html/2608.14150#bib.bib5)\]。我们保留单次前向的 VibeVoice-ASR-7B 骨干网络\[6 (https://arxiv.org/html/2608.14150#bib.bib6)\],仅修改微调部分:随机前置静音裁剪改变时间起点,一致的时间戳校正保持标注对齐,EMA训练策略跟踪可训练参数。任务2必须从发布的音频中构建任务匹配的监督信号。长时音频模型在完整录音的定位、时间推理、计数及非音素信息处理上仍存在困难\[7 (https://arxiv.org/html/2608.14150#bib.bib7)\]。大规模合成音频问答语料及长音频问答数据支撑了指令调优的音频理解\[8 (https://arxiv.org/html/2608.14150#bib.bib8),9 (https://arxiv.org/html/2608.14150#bib.bib9)\],但音频贡献过滤表明部分多选题即使替换音频为静音仍可回答\[10 (https://arxiv.org/html/2608.14150#bib.bib10)\]。因此我们生成候选问答对,应用静音过滤与分布匹配增强,并微调 Qwen3-Omni-30B-A3B-Instruct\[11 (https://arxiv.org/html/2608.14150#bib.bib11)\]以实现带标签直接回答。每项任务仅提交一个预测模型,不使用模型级、分数级或输出级融合。  

主要贡献与发现如下:  
- • 在任务1的累积消融实验中,LoRA基线获得18.30%的tcpMER;添加带时间戳校正的前置静音裁剪后降至17.27%,进一步添加EMA后降至16.73%。  
- • 任务2的流程生成约12.7万合成样本。在评估集上,结合分布匹配增强与带标签直接回答的最终累积配置将准确率从83.0%提升至86.0%。  

## 2 系统描述  
### 2.1 任务1:多语言对话语音日志与识别  
#### 2.1.1 骨干网络与任务形式  
我们采用 VibeVoice-ASR-7B 作为任务1骨干网络。该模型支持最长60分钟录音、超过50种语言及语码转换\[6 (https://arxiv.org/html/2608.14150#bib.bib6)\],适用于多语言对话语音。我们在完整挑战赛录音上微调模型,并将预测结果直接序列化为官方输出格式。我们保留原始架构与单次前向形式。单次前向中,模型编码完整录音并输出时间排序的转录文本、说话人身份与时间戳序列。我们的修改仅影响微调环节,解码器架构与输出格式保持不变。  

图1 (https://arxiv.org/html/2608.14150#S1.F1)总结了系统流程。  

#### 2.1.2 随机前置静音裁剪  
现有ASR增强方法通常扰动波形速度\[12 (https://arxiv.org/html/2608.14150#bib.bib12)\]或在声学特征中遮蔽时频区域\[13 (https://arxiv.org/html/2608.14150#bib.bib13)\]。随机前置静音裁剪则针对时间起点与前置非语音上下文的变化,同时保留已标注语音。由于不同录音中首个标注语音前的非语音音频时长不同,我们微调时随机移除该区域部分片段。  

对于时长为 \(T\) 且首个标注片段起始于 \(s_{1}\) 的录音,我们根据训练时裁剪策略采样裁剪时长 \(\delta\)(满足 \(0 \leq \delta \leq s_{1}\)),并移除区间 \([0, \delta)\)。裁剪后,所有标注时间戳按相同偏移量调整:  

\(s_{i}^{\prime}=s_{i}-\delta, \qquad e_{i}^{\prime}=e_{i}-\delta, \qquad T^{\prime}=T-\delta.\) (1)  

约束 \(\delta \leq s_{1}\) 确保不移除已标注语音。统一的偏移保持转录文本、说话人标签、对话轮次顺序、片段时长与相对时序不变;仅前置非语音上下文、绝对时间起点及总录音时长发生变化。该增强通过改变现有样例的时间呈现方式,而非合成新对话或扰动说话人轮次内部边界。因此累积消融实验测量了前置静音增强的效果,但未直接验证对轮次边界错误的鲁棒性。  

参见图注  
图2:任务2合成监督流程:候选生成、静音过滤、分布匹配增强与统一指令格式序列化。  

#### 2.1.3 EMA训练策略  
微调过程中,我们维护可训练参数的指数移动平均\[14 (https://arxiv.org/html/2608.14150#bib.bib14)\]。在优化器步 \(t\) 后,EMA状态更新为:  

\(\bar{\boldsymbol{\theta}}_{t}=\lambda \bar{\boldsymbol{\theta}}_{t-1}+(1-\lambda) \boldsymbol{\theta}_{t},\) (2)  

其中 \(\boldsymbol{\theta}_{t}\) 表示当前可训练参数,\(\bar{\boldsymbol{\theta}}_{t}\) 表示EMA状态,\(\lambda\) 为衰减系数。我们设置 \(\lambda=0.99\),并在整个微调过程中每次优化器步后更新EMA状态。EMA应用于整个微调阶段,不改变解码或输出序列化方式。  

表1 (https://arxiv.org/html/2608.14150#S3.T1)报告了在随机前置静音裁剪基础上添加EMA的累积配置结果。  

#### 2.1.4 训练配置  
我们使用低秩自适应(LoRA)\[15 (https://arxiv.org/html/2608.14150#bib.bib15)\]微调 VibeVoice-ASR-7B。LoRA秩、缩放因子与dropout概率分别设为32、128与0.05,训练持续5个epoch。16个数据并行worker中,每个设备batch size为1,配合4步梯度累积,全局有效batch size为64。优化配置包括学习率 \(1\times 10^{-4}\)、预热比例0.03、权重衰减0.01以及最大范数为1.0的梯度裁剪。我们通过梯度检查点\[16 (https://arxiv.org/html/2608.14150#bib.bib16)\]、bfloat16计算与DeepSpeed ZeRO-2\[17 (https://arxiv.org/html/2608.14150#bib.bib17)\]降低内存消耗。随机前置静音裁剪、时间戳校正与EMA训练策略在整个微调阶段保持启用。  

### 2.2 任务2:多语言对话语音理解  
#### 2.2.1 基础模型与预测格式  
Qwen2-Audio展示了通用音频分析与指令条件交互能力,属于通义千问音频-语言模型系列\[18 (https://arxiv.org/html/2608.14150#bib.bib18)\]。遵循这一趋势,我们的任务2系统采用 Qwen3-Omni-30B-A3B-Instruct 作为唯一预测模型\[11 (https://arxiv.org/html/2608.14150#bib.bib11)\]。每个实例格式为用户消息,包含完整对话音频、单选问题、2-4个候选选项及将答案置于标签内的指令。模型直接处理原始对话音频,不依赖外部生成的转录文本,因此可同时访问词汇内容与非词汇声学线索。带标签答案格式提供一致的监督目标,便于评估时统一提取预测结果。  

图2 (https://arxiv.org/html/2608.14150#S2.F2)总结了完整的任务2流程。  

#### 2.2.2 合成训练数据  
**候选生成**:当任务特定监督稀缺时,合成指令生成提供可扩展的替代方案\[19 (https://arxiv.org/html/2608.14150#bib.bib19)\],先前音频-语言研究已将此策略扩展至大规模问答语料\[8 (https://arxiv.org/html/2608.14150#bib.bib8)\]。我们使用 Gemini 2.5 Pro\[20 (https://arxiv.org/html/2608.14150#bib.bib20)\]从发布的训练音频中生成约21万候选问答对。提示遵循已发布开发样例的问题类型、语言、时间戳风格及必需的2-4选项单选格式。  

**静音过滤**:部分生成的问题可能依赖文本先验或选项 artifacts 而非相关对话中的证据。当音频与文本冲突时,音频-语言模型可能偏向文本输入\[21 (https://arxiv.org/html/2608.14150#bib.bib21)\],近期音频-问答研究已识别出音频贡献极少或无贡献的多选题,并使用音频贡献过滤进行分离\[10 (https://arxiv.org/html/2608.14150#bib.bib10)\]。为减少此类情况,我们使用 Qwen2.5-Omni-7B\[22 (https://arxiv.org/html/2608.14150#bib.bib22)\]作为反事实过滤器。对每个候选,保留问题、选项与预期答案,但将原始音频替换为静音。丢弃仍能正确回答的候选,保留预测结果变错的候选。此流程保留约6.7万对(占候选池32%)。它增加了保留问题依赖音频证据的可能性,但本身不保证声学 grounding。  

**分布匹配增强**:基于翻译的多语言音频问答此前已通过问题语言翻译扩展音频-问答语料\[23 (https://arxiv.org/html/2608.14150#bib.bib23)\]。相对于已发布开发样例,评估输入平均选项更长(77.9字符 vs 38.0字符),且部分非英语对话配对英语问题与选项。基于这些聚合的无标签输入属性,我们翻译选定训练问题并合成带长选项样例,生成约6万额外实例。评估集中的问题、选项集或答案未复制到训练数据中。  

**序列化**:所有保留与增强样例转换为统一的聊天风格模式。训练时用户消息包含音频占位符、问题、候选选项与输出指令,助手消息仅包含由标签包裹的标准答案。评估时模型仅接收用户消息。  

#### 2.2.3 训练、推理与挑战合规性  
我们使用LoRA\[15 (https://arxiv.org/html/2608.14150#bib.bib15)\]微调Qwen3-Omni。LoRA参数、视觉Transformer(ViT)与模态对齐器保持可训练,其余参数冻结。训练使用学习率 \(5\times 10^{-5}\) 持续2个epoch,微批量大小为4,16个加速器设备上全局批量大小为64。推理时禁用采样,实现中将温度设为0.0。标签内文本作为预测结果提取。每项任务提交由单一训练模型生成,不进行模型级、分数级或输出级融合。  

Gemini 2.5 Pro与Qwen2.5-Omni仅用于离线任务2数据构建流程,而提交的每项任务2预测均由Qwen3-Omni独立生成。Qwen检查点已公开发布\[11 (https://arxiv.org/html/2608.14150#bib.bib11),22 (https://arxiv.org/html/2608.14150#bib.bib22)\]并披露;Gemini 2.5 Pro仅在允许的任务2商业API例外情况下使用\[1 (https://arxiv.org/html/2608.14150#bib.bib1)\]。  

## 3 实验与结果  
### 3.1 评估协议  
任务1使用官方评分器与基线配置\[24 (https://arxiv.org/html/2608.14150#bib.bib24)\]。说话人日志错误率(DER)首先确定参考说话人与假设说话人间的最优排列。说话人映射后,识别流使用tcpCER(针对日语、韩语和泰语)与tcpWER(针对其他所有语言)评估,采用官方5秒容忍区间\[24 (https://arxiv.org/html/2608.14150#bib.bib24)\];指标计算使用MeetEval\[25 (https://arxiv.org/html/2608.14150#bib.bib25),26 (https://arxiv.org/html/2608.14150#bib.bib26)\]。我们报告跨语言平均值tcpMER,值越低表示性能越好。  

任务2使用单选问答准确率评估对话理解。每个问题包含2-4个选项,有且仅有一个正确答案,可能需要声学、语义或声学-语义联合证据。仅评估分数贡献最终挑战赛排名\[1 (https://arxiv.org/html/2608.14150#bib.bib1)\]。  

### 3.2 任务1结果  
表1 (https://arxiv.org/html/2608.14150#S3.T1)总结了使用官方tcpMER指标评估的三个累积任务1配置,值越低越好。  

表1:官方tcpMER协议下的累积任务1消融实验。值越低越好。  

配置及其观察到的变化如下:

相似文章

如何利用合成语音构建基于LLM的ASR系统?

arXiv cs.CL

本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。

基于对比 LLM 微调对齐对话附和信号与语境表征

arXiv cs.CL

KTH Royal Institute of Technology 的研究人员提出了一种两阶段框架,通过在对话转写文本上微调 LLMs,并结合对比学习构建联合嵌入空间,以实现对对话附和信号与语境的精准对齐。结果表明,相较于以往方法,该方案显著提升了语境与附和信号的匹配检索性能。