Interspeech 2026 MLC-SLM 挑战赛任务2的Eloquence提交

arXiv cs.CL 论文

摘要

本文详细介绍了Eloquence团队在Interspeech 2026 MLC-SLM挑战赛任务2中的方法,该任务涉及使用语音LLMs进行多语言多选问答,结合微调、上下文学习和检索系统。

arXiv:2609.11724v1 公告类型:新 摘要:本文详述了Eloquence团队针对Interspeech 2026第二届MLC-SLM挑战赛任务2的方法,该任务涉及21种语言的多语言多选题问答(MCQA)。我们探讨了三种方法。首先,我们通过LoRA对Voxtral-Mini-3B进行微调,使用跨语言数据增强、ASR转录增强和时间戳感知音频裁剪,在评估阶段2达到0.72的宏平均准确率。其次,我们对冻结的Voxtral-24B模型应用多模态上下文学习(ICL)以校正强烈的标签偏差,达到0.81的最佳结果。第三,一个基于三层语音锚定记忆的无需训练检索系统,结合声学身份、语义内容和知识图谱,达到0.68。所有三种系统都显著优于官方基线。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:33

# Interspeech 2026 MLC-SLM 挑战赛任务二 Eloquence 团队参赛方案
来源:https://arxiv.org/html/2609.11724
Luque Concina Matassoni Brutti Vella

###### 摘要

本文详细阐述了 Eloquence 团队在 Interspeech 2026 第二届 MLC-SLM 挑战赛任务二(涉及21种语言的多语种多选问答(MCQA))中的解决方案。我们探索了三种方法:第一,通过 LoRA 对 Voxtral-Mini-3B 模型进行微调,并采用跨语言数据增强、ASR 转录文本增强以及带时间戳感知的音频裁剪,在评估阶段2达到了0.72的宏平均准确率。第二,将多模态上下文学习(ICL)应用于冻结的 Voxtral-24B 模型,以校正强烈的标签偏差,达到了0.81的最佳结果。第三,提出一个无需训练的检索系统,该系统基于三层声音锚定记忆,结合了声学身份、语义内容和知识图谱,取得了0.68的准确率。所有三个系统都显著超越了官方基线系统。

###### 关键词

语音大语言模型,多选问答,标签偏差缓解,上下文学习,检索增强生成,语音识别

††地址:1Telefónica Innovación Digital,科学小组
2Bruno Kessler 基金会
3意大利国家研究委员会††邮箱:jordi\.luque@telefonica\.com, \{lconcina, brutti, matasso\}@fbk\.eu, filippo\.vella@icar\.cnr\.it## 1引言

大型语言模型(LLMs)的最新进展推动了向语音大语言模型的广泛转变,这些模型将语音感知和语言理解统一在一个单一模型中,超越了以转录为中心的管道[1 (https://arxiv.org/html/2609.11724#bib.bib1), 2 (https://arxiv.org/html/2609.11724#bib.bib2)],转向能够对口语交互的声学和语义内容进行推理的系统[3 (https://arxiv.org/html/2609.11724#bib.bib3), 4 (https://arxiv.org/html/2609.11724#bib.bib4), 5 (https://arxiv.org/html/2609.11724#bib.bib5), 6 (https://arxiv.org/html/2609.11724#bib.bib6), 7 (https://arxiv.org/html/2609.11724#bib.bib7), 8 (https://arxiv.org/html/2609.11724#bib.bib8)]。然而,现实世界的对话式语音[9 (https://arxiv.org/html/2609.11724#bib.bib9), 10 (https://arxiv.org/html/2609.11724#bib.bib10)]与朗读或单说话人录音有显著不同:它包含重叠的对话轮次、非流利现象以及多个说话人,并且在训练资源在不同语言间分布不均的多语言环境中,这种复杂性更加突出[11 (https://arxiv.org/html/2609.11724#bib.bib11)]。多语言对话语音语言模型(MLC-SLM)挑战赛[12 (https://arxiv.org/html/2609.11724#bib.bib12)]旨在通过发布大规模、真实世界的多语言对话语音数据以及统一的评估协议来解决这一差距。第一届赛事表明,当前的语音大语言模型在很大程度上解决了转录准确性问题,而说话人分割和更深层次的对话理解仍然是开放性问题;基于这些发现,第二届赛事扩大了语言覆盖范围,并将重点转移到说话人分割、声学理解以及完整对话的语义理解上111https://www\.nexdata\.ai/competition/mlc\-slm\。

本文报告了 Eloquence 团队参加第二届 MLC-SLM 挑战赛任务二(*多语言对话语音理解*)的情况。任务二要求系统回答多项选择题,以探究整个多人对话的声学属性(如说话人特征、情感)和语义内容[13 (https://arxiv.org/html/2609.11724#bib.bib13), 14 (https://arxiv.org/html/2609.11724#bib.bib14)]。至关重要的是,评估时没有先验信息可用:没有预分割的语音段,没有说话人标签,也没有真实的说话人分割结果,因此一个完整的系统必须直接从原始录音中解析谁在说话、说了什么以及怎么说。该任务对架构选择持开放态度,鼓励基于管道和端到端的解决方案,并评估系统整体回答对话相关问题的能力。我们为任务二提交了三个系统,从不同角度解决问题。第一个系统(在第3节 (https://arxiv.org/html/2609.11724#S3) 中描述)使用 LoRA 对 Voxtral-Mini-3B 进行了微调,并采用了跨语言数据增强、ASR 转录文本增强和带时间戳感知的音频裁剪。第二个系统(在第4节 (https://arxiv.org/html/2609.11724#S4) 中描述)将上下文学习应用于冻结的 Voxtral-24B 语音大语言模型,以在不进行任何参数更新的情况下校正强烈的标签偏差。第三个系统(在第5节 (https://arxiv.org/html/2609.11724#S5) 中描述)将任务重新定义为检索问题:它不通过训练来适配语音大语言模型,而是为冻结的大语言模型配备一个持久化的、基于声音的记忆层,在推理时进行查询。

参考插图图1:1141\_006 澳大利亚英语对话摘录。
## 2挑战与基线描述

MLC-SLM 挑战赛专注于大语言模型及其在不同语言和上下文中的适应能力。大语言模型在许多任务中展现的卓越成果,在特定上下文或多语言环境中难以复制,因为在这些环境中,某些资源可能稀缺且难以获取。该挑战赛提供了一个真实世界的多语言对话语音数据集(见图1 (https://arxiv.org/html/2609.11724#S1.F1)),旨在为能够在多语言、动态且上下文丰富的环境中自然回应人类对话者的语音模型奠定基础。该数据集包含多样化的对话风格,并捕捉了人类对话的复杂性,包括停顿、打断和说话人重叠。第一届挑战赛包含11种语言,其中包括五种英语地区变体[12 (https://arxiv.org/html/2609.11724#bib.bib12)]。第二届 MLC-SLM 挑战赛(组织者描述为比第一届更具挑战性)扩展了语言覆盖范围,新增了他加禄语、乌尔都语和土耳其语,以及加拿大法语、墨西哥西班牙语和巴西葡萄牙语的地区方言。任务一侧重于多语言对话语音分割和识别,而任务二(我们的系统所针对的任务)则侧重于多语言对话语音理解。提供的训练集和开发集是使用 Gemini2\.5\-Pro 构建的,这是一个多语种多选问答任务,涉及训练集和开发集的声学和语义理解。组织者通过 Github222https://github.com/DontPushMeee/MLC-SLM-2nd-Task2-Baseline 提供了一个基线系统,其中使用 ms\-swift 工具包[15 (https://arxiv.org/html/2609.11724#bib.bib15)] 对 Qwen2\.5\-Omni\-7B 进行了微调。挑战赛的评估集采用类似流程构建为语音理解的多项选择题,并通过额外的人工审查对任务进行排序。

## 3微调语音大语言模型

### 3\.1模型与训练设置

我们使用 LoRA[17 (https://arxiv.org/html/2609.11724#bib.bib17)](r=16r\{=\}16,α=32\\alpha\{=\}32, 所有线性模块) 在 4×\\timesH100\-64 GB GPU 上对 Voxtral-Mini-3B-2507[16 (https://arxiv.org/html/2609.11724#bib.bib16)]进行了微调(有效批量大小为 32,学习率为 2×10−52\{\\times\}10^\{\-5\},采用线性衰减)。每个实例是一个单轮对话,在用户轮次中放置音频和 MCQ 文本;模型输出一个对应答案的单个字母(A–D)。由于所有提供的音频文件都出现在挑战赛的评估集中,过度微调会导致会话记忆。我们将训练限制在 0\.25×0\.25\\times 个 epoch,并选择在记忆效应发生前泛化差距最小的检查点。

### 3\.2跨语言数据增强

使用 langdetect[18 (https://arxiv.org/html/2609.11724#bib.bib18)],我们估计评估集包含约≈\{\\approx\}52% 的跨语言问题对(非英语音频,英语问题),而训练数据中没有此类覆盖。为解决这一不匹配问题,我们通过 NLLB-200[19 (https://arxiv.org/html/2609.11724#bib.bib19)]将非英语的问题和选项翻译成英语(屏蔽音频引号,保留用于多语言语义问题的本族语术语),并在原始数据+翻译副本的*混合*数据集(6,630 个问题,对应 124 个文件,保留 25 个文件用于验证)上进行训练。

### 3\.3ASR转录文本增强与音频裁剪

我们通过微调 Voxtral-Mini-3B 作为 LoRA ASR 模型来生成转录文本:首先在 MLC25 数据上训练一个种子模型,然后在六个新的 MLC26 语言上通过过采样预训练进行适配延续。适配后的模型将 MLC26 新语言的词错误率(WER)从 26\.2% 降低到 15\.2%,在新语言上取得了显著改进(表1 (https://arxiv.org/html/2609.11724#S3.T1))。音频会话被分割为1分钟的段,并采用循环检测以减轻幻觉问题。转录文本以“转录文本:\{text\}”的形式前置到 MCQ 提示中以进行增强。

表 1:WER \(%\) Seed 与适配后 Voxtral ASR 对比。Δ\\Delta= 适配后−\-种子。MLC25:官方测试集;MLC26(†):开发集。开发集中大约 51% 的问题包含指向包含答案的音频片段的时间戳引用。为了提高训练和推理效率,并鼓励语音大语言模型关注特定音频内容,我们将音频裁剪到这些自动检测时间戳的±30\\pm 30 秒窗口内。这种方法在阶段1取得了 0\.85 的最佳分数。微调组件的消融研究见表2 (https://arxiv.org/html/2609.11724#S3.T2),报告了在阶段1提交的结果。

表 2:阶段1微调组件消融研究。

## 4基于语音大语言模型的上下文学习

我们检测到 Voxtral 两种模型尺寸都存在系统性的 A 类预测偏差。24B 基线模型在 63% 的问题中预测 A 类,而只有 2% 预测 D 类。

### 4\.1上下文学习

在目标问题前附加已解决的 MCQ 示例,即少样本上下文学习(ICL),可以校正 24B 模型在英语音频/英语问题上的偏差。仅两个文本示例就将 A 类预测从 63% 转移到 44%,并将准确率提高了 +5\.1 个百分点;扩展到六个多模态示例又额外增加了 +1\.5 个百分点,达到了我们的最佳分数 0\.8095(表3 (https://arxiv.org/html/2609.11724#S4.T3))。请注意,所有评估实例都使用同一组 ICL 示例,这些示例完全来自训练集中的英语示例。我们假设采用多语言特定的 ICL 策略可能进一步提高性能。每个多模态示例在用户轮次中放置一个 30 秒的音频片段,带有音频焦点前缀和 MCQ 文本;助手轮次是单独的答案字母。对于四选项问题,四个示例覆盖了从保留音频中提取的每个答案标签(A、B、C、D)的一个实例,确保模型观察到所有四个标签作为有效输出。对于二选项(A/B)问题,则使用两个示例。

表 3:预测标签分布和阶段2准确率(9,470 个问题)。所有系统在推理时使用 30 秒裁剪音频,且不将 ASR 转录文本作为增强上下文。mm 代表多模态示例。
### 4\.2推理时校准

我们还评估了一种称为先验校准(CBU,[20 (https://arxiv.org/html/2609.11724#bib.bib20)])的推理时校准策略,该策略减去空提示的对数概率以消除位置先验。当应用于 ICL-2 时,该方法达到了与基线 ICL-2 相同的准确率(≈\\approx 0\.795),这表明仅上下文学习就足以校正 24B 模型的位置偏差。

## 5无需训练的检索方法

### 5\.1基于声音的记忆层

我们的第三种方法不将任务二视为模型训练问题,而是视为一个*检索*问题。我们使用一个持久化的、基于声音的记忆层,为标准大语言模型提供跨会话记忆、语义内容记忆以及一个包含事实和关系的知识图谱[21 (https://arxiv.org/html/2609.11724#bib.bib21)],且无需训练任何组件。我们将语音会话注册到我们的系统中,然后在查询时从中检索回答问题所需的上下文。将音频文件注册到此记忆层是通过注册管道完成的:首先通过说话人分割将多人对话按语句分割,然后由通过 vLLM[22 (https://arxiv.org/html/2609.11724#bib.bib22)] 提供的单一语音大语言模型 Voxtral Mini 3B[16 (https://arxiv.org/html/2609.11724#bib.bib16)] 完成整个音频前端处理:每次语句调用返回转录文本、语言、性别、年龄以及声学和文本情感标签。所有这些提取的信息都被结构化存储在记忆层中。该层随后在运行时被查询,以组装一个结构化的*事实单*,交给一个冻结的、可更换的下游大语言模型,并帮助其基于检索到的信息回答问题;整个系统在推理时由预训练模型组成。此方法使我们只需注册一次多人对话,就能高效地回答所有相关问题,无需多次处理音频文件。在这些实验中,我们使用了大语言模型 Qwen3-14B-AWQ333https://huggingface.co/Qwen/Qwen3-14B-AWQ\。

共享语句标识符。记忆层组织为三个持久化存储层(如图2 (https://arxiv.org/html/2609.11724#S5.F2) 所示):声学身份层 LacL\_\{\\mathrm\{ac\}\}、语义内容层 LsemL\_\{\\mathrm\{sem\}\} 和知识图谱层 LkgL\_\{\\mathrm\{kg\}\}。系统摄取的每个轮次——无论是来自多人录音的说话人分割结果还是聊天轮次——在摄取时都被分配一个唯一的 UUID uu,该 UUID 作为主键传播到记录它的所有层中。对于音频语句 uu,在说话人嵌入写入 LacL\_\{\\mathrm\{ac\}\} 时生成,并在 LsemL\_\{\\mathrm\{sem\}\} 中用作记录 ID,在 LkgL\_\{\\mathrm\{kg\}\} 中用作语句节点标识符;聊天轮次跳过 LacL\_\{\\mathrm\{ac\}\},并在 LsemL\_\{\\mathrm\{sem\}\} 中生成 uu。不变的原则是:每当两层存储关于同一语句的信息时,它们都使用相同的键进行存储,因此跨层引用通过直接查找而非近似匹配来解析。

声学身份(LacL\_\{\\mathrm\{ac\}\})。对于每个语句,使用 Titanet-Large[23 (https://arxiv.org/html/2609.11724#bib.bib23)]提取一个192维的说话人嵌入,并存储在持久化的 ChromaDB 集合中。记录被标记为 *注册*数据(已知说话人的持久身份配置文件)或 *探测*数据(在单次查询会话期间产生的临时嵌入)。在查询时,该层支持 *识别*(通过 Top-k 余弦检索将探测嵌入与已注册配置文件进行比较,并返回相似度阈值以上的最接近身份)和 *解析*(将探测嵌入与同一会话中的其他探测嵌入进行匹配,以便将同一未知说话人的片段链接起来)。

音频记录\(说话人分割→\\tosegments\)对话会话\(用户/助手轮次\)UUIDuuLacL\_\{\\mathrm\{ac\}\}:声学身份TitaNet 192维嵌入ChromaDBLsemL\_\{\\mathrm\{sem\}\}:语义内容MiniLM 384维嵌入ChromaDBLkgL\_\{\\mathrm\{kg\}\}:知识图谱NetworkX, 类型化 FACTs元情感元情感元用户问题\(\+ 可选的探测音频\)检索事实单说话人 \+ 内容\+ 事实 \+ 情感大语言模型答案注册写入/问题流检索读取跨层属性图2:系统架构。每个语句在摄取时获得一个 UUID uu。音频输入

相似文章