Raon-Speech 技术报告
摘要
Raon-Speech是一个9B参数的语音语言模型,支持英语和韩语的理解、回答和生成,并具有全双工扩展Raon-SpeechChat,可实现自然的实时对话。它在42个基准测试上取得了强劲的性能,并且完全开源。
arXiv:2605.23912v1 公告类型:新
摘要:我们提出了Raon-Speech,一个表现卓越的9B参数语音语言模型(SpeechLM),用于英语和韩语的语音理解、回答和生成,以及Raon-SpeechChat,一个高性能的全双工扩展,用于自然的实时对话。
Raon-Speech成功地将预训练的大语言模型(LLM)转变为既能理解又能生成语音,同时保留强大文本能力的语音语言模型。
它在138万小时精心整理的英语和韩语语音及文本数据集上进行训练,训练阶段如下:(1)语音模块对齐,(2)结合知识蒸馏的端到端SpeechLM预训练,(3)基于多任务偏好优化的后训练。
在42个英语和韩语语音及文本基准测试中,与包括Qwen2.5-Omni和Fun-Audio-Chat在内的八个近期同等规模的音频基础模型相比,Raon-Speech在语音中心任务上建立了最强的整体表现,同时保持了强大的文本问答能力。
在此基础上,Raon-SpeechChat通过在11.9万小时时间对齐的真实与合成对话数据上进行持续训练,实现了自然的全双工对话。
它通过三个互补的训练阶段进行:(1)因果编码器适配,(2)全双工预训练,(3)用于语音和角色控制的全双工微调。
在多个全双工基准测试中,Raon-SpeechChat在FDB v1.0覆盖的轮流发言和中断敏感行为上展现出最明显的优势,并在更广泛的全双工评估套件中保持竞争力。
我们开源了所有模型检查点、训练和推理流程以及一个交互式演示。
查看缓存全文
缓存时间: 2026/05/26 08:58
# Raon-Speech 技术报告 来源:https://arxiv.org/html/2605.23912 \\uselogo\\DTMsetstyle iso\\paperdate\\DTMtoday ###### 摘要 我们提出了 **Raon-Speech**,一个在英语和韩语语音理解、问答和生成方面表现出色的 9B 参数语音语言模型(SpeechLM),以及 **Raon-SpeechChat**,一个用于自然实时全双工对话的高性能扩展。Raon-Speech 成功地将一个预训练的 LLM 转变为既能理解又能生成语音,同时保留强大文本能力的 SpeechLM。它在 138 万小时经过高度筛选的英语和韩语语音及文本数据集上进行训练,训练阶段包括:(1) 语音模块对齐,(2) 基于知识蒸馏的端到端 SpeechLM 预训练,以及 (3) 基于多任务偏好优化的后训练。在 42 个英语和韩语语音及文本基准测试中,Raon-Speech 在与八个近期相似规模音频基础模型(包括 Qwen2.5-Omni 和 Fun-Audio-Chat)的比较中,在语音任务上取得了最强的综合表现,同时保留了强大的文本问答能力。在此基础上,Raon-SpeechChat 通过在 11.9 万小时时间对齐的真实与合成对话数据上进行持续训练,实现了自然的全双工对话。它通过三个互补的训练阶段进行:(1) 因果编码器适配,(2) 全双工预训练,(3) 用于语音和角色控制的全双工微调。在多个全双工基准测试上,Raon-SpeechChat 在 FDB v1.0 涵盖的轮流发言和对打断敏感的行为中展现出最明显的优势,并在更广泛的全双工评估套件中保持竞争力。我们开源所有模型检查点、训练和推理流程以及一个交互式演示。 11footnotetext:†完整作者列表见作者署名与贡献分配章节。 ## 1 引言 语音在人类认知中扮演着核心角色 [hickok2012computational]。通过口语,人类可以感知环境、表达意图并实时互动,从而形成复杂、动态且高度社会化的系统。语音的核心地位日益体现在现代计算中,从车载语音助手、游戏智能体,到基于语音的机器人控制和计算机使用 [clark2019state, arora2025landscape]。因此,人们越来越有兴趣开发支持更类人通信的交互式语音语言系统。与文本不同,语音不仅承载语言内容,还包含韵律、时机和轮流发言等对自然交互至关重要的线索。语音语言模型(SpeechLM)正成为实现这一目标最有希望的途径。通过将大语言模型(LLM)的强大语言能力扩展到语音模态,它们实现了自然且高质量的口语交互 [defossez2024moshi, goel2025audioflamingo, team2025fun]。然而,当前模型与实际部署之间仍存在差距。轻量级模型(即 100 亿参数以下)在英语之外仍难以提供高质量的多语言语音交互,而全双工模型在时间感知和交互自然性方面仍然有限,特别是在需要精细实时通信的环境(如动态游戏 [chang2025game])中。实际部署还需要低延迟、稳健的打断处理以及连贯的轮流发言,这些对当前的 SpeechLM 来说仍是挑战。 本文中,我们提出了 **Raon-Speech**,一个 9B 参数的语音语言模型,用于英语和韩语的语音理解、问答和生成;以及 **Raon-SpeechChat**,其通过全双工交互扩展以实现自然的实时对话。Raon-Speech 使用语音理解和生成模块增强预训练的 LLM 骨干网络,通过分阶段训练方案获得新的语音模态能力,同时保留骨干网络原有的文本能力。Raon-SpeechChat 进一步包含了三个互补性的变更,以实现实时的同时听和说:(1) 用于流式输入的因果编码器;(2) 用户语音、助手文本和助手语音的词级对齐的令牌级交错序列;(3) 状态建模,将“何时说话”与“说什么”分离,从而实现可控的交互时机和行为。 通过在 42 个英语和韩语语音及文本基准测试上的大量实验,Raon-Speech 在与八个近期相似规模音频基础模型的比较中,在语音任务上取得了最强的综合表现。在英语中,其最显著的提升体现在口语问答、语音理解和生成语音的可懂度上,表现为最高的 VoiceBench 平均分、最佳的 MMAU 和 MMAU-Pro 分数,以及在 LibriSpeech [panayotov2015librispeech] 和 Seed-TTS-Eval [anastassiou2024seedtts] 上最低的 WER;它还保留了强大的文本能力,取得了最佳的 MMLU-Pro [wang2024mmlupro] 和 MMLU-Redux 结果。在韩语中,提升更广泛且更强:Raon-Speech 在所有 ASR 和语音生成基准测试上取得了最低的 CER,最佳的 KVoiceBench、KOpenAudioBench 和 KMMAU 分数,以及最佳的 KMMLU-Pro 和 KMMLU-Redux 结果。为便于阅读,主要结果表格报告了 VoiceBench/OpenAudioBench 和 KVoiceBench/KOpenAudioBench 的聚合分数,而附录E (https://arxiv.org/html/2605.23912#A5) 提供了每个基准测试的口语问答细分结果。 Raon-SpeechChat 进一步在 FDB v1.0 涵盖的轮流发言和对打断敏感的行为中展现出最强的综合能力,同时在更广泛的全双工评估套件中的重叠语音场景下保持竞争力。 我们的贡献总结如下: - • 我们引入了 **Raon-Speech**,一个 9B 参数的 SpeechLM,并在 42 个英语和韩语语音及文本基准测试中,与八个近期相似规模的音频基础模型相比,展示了最强的语音任务综合表现。 - • 我们提出了 **Raon-SpeechChat**,一个全双工模型,能够在游戏等具有挑战性的场景中实现自然的实时对话。 - • 我们发布了 3 个韩语语音基准测试:KVoiceBench、KOpenAudioBench 和 KMMAU,专门针对韩语语音和文化定制。 - • 我们开源所有模型检查点、推理流程和一个交互式演示。 ## 2 模型架构 ### 2.1 Raon-Speech 图 1:Raon-Speech 和 Raon-SpeechChat 概览。 Raon-Speech 扩展了骨干 LLM 以支持语音理解和生成。在语音理解侧,输入语音经过语音编码器和适配器得到语音嵌入,然后作为输入表示馈入 LLM。在语音生成侧,前一步的编解码器嵌入首先通过输出适配器映射到 LLM 输入空间。然后语音生成专家从 LLM 隐藏状态预测语义令牌,之后残差码预测器(RCP)按残差方式 15 步预测声学令牌。对每个深度预测的码进行反量化得到编解码器隐藏状态,将所有声学深度与语义深度相加得到编解码器嵌入。该嵌入通过编解码器解码器合成语音,同时也作为下一个生成步骤的输出适配器输入。 图1 (https://arxiv.org/html/2605.23912#S2.F1) 展示了 Raon-Speech 的整体架构,它扩展了预训练的骨干 LLM 以支持语音理解和生成。我们采用 **Qwen3-VL-8B-Instruct** [bai2025qwen3vltechnicalreport] 作为骨干 LLM,因其强大的多语言文本能力。**语音理解模块** 包括一个语音编码器和一个输入适配器,**语音生成模块** 包括一个输出适配器、一个语音生成专家、一个残差码预测器(RCP)和一个说话人编码器。Raon-Speech 的模块级参数分解见附录B (https://arxiv.org/html/2605.23912#A2)(表7 (https://arxiv.org/html/2605.23912#A2.T7)),详细的架构配置见附录C (https://arxiv.org/html/2605.23912#A3)(表8 (https://arxiv.org/html/2605.23912#A3.T8))。 #### 语音理解模块。 语音编码器初始化为预训练的 AuT 模型 [qwen3\_asr\_technical\_report],因其强大的多语言语音表示,以 12.5 Hz 的令牌速率从输入语音中提取特征。一个随机初始化的输入适配器,实现为带有 GELU 激活的 2 层 MLP,遵循 [liu2023visual] 的设计,然后将编码器输出投影到 LLM 嵌入空间。适配后的语音嵌入被插入到 LLM 输入序列中,使骨干网络能够通过与文本相同的接口处理语音。这种设计使骨干网络能够复用其预训练的语言能力,同时将语音特定的特征提取委托给编码器和适配器。为了稳定语音和文本表示之间的对齐,我们在适配器之后应用 RMSNorm [NEURIPS2019\_1e8a1942],其权重设置为 0.02 的小尺度,使得语音嵌入的范数在初始化时与 LLM 嵌入的范数匹配。 #### 语音生成模块。 我们使用 Mimi 编解码器 [defossez2024moshi],这是一个基于 RVQ 的神经语音编解码器 [zeghidour2021soundstream, defossez2022high],专为流式生成设计。Mimi 使用 32 个残差码本,我们保留前 16 个以在实时场景中平衡效率和生成质量。在每个生成步骤,Raon-Speech 预测 16 个编解码器令牌,包括第一个残差深度的 1 个语义令牌和后续深度的 15 个声学令牌。一个随机初始化的输出适配器(与输入适配器架构相同)将前一步的编解码器嵌入映射到骨干 LLM 的输入空间。从得到的骨干隐藏状态中,一个随机初始化的四层仅解码 Transformer 语音生成专家(隐藏尺寸小于骨干网络)预测语义令牌。一个 15 深度的 RCP,初始化为 **Qwen3-Omni-30B-A3B-Instruct** [xu2025qwen3] 以加速收敛,然后预测其余残差深度的声学令牌。对于说话人身份控制,我们使用从 **speechbrain/spkrec-ecapa-voxceleb** [desplanques2020ecapa, dawalatabad2021ecapa] 初始化的说话人编码器提取说话人嵌入,对模型进行条件控制。具体来说,从目标语音中随机抽取一段时长(Raon-Speech 为 2 到 8 秒,Raon-SpeechChat 为 10 秒)进行编码,并插入到 LLM 输入序列中,以控制生成语音的说话人身份。 ### 2.2 Raon-SpeechChat 我们描述将 Raon-Speech 扩展到实时全双工对话所需的架构和序列级修改。图2 (https://arxiv.org/html/2605.23912#S2.F2) 展示了 Raon-SpeechChat 中使用的令牌序列交错。具体来说,支持同时听和说需要模型在处理流式用户音频的同时并行生成助手语音。为此,我们引入了三项修改:(1) 用于流式输入的因果语音编码器;(2) 用户语音、助手文本和助手语音的令牌序列交错;(3) 显式的交互状态建模,将“何时说话”与“说什么”分离,从而实现对交互时机和行为的控制。Raon-SpeechChat 的模块级参数分解见附录B (https://arxiv.org/html/2605.23912#A2)(表7 (https://arxiv.org/html/2605.23912#A2.T7)),详细的架构配置见附录C (https://arxiv.org/html/2605.23912#A3)(表8 (https://arxiv.org/html/2605.23912#A3.T8))。 #### 因果语音编码器。 从 Raon-Speech 开始,我们将非因果的 AuT 编码器替换为 **Voxtral-Mini-4B-Realtime-2602** [voxtral\_realtime] 的因果语音编码器。该编码器使用因果注意力,专为原生流式操作设计,允许用户音频无需未来上下文即可处理。结合滑动窗口注意力,它通过将注意力限制在固定窗口内支持高效的长形式流式处理,从而以可控延迟实现连续转录。为便于将非因果编码器替换为因果编码器,我们引入了一个重新适配训练阶段(参见第3节 (https://arxiv.org/html/2605.23912#S3))。 图 2:Raon-SpeechChat 概览。 Raon-SpeechChat 使用因果语音编码器获取流式用户语音嵌入,并在用户语音、助手文本和助手语音的交错令牌序列上进行训练。在双工生成期间,它在说话的同时持续并行收听。虚线垂直线表示对齐的时间边界。在该示例中,助手在收听时保持静默 (SIL),然后以 BOW 开始讲话。首先生成文本令牌;由于语音生成时间更长,会发出 PAD 令牌直到口语词完成,之后另一个 BOW 标记下一个词的开头。 #### 全双工序列设计。 为了建模同时说话和收听,Raon-SpeechChat 在单个自回归序列上进行训练,该序列交错用户语音、助手文本和助手语音,而不是像 Moshi [defossez2024moshi] 那样并行建模。用户语音流被连续编码并由骨干网络消费,而助手侧通过在同一自回归序列内交错的文本和语音令牌进行建模。助手文本和助手语音在词级别对齐,当文本令牌数量少于语音令牌数量时,使用填充(PAD)来保持时间一致性。这种设计允许在统一的令牌级建模框架内处理识别、语言规划和语音生成。 #### 状态建模。 我们使用两个状态(收听和说话)对助手的对话行为进行建模,并使用在每个帧预测的特殊令牌来管理状态间的转换。与 Moshi(使用单个 PAD 令牌同时表示静默和其他非文本位置)不同,Raon-SpeechChat 引入了一个专用的静默令牌 SIL(静默),以显式编码静默收听行为。在收听状态下,预测 SIL 保持助手静默,而预测说话开始令牌则使模型进入说话状态。为了进一步将交互时机与内容生成分离,我们引入了 BOW(词开始),一个在每次助手文本令牌之前立即发出的特殊令牌。BOW 本身不携带词汇内容,而是表示模型即将产生一个新词,从而标记出“决定说话”与“指定说什么”之间的边界。随后的助手文本令牌则编码实际的回复内容。这种设计将交互行为与语言内容分离,使模型能够通过不同的令牌类型学习“何时说话”和“说什么”。一旦进入说话状态,模型继续生成助手文本和语音,直到预测到 SIL,此时返回收听状态。最后,我们使用一个单独的令牌 BC 来表示回应性反馈,而不是复用 BOW。这使得模型在训练期间能够更清晰地区分简短听者回应与常规话语起始,并在推理时提供对回应性反馈使用的显式控制,包括完全禁用回馈或调整其频率。
相似文章
MERaLiON-GR:面向英语和东南亚语言的语音性别识别模型
本文介绍了MERaLiON-GR,一个面向英语和东南亚语言的语音性别识别模型,基于MERaLiON-SpeechEncoder-2,使用LoRA和ECAPA-TDNN头部进行微调,在多语言基准上取得了最先进的性能。
缩小低资源文本转语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调
本文研究了VoxCPM2 TTS模型的LoRA微调,以改善低资源语言(如高棉语)的质量,同时显示对于基础模型已处理良好的韩语没有提升。该适配器在极少的参数训练下,显著提高了高棉语的MOS评分。
@svpino: 这个新模型做了一件很酷的事:它能在你说话时将语音转换为文本。这与其他所有a…
R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。
@Gorden_Sun: ZONOS2:开源MoE TTS模型 8B总参数,0.9B激活参数。支持多语言,支持语音克隆,支持中文,中文效果不错。 模型:
Zyphra released ZONOS2, an open-source MoE text-to-speech model trained on over 6 million hours of multilingual speech, supporting voice cloning and high-quality synthesis across many languages.
KoALa-Bench:评估大型音频语言模型在韩语语音理解与忠实度上的表现
KoALa-Bench 推出了一套聚焦韩语的基准测试,从六个维度评估大型音频语言模型,包括全新的语音忠实度指标与韩国本土文化内容。