FormalASR: 端到端中文口语到正式文本转换

arXiv cs.CL 论文

摘要

FormalASR 提出了两个紧凑的端到端模型,可直接将中文口语转录为正式书面文本,显著降低错误率,并消除了对单独 LLM 后处理阶段的需求,实现了轻量级的设备端部署。

arXiv:2605.19266v1 Announce Type: new 摘要:自动语音识别(ASR)系统通常针对逐字转录进行优化,这保留了不流畅、填充词和非正式口语结构,而这些往往不适合下游面向写作的应用。常见的解决方法是采用两阶段 ASR+LLM 流水线进行后期编辑,但这种设计增加了延迟和内存成本,且难以在设备端部署。我们提出 FormalASR,两个紧凑的端到端模型(0.6B 和 1.7B),可直接将中文口语转录为正式书面文本。为了实现这一设定,我们构建了 WenetSpeech-Formal 和 Speechio-Formal,两个大规模口语到正式文本的数据集,通过基于 LLM 的重写和质量过滤构建。然后,我们使用监督微调对 Qwen3-ASR 在两个规模(0.6B 和 1.7B)上进行微调。在 WenetSpeech-Formal 和 Speechio-Formal 上的实验表明,FormalASR 相对于逐字基线实现了高达 37.4% 的相对 CER 降低,同时提高了 ROUGE-L 和 BERTScore。FormalASR 在部署时无需后处理 LLM,为口语到正式转录提供了轻量级的设备端解决方案。
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:24

# FormalASR: 端到端中文口语转正式文本
来源:https://arxiv.org/html/2605.19266

###### 摘要

自动语音识别(ASR)系统通常针对逐字转录进行优化,这种转录保留了口语中的不流畅、填充词和非正式口语结构,而这些内容往往不适合下游面向写作的应用。常见的解决方法是采用两阶段的 ASR+LLM 流水线进行后编辑,但这种设计会增加延迟和内存成本,并且难以在设备端部署。我们提出 FormalASR,这是两个紧凑的端到端模型(0.6B 和 1.7B),能够直接将中文口语转录为正式书面文本。为了实现这一设定,我们构建了 WenetSpeech-Formal 和 Speechio-Formal,这两个大规模的口语转正式数据集是通过基于 LLM 的重写和质量过滤构建的。然后,我们通过监督微调(SFT)在两个规模(0.6B 和 1.7B)上微调 Qwen3-ASR。在 WenetSpeech-Formal 和 Speechio-Formal 上的实验表明,与逐字基线相比,FormalASR 的 CER 相对降低了高达 37.4%,同时 ROUGE-L 和 BERTScore 也得到提升。FormalASR 在部署时不需要后处理 LLM,为口语到正式文本的转录提供了一种轻量级、端侧可部署的解决方案。

关键词——语音识别、口语转正式、端侧 ASR、文本规范化、监督微调

## 1 引言

自动语音识别(ASR)已成为现代人机交互的基础组件,为语音助手、会议转录、实时字幕和文档听写等应用提供支持。Whisper [13 (https://arxiv.org/html/2605.19266#bib.bib1)]、Qwen3-ASR [12 (https://arxiv.org/html/2605.19266#bib.bib2)] 和 SenseVoice [1 (https://arxiv.org/html/2605.19266#bib.bib11)] 等先进系统在标准基准测试中取得了显著准确率,但它们共享一个基本的设计假设:输出应忠实地再现口语表面形式。这种逐字转录范式忠实地记录了所说内容,但输出继承了自发性语音的所有特征——填充词、重新开始 [19 (https://arxiv.org/html/2605.19266#bib.bib14), 9 (https://arxiv.org/html/2605.19266#bib.bib17)]、重复以及结构松散的句子 [18 (https://arxiv.org/html/2605.19266#bib.bib16)]——这些在正式文档中是不可接受的。在实践中,ASR 输出的下游消费者——会议纪要生成器、对话系统、语音控制文档编辑器——期望得到正式、结构良好的文本,而非逐字记录的实际讲话方式。

常见的补救措施是两阶段流水线:首先使用 ASR 模型进行逐字转录,然后使用单独的大型语言模型(LLM)将转录结果重写为正式风格 [3 (https://arxiv.org/html/2605.19266#bib.bib15)]。虽然在服务器端设置中有效,但这种方法会使内存占用和推理延迟翻倍,允许错误跨阶段传播,并且最关键的在于,它使得系统不适合只能运行紧凑模型的设备端或隐私敏感部署。大型多模态模型如 GPT-4o-audio-preview [11 (https://arxiv.org/html/2605.19266#bib.bib5)] 可以通过单次前向传播生成正式风格的转录,但依赖云 API,产生按 token 计费的成本并引发隐私问题,从而排除了边缘部署的可能。如图 1 (https://arxiv.org/html/2605.19266#S1.F1) 所示,即使对于单个话语,逐字 ASR 输出与预期的正式书面形式之间的差距也可能很大。

参考图注
图 1:口语转正式转换示例。逐字 ASR 转录保留了不流畅和非正式口语模式,而 FormalASR 直接从相同音频输入生成干净、正式的书面句子。

在这项工作中,我们提出 FormalASR,这是一种端到端方法,使用单个紧凑模型(推理时无需辅助 LLM)直接将中文口语音频映射为正式书面文本。关键见解是,音频-语言模型可以被训练来*同时*执行声学识别和语言规范化,前提是它在适当的口语到正式监督下进行训练。为了大规模提供这种监督,我们构建了 WenetSpeech-Formal 和 Speechio-Formal,这是两个大规模的中文口语到正式 ASR 数据集,源自 WenetSpeech [20 (https://arxiv.org/html/2605.19266#bib.bib3)] 和 Speechio [15 (https://arxiv.org/html/2605.19266#bib.bib6)],通过使用 DeepSeek-V3.2 [4 (https://arxiv.org/html/2605.19266#bib.bib7)] 重写逐字转录并应用质量过滤而构建。然后,我们使用监督微调(SFT)在两个规模(0.6B 和 1.7B)上微调 Qwen3-ASR。我们的主要贡献是:

- 我们提出并开源了 FormalASR,这是两个规模的紧凑音频-语言模型(0.6B³ 和 1.7B⁴),通过 SFT 微调,在域内和跨域中文基准测试中,与逐字基线相比,实现了高达 31.4% 的 CER 相对降低以及一致的 ROUGE-L 和 BERTScore 提升,同时保持适合设备端部署。

据我们所知,FormalASR 是第一个端到端微调紧凑音频-语言模型用于中文口语到正式转录的工作。我们的结果表明,现代 ASR 模型已经具备语言规范化的潜在能力——它们只需要适当的监督来激活这种能力,而无需增加模型规模或推理时的复杂度。

## 2 相关工作

### 2.1 自动语音识别

现代 ASR 系统已从传统的混合 HMM-DNN 架构 [8 (https://arxiv.org/html/2605.19266#bib.bib8)] 演变为基于 CTC [7 (https://arxiv.org/html/2605.19266#bib.bib9)] 和基于注意力的编码器-解码器框架 [2 (https://arxiv.org/html/2605.19266#bib.bib10)] 的端到端模型。大规模预训练模型进一步推动了该领域的发展:Whisper [13 (https://arxiv.org/html/2605.19266#bib.bib1)] 展示了在数十万小时的弱监督音频数据上训练能够产生鲁棒的多语言转录,而音频-语言模型如 Qwen3-ASR [12 (https://arxiv.org/html/2605.19266#bib.bib2)] 和 SenseVoice [1 (https://arxiv.org/html/2605.19266#bib.bib11)] 集成了强大的语言模型解码器,以提高对罕见词和领域特定术语的识别能力。尽管取得了这些进展,所有这些系统都旨在产生*逐字*转录,忠实地保留口语表面形式,包括“嗯”、“啊”、“你知道”等填充词、重新开始和非正式句子结构。这种设计选择适用于通过字符错误率(CER)衡量的转录基准,但意味着输出对于期望正式输出的下游应用(如文档生成、对话系统或语音控制界面)并不直接适用。

### 2.2 语音转文本规范化

将口语风格的转录转换为正式文本是一个长期存在的挑战。早期方法依赖手工规则或有限状态转换器来处理特定的表面现象,如数字口头化和标点插入 [16 (https://arxiv.org/html/2605.19266#bib.bib12), 17 (https://arxiv.org/html/2605.19266#bib.bib13)],但这些方法无法处理口语转正式转换所需的更广泛的语言重构。不流畅检测方法 [19 (https://arxiv.org/html/2605.19266#bib.bib14), 9 (https://arxiv.org/html/2605.19266#bib.bib17)] 识别并去除填充词和重新开始,但未能解决更深层的结构规范化,如句子重组或语域转换 [18 (https://arxiv.org/html/2605.19266#bib.bib16)]。一种更灵活的范式将紧凑的 ASR 模型与大型语言模型串联起来,后者将逐字输出转换为正式文本 [3 (https://arxiv.org/html/2605.19266#bib.bib15)],利用现代 LLM 强大的语言理解能力来处理各种口语现象;然而,这需要同时加载两个模型,使内存占用和推理延迟翻倍,并使设备端部署变得不可行。大型多模态模型如 GPT-4o-audio-preview [11 (https://arxiv.org/html/2605.19266#bib.bib5)] 可以通过单次前向传播从原始音频生成流畅、正式风格的转录,但依赖云 API,产生按 token 计费的成本并引发隐私问题,排除了设备端或延迟敏感部署的可能。如表 1 (https://arxiv.org/html/2605.19266#S2.T1) 所总结,现有方法均无法同时实现口语转正式转换、设备端可部署、单模型推理和低成本。

FormalASR 通过微调 0.6B 和 1.7B 的紧凑音频-语言模型来填补这一空白,这些模型在单次前向传播中直接从语音产生正式输出,推理时无需辅助模型,并且仍然适合设备端部署。

表 1:语音转文本范式的比较。FormalASR 实现了口语转正式转换,同时保持了设备端可部署、单模型和低成本的特点。
| 范式 | 口语转正式 | 设备端可行 | 单模型 | 低成本 |
|------|------------|------------|--------|--------|
| 传统 ASR | × | ✓ | ✓ | ✓ |
| ASR + LLM | ✓ | × | × | × |
| 多模态 LLM | ✓ | × | ✓ | × |
| FormalASR (本文) | ✓ | ✓ | ✓ | ✓ |

## 3 数据集:WenetSpeech-Formal 和 Speechio-Formal

### 3.1 构建流程

我们从 WenetSpeech 语料库 [20 (https://arxiv.org/html/2605.19266#bib.bib3)] 和 Speechio 基准数据 [15 (https://arxiv.org/html/2605.19266#bib.bib6)] 构建 WenetSpeech-Formal 和 Speechio-Formal,遵循三个阶段流程:

**逐字转录收集。** 我们使用 WenetSpeech 和 Speechio 的原始音频文件及其逐字转录作为输入。这些逐字转录保留了口语特征,包括填充词、重新开始、重复和非正式句子结构。

**基于 LLM 的规范化。** 我们提示 DeepSeek-V3.2 [4 (https://arxiv.org/html/2605.19266#bib.bib7)] 将每个逐字转录重写为正式书面中文。重写过程包括移除填充词和不流畅内容、按照书面习惯重新组织句子、规范标点和空格,以及在保留语义内容的同时纠正明显的识别错误。该提示指示模型生成简洁、语法正确的书面文本,传达与口语输入相同的含义。

**质量过滤。** 我们应用自动过滤以丢弃低质量的重写内容。如果重写文本与原始文本在语义上不一致(通过嵌入相似度衡量),如果逐字文本与正式文本之间的编辑距离太小(表明缺乏有意义的规范化)或太大(表明可能存在幻觉),或者如果重写文本包含明显错误或伪影,则移除样本。这一过滤步骤确保训练数据仅包含高质量的口语到正式配对。

### 3.2 数据集详情

表 2 (https://arxiv.org/html/2605.19266#S3.T2) 总结了 WenetSpeech-Formal 和 Speechio-Formal 的统计数据。WenetSpeech-Formal 包含源自 WenetSpeech 语料库的 969K 训练样本,涵盖多种领域,如有声读物、播客、新闻广播和对话语音。Speechio-Formal 包含 43K 测试样本,涵盖 27 个特定领域的子集(ZH00000–ZH00026),包括讲座录音、访谈、会议转录和自发对话,提供了一个全面的跨领域评估基准。

每个样本由一个音频文件和两个文本字段配对:`original_text`(逐字转录)和 `target_text`(DeepSeek-V3.2 生成的正式书面文本)。表 3 (https://arxiv.org/html/2605.19266#S3.T3) 展示了代表性示例,说明了所执行的规范化类型,包括填充词移除、错误纠正和句子重组。

表 2:WenetSpeech-Formal 和 Speechio-Formal 数据集统计。
| 数据集 | 样本数 | 用途 |
|--------|--------|------|
| WenetSpeech-Formal (训练集) | 969,201 | SFT 训练 |
| WenetSpeech-Formal (测试集) | 31,932 | 域内评估 |
| Speechio-Formal (测试集) | 43,178 | 跨域评估 |

表 3:代表性口语转正式转换示例。
| 逐字文本 (original_text) | 正式文本 (target_text) |
|--------------------------|------------------------|
| 把这个呃增加的这个利润 | 把这个增加的利润。 |
| 对全美国全球影响影响不大 | 对美国全球影响不大。 |
| 但是我想这里这当中就是如果如果一定要那个挑一点儿什么的话 | 但是,如果一定要从中挑出一点什么的话。 |

通过在这些口语到正式配对上进行训练,FormalASR 学会直接从语音生成正式书面输出,消除了对单独后处理阶段的需求。

## 4 方法

给定输入音频话语 x,我们的目标是在单次前向传播中直接预测正式书面转录 ŷ:

ŷ = arg max_y P_θ(y | x),   (1)

其中 y 表示一个结构良好的书面句子,而非逐字的口语转录。与传统 ASR→LLM 流水线不同,这种公式将声学识别和语言规范化耦合到一个条件生成过程中,因此推理时无需辅助重写器。

表 4:在 WenetSpeech-Formal 和 Speechio-Formal 基准上的口语转正式 ASR 结果。
| 模型 | WenetSpeech-Formal | | | Speechio-Formal | | |
|------|--------------------|---|---|-----------------|---|---|
|      | CER↓ | ROUGE-L↑ | BERTScore↑ | CER↓ | ROUGE-L↑ | BERTScore↑ |
| Qwen3-ASR-0.6B | 0.2581 | 0.8463 | 0.9198 | 0.2252 | 0.8701 | 0.9343 |
| FormalASR-0.6B (本文) | 0.1770 | 0.8769 | 0.9359 | 0.1603 | 0.8948 | 0.9481 |
| Qwen3-ASR-1.7B | 0.2460 | 0.8571 | 0.9268 | 0.2393 | 0.8510 | 0.9108 |
| FormalASR-1.7B (本文) | 0.1606 | 0.8896 | 0.9439 | 0.1499 | 0.9029 | 0.9533 |
| Whisper large-v3 | 0.3631 | 0.7393 | 0.8538 | 0.3302 | 0.7643 | 0.8795 |

我们使用 Qwen3-ASR [12 (https://arxiv.org/html/2605.19266#bib.bib2)](0.6B 和 1.7B 变体)实例化 P_θ(y | x),它采用了类似 Whisper 的音频编码器和自回归的 Qwen 解码器。对于每个训练样本,模型接收从波形中提取的语音特征,并被监督生成来自 WenetSpeech-Formal 和 Speechio-Formal 的对应正式目标文本。训练目标是标准的教师强制最大似然:

L_SFT = -∑_{t=1}^T log P_θ(y_t | x, y_{<t}),   (2)

其中 T 是目标长度,y_t 是正式参考中的第 t 个 token。优化这一目标鼓励模型在一个统一的端到端框架内共同学习:声学到文本的对齐、不流畅移除、口语到正式风格的转换以及内容保留的重写⁵。

在推理时,解码直接在音频输入上进行以生成正式文本,这使得系统复杂度与标准单模型 ASR 部署相同,同时提供口语到正式的输出。

## 5 实验

### 5.1 实验设置

我们在 WenetSpeech-Formal 上使用全参数监督微调(SFT)对两个规模(0.6B 和 1.7B)的 Qwen3-ASR 进行微调。两个模型均从官方 Qwen3-ASR [12 (https://arxiv.org/html/2605.19266#bib.bib2)] 检查点初始化,并在 969K 样本的训练集上训练 2 个 epoch。所有实验均在 2 块 NVIDIA A800-SXM4-80GB GPU 上进行。训练采用 BF16 精度,并启用梯度检查点。我们使用 AdamW 优化器 [10 (https://arxiv.org/html/2605.19266#bib.bib8)]。

相似文章

@aigclink: 阿里通义实验室最新发布了款ASR:Fun-ASR 1.5,核心能力:方言工业级可用 单模型即可无缝覆盖30种语言、汉语七大方言体系及20+ 地方口音,古诗词吟诵也能精准转写 典型方言场景CER相对上代下降56.2%,有5种方言准确率破 9…

X AI KOLs Timeline

阿里通义实验室发布Fun-ASR 1.5,单模型覆盖30种语言、汉语七大方言及20余种地方口音,典型方言场景字错率较上代下降56.2%,5种方言准确率突破90%。

@MaxForAI: 如果你在做语音Agent,你应该试一下这个项目 来自南洋理工、新国立和上海 AI Lab的团队发布了:Mega-ASR 这个完全开源的ASR基于 Qwen3-ASR构建,目的是打破长期困扰ASR的在嘈杂、混响或其他受损现实环境中表现的瓶颈…

X AI KOLs Timeline

南洋理工、新国立和上海 AI Lab 联合发布 Mega-ASR,一个基于 Qwen3-ASR 构建的完全开源 ASR 模型,通过 Voices-in-the-Wild-2M 数据集和渐进式声学到语义优化,在真实世界嘈杂环境中实现最高 30% 的相对词错误率下降,且仅 1.7B 参数可在消费级硬件高效推理。

DialectS2S:面向低资源中文方言的端到端语音对话建模

arXiv cs.CL

DialectS2S是一个面向低资源中文方言的端到端语音对话模型,引入了可扩展的数据合成流程和一种带有自对齐语音监督的两阶段后训练策略。实验表明,在方言一致性、响应质量和可懂度方面均有提升,并且模型、数据和代码全部开源。