利用细粒度错误校正优化咨询服务中的韩语语音识别
摘要
本文介绍了DasanCallDial,一个针对对话级ASR错误校正的大规模韩语基准数据集,并提出了DCSC框架,在纯文本后编辑中达到了最先进的性能。
arXiv:2609.09889v1 Announce Type: new
摘要:自动语音识别(ASR)技术是客户服务自动化和大规模转录的基础。然而,即使先进的ASR模型在复杂的真实环境如呼叫中心对话中也难免出现错误。当隐私限制无法获取音频时,错误校正必须依赖基于文本的后编辑。现有的纯文本方法在低资源语言中面临重大挑战,主要由于标注语料库和定制校正方法的严重缺乏。对于韩语,这一资源差距尤为明显,因为现有资源主要用于ASR训练,而非基于文本的错误校正。为解决这一问题,我们推出了DasanCallDial,这是首个专门为对话级ASR错误校正策划的大规模韩语基准数据集。该数据集源自真实的呼叫中心交互,包含1,974段对话和115,460个话语。利用这一资源,我们提出了检测器门控上下文跨度校正(DCSC),这是一种用于错误稀疏韩语语音识别转录的纯文本后编辑框架。DCSC结合了基于编码器的检测器,首先进行令牌级错误检测,然后是一个基于语言模型的校正器,用于纠正细粒度的跨度级错误。此外,我们采用对话级上下文增强,使模型能够利用话语历史进行消歧。通过采用多级粒度,我们的方法达到了最先进的性能,有效克服了通用LLMs在低资源环境中的局限性。
查看缓存全文
缓存时间: 2026/09/10 08:16
# 利用韩语语音识别中的细粒度错误纠正提升咨询服务 来源: https://arxiv.org/html/2609.09889 ###### 摘要 自动语音识别(ASR)技术是客户服务自动化和大规模转录的基础。然而,即使在先进的ASR模型中,在呼叫中心对话等复杂的现实环境中也存在不可避免的错误。当隐私限制禁止访问音频时,错误纠正必须依赖于基于文本的后编辑。现有的纯文本方法在低资源语言中面临重大挑战,主要原因是标注语料库和定制纠正方法的严重缺乏。对于韩语,这种资源差距尤为明显,因为现有资源主要为ASR训练而非基于文本的错误纠正而设计。为了解决这个问题,我们引入了 **DasanCallDial**,这是第一个专门为对话级ASR错误纠正而策划的大规模韩语基准数据集。该数据集源自真实的呼叫中心交互,包含1,974段对话和115,460个话语。利用这一资源,我们提出了 **检测器引导的上下文片段纠正(DCSC)**,这是一个针对错误稀疏的韩语语音识别转录的纯文本后编辑框架。DCSC结合了基于编码器的检测器(首先执行词元级错误检测)和基于语言模型的纠正器(训练用于纠正细粒度的片段级错误)。此外,我们采用了对话级上下文增强,使模型能够利用话语历史进行消歧。通过采用多层粒度,我们的方法实现了最先进的性能,有效克服了通用LLM在低资源环境中的局限性。 00footnotetext:已接受的手稿,发表于 *Engineering Applications of Artificial Intelligence* 183 (2026) 116038。正式版本: doi:10.1016/j.engappai.2026.116038 (https://doi.org/10.1016/j.engappai.2026.116038)。© 2026。此手稿版本根据 CC-BY-NC-ND 4.0 许可提供,https://creativecommons.org/licenses/by-nc-nd/4.0/。 00footnotetext:2,3这项工作在作者隶属于120 Dasan Call Foundation时进行。 ## 1 引言 自动语音识别(ASR),通常称为语音转文本(STT)技术,已在客户支持、无障碍服务和自动转录等领域变得不可或缺。深度学习和自然语言处理(NLP)的最新进展显著提高了STT系统的准确性(Prabhavalkar等人,2024 (https://arxiv.org/html/2609.09889#bib.bib1); Ahlawat等人,2025 (https://arxiv.org/html/2609.09889#bib.bib2))。然而,在呼叫中心或咨询热线等复杂多变的环境中,由于发音差异、背景噪音、语音重叠和领域特定术语,语音识别器仍然存在高错误率。这些识别错误干扰了有效的投诉处理和公共服务运营。参见图1。 图1:三层粒度的端到端示意图:(1)**对话级** 显示原始数据集中的样本;(2)**话语级** 描绘从对话中提取的话语;(3)**词元(片段)级** 确定词元级检测和片段级纠正目标。左侧和右侧示例分别代表有噪声的ASR转录和人工标注的真实值。在(3)中,错误的词元用 **红色** 标记,其更正用 **蓝色** 标记。 因此,提高STT性能的研究涵盖两个互补的方面:(i)增强骨干ASR模型的声学和语言组件(Baevski等人,2020 (https://arxiv.org/html/2609.09889#bib.bib3); Gulati等人,2020 (https://arxiv.org/html/2609.09889#bib.bib4)),以及(ii)后编辑转录以修复残余错误。在公共服务呼叫日志中,严格的隐私法规通常禁止访问原始音频,使得纯文本纠正框架特别有价值。早期工作将后编辑定义为单语“翻译”,微调序列到序列模型以将有噪声的转录映射到干净的文本(Hrinchuk等人,2020 (https://arxiv.org/html/2609.09889#bib.bib5); Dutta等人,2022 (https://arxiv.org/html/2609.09889#bib.bib6); Ma等人,2023a (https://arxiv.org/html/2609.09889#bib.bib7))。最近,大型语言模型(LLM)显示出在无需特定任务调整的情况下在上下文中纠正错误的能力(Ma等人,2023b (https://arxiv.org/html/2609.09889#bib.bib8); Ma等人,2025 (https://arxiv.org/html/2609.09889#bib.bib9))。然而,这些成功集中在英语和中文等高资源语言;在低资源语言中,性能急剧下降,因为错误模式和干净参考都很稀缺(Li等人,2024 (https://arxiv.org/html/2609.09889#bib.bib10))。据我们所知,韩语ASR后编辑场景——特别是涉及呼叫中心数据嘈杂、真实世界条件下的完整话语级分析——在很大程度上尚未被探索。为了弥合这一差距,我们编译了一个名为 **DasanCallDial** 的新基准,其中包含来自韩国官方政府组织首尔Dasan Call Foundation的真实呼叫中心对话。DasanCallDial中的对话由生产ASR系统自动转录,随后手动更正以建立真实值参考。**DasanCallDial** 是第一个源自原始、真实世界环境的对话级韩语后编辑数据集。其独特之处在于错误稀疏设置,准确反映了现代STT模型的高基线性能,区别于错误率人为提高的合成数据集。最终语料库包含约1974个对话对,共115,460行话语,在不同的话语集中错误率为17.95%。 利用这个现实的基准,我们提出了 **检测器引导的上下文片段纠正(DCSC)**,这是一个为错误稀疏、纯文本韩语ASR纠正设计的后编辑框架,并在多个指标上验证了其有效性。借鉴先前研究,表明在纠正器前引入专用检测器可以提高纠正准确性(Pu等人,2024 (https://arxiv.org/html/2609.09889#bib.bib11); Yeen等人,2023 (https://arxiv.org/html/2609.09889#bib.bib12)),DCSC首先应用词元级检测器来确定话语是否需要纠正。如果需要纠正,则将整个话语转发给纠正器,而不仅仅是检测到的错误词元,允许纠正器利用周围的词汇和句法上下文来修改话语。此外,受编辑模型在训练于真正需要修改的片段而非整个句子时表现最佳的发现的启发(Malmi等人,2019 (https://arxiv.org/html/2609.09889#bib.bib13); Stahlberg和Kumar,2020 (https://arxiv.org/html/2609.09889#bib.bib14); Leng等人,2023 (https://arxiv.org/html/2609.09889#bib.bib15)),我们系统地在三个级别上细化样本粒度,如图1 (https://arxiv.org/html/2609.09889#S1.F1) 所示。首先,数据集包含完整的(1)呼叫中心代理和客户之间的对话级样本。然后,每个对话被拆分为单独的(2)话语级样本,缩短上下文并增加样本数量(第3.1.2节 (https://arxiv.org/html/2609.09889#S3.SS1.SSS2))。我们通过计算ASR转录和真实值之间的词元级编辑距离来进一步细化每个话语,得到用于检测的(3)词元级标签(第4.1节 (https://arxiv.org/html/2609.09889#S4.SS1))和用于纠正的(3)片段级目标(第4.2节 (https://arxiv.org/html/2609.09889#S4.SS2))。最后,为了恢复在话语级分割过程中丢失的对话信息,DCSC采用 **对话级上下文增强** 策略(第4.2节 (https://arxiv.org/html/2609.09889#S4.SS2)),将前序话语上下文与目标话语连接起来。我们在第5.1节 (https://arxiv.org/html/2609.09889#S5.SS1) 中实证验证了DCSC的有效性。具体而言,基于pkoT5的DCSC实现了90.43的检测准确率(Acc),优于83.43的零规则基线,并将平衡词错误率(Bal-WER)从14.67降低到13.30。它还将错误话语的词错误率(E-WER)从29.35降低到26.27,表明DCSC在进行有意义的纠正的同时,保持了干净话语上不必要的编辑很低。此外,关于检测器和纠正器的详细消融研究(第5.2节 (https://arxiv.org/html/2609.09889#S5.SS2),第5.3节 (https://arxiv.org/html/2609.09889#S5.SS3))展示了词元级检测、片段级纠正、对话上下文增强和检测器引导路由如何各自贡献最终性能。最后,我们进行了广泛的分析以阐明DCSC为何以及何时有效工作(第6节 (https://arxiv.org/html/2609.09889#S6))。这些分析包括表示几何、检测器-纠正器连通性、外部域迁移、说话者和错误密度分解以及定性案例研究。这些分析共同描述了DCSC的鲁棒性和局限性。 ## 2 相关工作 ### 2.1 韩语ASR数据集 表1:DasanCallDial与现有韩语ASR数据集的比较,基于内容类型、音频源环境、ASR转录的可用性、对错误稀疏设置的支持以及数据集规模。 | 数据集 | 内容 | 音频源 | STT转录 | 错误稀疏 | 话语数 | | :--- | :--- | :--- | :--- | :--- | :--- | | KsponSpeech (Bang等人,2020 (https://arxiv.org/html/2609.09889#bib.bib16)) | 对话 | 受控环境 | ✗ | ✗ | 625,545 | | ClovaCall (Ha等人,2020 (https://arxiv.org/html/2609.09889#bib.bib17)) | 问答 | 受控环境 | ✗ | ✗ | 61,000 | | KEBAP (Koo等人,2023 (https://arxiv.org/html/2609.09889#bib.bib18)) | 句子 | 受控环境 | ✓ | ✗ | 2,478 | | Hyper-BTS (Park等人,2024 (https://arxiv.org/html/2609.09889#bib.bib19)) | 句子 | 合成 | ✓ | ✗ | 1,008,000 | | **DasanCallDial (本文)** | **对话** | **真实世界** | **✓** | **✓** | **115,460** | 在韩语方面,已经发布了几个大规模语音数据集。**KsponSpeech**(Bang等人,2020 (https://arxiv.org/html/2609.09889#bib.bib16))提供了969小时的自发语音和人工标注转录,在受控环境中录制以阻挡外部噪音。类似地,**ClovaCall**(Ha等人,2020 (https://arxiv.org/html/2609.09889#bib.bib17))提供众包录音和基于从餐厅预订场景中提取的候选问答对的源文本。然而,由于这些数据集主要为训练ASR模型而设计,它们不提供原始ASR输出(STT转录)文本。这种省略使得它们不适合在无法访问原始音频源或必须仅在文本范围内执行错误纠正的情况下研究后编辑技术。因此,迫切需要专门为基于文本的ASR错误纠正设计的数据集。**KEBAP**(Koo等人,2023 (https://arxiv.org/html/2609.09889#bib.bib18))通过分析和假设各种错误场景构建了可解释数据;然而,其实用性因其句子级独立性和由于人工后插入外部噪音再转录而导致的缺乏现实性而受到限制。尽管 **Hyper-BTS**(Park等人,2024 (https://arxiv.org/html/2609.09889#bib.bib19))拥有100万样本的巨大规模,但它也由独立的句子级数据组成。此外,它依赖于合成生成管道——其中现有文本语料库(例如,TED脚本或字典)通过TTS模型处理生成语音,然后通过STT转换回文本——导致音频源显著合成。而且,现有的韩语后编辑数据集仅包含错误的源样本,因此不提供评估错误稀疏后编辑所需的干净多数标签分布。相比之下,如表1 (https://arxiv.org/html/2609.09889#S2.T1) 所示,我们提出的 **DasanCallDial** 是第一个反映真实世界对话级特征的韩语数据集,通过直接转录实际的呼叫中心市民投诉收集而来。此外,通过保留正确和错误识别的原始ASR输出而不进行人工过滤,它独特地保留了在操作环境中遇到的干净多数、错误稀疏的分布。我们提供了115k的并行数据样本,由STT识别输出和相应的人工标注真实文本组成,从而促进专门致力于纠正ASR错误的后编辑技术的进步。 ### 2.2 ASR转录的后编辑 自动语音识别(ASR)错误检测是一个长期的后处理步骤,旨在在错误传播到下游应用程序之前标记识别错误。一种常见的方法使用单独的声学和转录编码器。Meripo和Konam (2022) (https://arxiv.org/html/2609.09889#bib.bib21) 联合编码声学和文本输入,利用Wav2Vec 2.0(Baevski等人,2020 (https://arxiv.org/html/2609.09889#bib.bib3))处理语音,BERT(Devlin等人,2019 (https://arxiv.org/html/2609.09889#bib.bib22))处理文本,然后训练一个蕴含分类器来预测音频-转录的一致性。然而,在许多现实环境中,原始音频并非总是可访问,这激发了纯文本检测。因此,Harvill等人 (2024) (https://arxiv.org/html/2609.09889#bib.bib23) 提出了一个轻量级的话语级检测器,通过估计语义距离来识别关键转录错误,而无需额外的声学信息。超越粗略的话语级标签,Gekhman等人 (2022) (https://arxiv.org/html/2609.09889#bib.bib24) 引入了一个基于BERT的序列标注器,将ASR置信度分数与文本一起嵌入,将每个词元标记为 **错误** 或 **非错误**,从而产生更强的检测性能。 除了检测,关于纠正ASR转录的研究沿着三个相互关联的轴线推进:模型容量、管道结构和监督粒度。这些维度共同为我们的方法提供了信息。早期工作表明,提示GPT风格的大型语言模型(LLM)可以在不微调的情况下降低词错误率(WER)(Ma等人,2023b (https://arxiv.org/html/2609.09889#bib.bib8); Ma等人,2025 (https://arxiv.org/html/2609.09889#bib.bib9)),然而这些收益仅限于高资源语言。当并行数据稀缺时,在1-best假设上微调的Transformer序列到序列模型提供了更强的基线(Hrinchuk等人,2020 (https://arxiv.org/html/2609.09889#bib.bib5))。后续研究添加了去噪目标(Dutta等人,2022 (https://arxiv.org/html/2609.09889#bib.bib6))或N-best条件(Ma等人,2023a (https://arxiv.org/html/2609.09889#bib.bib7)),表明当显式注入领域知识时,即使是适度的语料库仍然能产生有竞争力的改进。因此,我们采用韩语预训练的seq2seq骨干作为与LLM的现实比较。除了模型容量,管道的结构配置和监督粒度已成为最大化纠正性能的关键因素。具体而言,当错误定位和重写被解耦为不同的阶段时,纠正效果显著增强。这些两阶段管道首先标记错误片段,然后仅编辑这些区域,优于单一
相似文章
使用本地语法图为韩语法律聊天机器人生成训练数据集
本文提出了一种利用本地语法图(LGG)为韩语法律聊天机器人生成大规模、带标注训练数据集的方法,在使用 DIET 分类器时达到了 91% 的 F1 分数。
迈向类人交互式语音识别:基于智能体修正与语义评估
本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。
倾听潜在状态:大型音频语言模型中通过隐藏状态交互的自我纠正语音识别
本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。
优化基于词的L2韩语语法错误标注
本文通过解决现有资源中的问题(包括表面目标实现和单一参考评估),优化了L2韩语的基于词的语法错误标注,并展示了使用基于KoBART的纠错方法所取得的改进。
海报:探索基于音频检测土耳其电话诈骗的极限
本文介绍了首个公开的多模态数据集,包含100个土耳其诈骗和良性电话通话,评估了七种大语言模型在原始音频、ASR转录和人工纠正转录下的表现。结果表明,基于转录的输入优于直接音频,凸显了在低资源语言中进行包容性AI安全研究的必要性。