SCRIBE:面向Indic ASR的诊断评估与富转录模型
摘要
SCRIBE 是一个用于自动语音识别的诊断评估框架,为印度语言提供分类错误分解,并发布了 Hindi、Malayalam 和 Kannada 的基准和开源权重富转录模型。
arXiv:2605.20712v1 公告类型:新
摘要:自动语音识别(ASR)只有在纠错成本低于手动输入时才会取代打字,这一阈值由错误类型而非错误数量决定:纠正一个误识别的领域术语远比插入一个逗号成本高。词错误率(WER)在两个层面存在不足:它将不同的错误类别合并为一个标量,并且在结构上惩罚粘着语,因为有效的连音合并会夸大分数。我们提出 SCRIBE,一个诊断框架,通过容忍连音的对齐和领域词汇注入,提供词汇、标点、数字和领域实体错误率的分类错误分解。人工验证确认,SCRIBE 与专家判断一致,而 WER 则不然。我们发布了 SCRIBE、一个 LLM 策展管道、基准测试以及用于 Hindi、Malayalam 和 Kannada 的开源权重富转录模型。
查看缓存全文
缓存时间: 2026/05/21 06:34
# SCRIBE:印度语言语音识别的诊断评估与富转录模型
来源:https://arxiv.org/html/2605.20712
Manohar Bhattacharya Juvekar Nethil \[Script=Devanagari\] \[Script=Malayalam, Scale=0.9\] \[Script=Devanagari\] \[Script=Malayalam, Scale=0.9\]\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English
###### 摘要
自动语音识别只有在纠错成本低于手动输入时才能取代手动输入,这一阈值由错误类型而非数量决定:修正一个被误识别的领域术语远比插入一个逗号代价高昂。词错误率(WER)在两个方面存在缺陷:它将不同的错误类别合并为一个标量,并且在结构上对黏着语系语言不公平——在这些语言中,合法的连音合并会人为抬高得分。我们提出了SCRIBE,一个诊断框架,通过容忍连音的对齐和领域词汇注入,提供词法、标点、数字和领域实体错误率的分类错误分解。人工验证表明,在WER失效的情况下,SCRIBE与专家判断一致。我们发布了SCRIBE、一个LLM整理流程、基准测试以及面向印地语、马拉雅拉姆语和卡纳达语的开权重富转录模型。
###### 关键词:
ASR评估、富转录、形态对齐、印度语言、诊断指标
## \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English1 引言
\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English逐词语料库\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=EnglishLLM整理流程格式化与领域注入发布1:流程\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=EnglishASR模型训练(印地语、马拉雅拉姆语、卡纳达语)\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=EnglishSCRIBE框架诊断评估发布2:框架\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English最终权重与基准测试发布3\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English领域数据(可选)带分类分析的诊断反馈循环\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English图1:面向印度语言富转录的诊断驱动开发周期。SCRIBE提供了必要的分类反馈,以优化整理流程并验证模型在不同错误类型上的表现。自动语音识别(ASR)在听写、生成医疗记录、法律笔录或课堂转录中的实用性由纠错阈值决定:编辑必须比打字更快。这需要**富转录**:包含语法正确的标点、标准化的数字以及符合领域习惯的正字法。系统是否达到这一标准取决于错误的**类型**,而不仅仅是数量。缺失一个逗号无伤大雅;但一个被误识别的医学术语或格式错误的法律日期可能使输出完全不可用。
标准词错误率(WER)在作为开发信号时存在两个缺陷。首先,它将声学失败、数字格式和标点合并为一个标量,无法提供可操作的见解。其次,它在结构上对黏着语系印度语言不公平。在形态复杂的达罗毗荼语言(如马拉雅拉姆语和卡纳达语)中\[manohar2020quantitative,bharadwaja2007statistical\],合法的词边界合并(连音)伴随着边界上的音位变化,会触发1:1对齐中的级联对齐偏移,相对错误率增加高达30%。这是对整个语言族的结构性惩罚。
我们提出SCRIBE,一个诊断评估框架,其名称来源于它所衡量的角色:ASR能否作为一个可靠的抄写员。SCRIBE不输出单一的标量,而是输出一个诊断错误向量 **E** = \[ER\_lex, ER\_punc, ER\_num, ER\_ent\],分别将失败分解为词法、标点、数字和领域特定实体的错误率。通过利用容忍连音的对齐和分类分解,SCRIBE用可操作的开发信号取代了单一的WER,从而实现对富转录任务的有针对性改进。
总之,本文的主要贡献如下:
- \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English• **SCRIBE**,作为开源评估工具发布,提供容忍连音的对齐和分类错误分解,提议在ASR担任抄写员角色的场景中替代单一的WER。
- \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English• **一种结构化标注方案和验证程序**用于分类ASR指标,每个维度由专家语言学家独立评分,证明SCRIBE在WER失效时与人类判断一致。
- \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English• **一种可复现的印度语言富转录配方**:基于LLM的数据整理流程、两个新的基准测试(通用领域的FLEURS-RO和领域评估的IN22-Legal),以及首批面向印地语、马拉雅拉姆语和卡纳达语的开权重富转录模型。
## \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English2 相关工作
**富转录模型:** 虽然Whisper\[radford2023robust\]和Canary\[raokoluguri25_interspeech\]等模型展示了联合声学-正字法建模的可行性,但印度语言的开源生态系统仍以逐词模型为主\[bhogale2023effectiveness,bhogale23_interspeech,bhogale2025towards\]。当前的格式化输出流程通常依赖于解耦的逆文本正则化\[pulipaka2025mark\],这忽略了韵律线索和同音词消歧。SCRIBE通过为印度语言ASR提供原生富转录配方来弥补这一空白。
**评估局限性:** 虽然字符错误率(CER)回避了黏着语系语言的词边界问题\[k-etal-2025-advocating\],但它和WER都缺乏诊断信号。CER在语义上是盲目的,将功能后缀变化与词根语素替换等同对待。像Beyond Levenshtein\[kuhn24_interspeech\]这样的分类框架朝着精细化评估迈进,但它们依赖于会将印度语言中词汇上不可或缺的元音符号(matras)和变音符删除掉的归一化操作\[manohar-pillai-2024-lost\]。同样,与词信息丢失(WIL)和词信息保留(WIP)\[morris04_interspeech\]共享的1:1词对齐无法解决达罗毗荼语言中常见的合法连音(词边界合并)\[manohar-pillai-2024-lost\]。像Semascore\[semascore2024\]这样的语义指标关注全局含义,但对致命的数字或否定词失败视而不见——这些错误会使专业听写输出无法使用。虽然Orthographically-Informed WER利用LLM捕捉允许的变体\[bhogale2026orthographicallyinformedevaluationspeechrecognition\],但该方法计算成本高,且无法解决由连音引起的结构性对齐偏移。SCRIBE通过保留变音符号的归一化、确定性的容忍连音对齐以及分类错误分解来弥补这些空白。
## \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English3 SCRIBE框架
SCRIBE分为三个阶段:分词和领域屏蔽、连音感知对齐引擎以及分类错误聚合。该框架输出一个诊断错误向量 **E**,其中每个分量对应一种具体的改进策略。
### \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English3.1 阶段1:分词和领域屏蔽
该框架将参考文本 \(R\) 和假设文本 \(H\) 转换为类型化标记 \((w_i, t_i)\),其中 \(t_i \in \{\text{词素, 数字, 标点, 领域实体}\}\)。与移除或盲目隔离标点的标准分词器不同,在SCRIBE中,标准标点和印度语言特有标记(例如印地语的danda)成为独立标记,而数字和复合词(例如 "22.05.2023", "ice-cream")内部的标点则被保留以保持词汇完整性。用户定义的领域实体通过基于正则表达式的屏蔽层注入,被视为原子单元,防止虚假碎片化。
### \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English3.2 阶段2:连音感知对齐引擎
一个**对齐**是参考文本 \(R\) 和假设文本 \(H\) 位置的配对,它考虑了插入、删除、标准1:1替换以及由连音引起的1:2(拆分)和2:1(合并)映射。我们寻求最大化总得分 \(dp[i][j]\) 的对齐,通过公式1中的扩展动态规划计算(参见 https://arxiv.org/html/2605.20712#S3.E1)。
\[
dp[i][j] = \max\left\{
\begin{aligned}
&dp[i-1][j-1] + S(r_i, h_j) && \text{(匹配/替换)}\\
&dp[i-1][j] + \gamma(t^R_i) && \text{(删除)}\\
&dp[i][j-1] + \gamma(t^H_j) && \text{(插入)}\\
&dp[i-1][j-2] + \Sigma_{\text{split}} && \text{(连音-拆分)}\\
&dp[i-2][j-1] + \Sigma_{\text{merge}} && \text{(连音-合并)}
\end{aligned}
\right.
\]
\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English(1)
评分函数 \(S(r_i, h_j)\) 以精确匹配(\(\alpha = +4.0\))为锚点,同时缓冲印度语言中常见的声学近似错误(例如 \\fontspec_if_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec_if_language:nTFHIN\\addfontfeatureLanguage=Hindi खाना: khaana 与 \\fontspec_if_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec_if_language:nTFHIN\\addfontfeatureLanguage=Hindi गाना: gaana)。为防止对齐漂移,如果 \(t^R_i \neq t^H_j\),则应用类别冲突惩罚 \(\beta = -3.0\)。对于相同类别的替换,我们采用 Levenshtein 缓冲惩罚 \(\delta = -1.5 - (0.2 \cdot d)\),其中 \(d\) 是 \(r_i\) 和 \(h_j\) 之间的字符距离。对目标语言的敏感性分析确认,Unicode 级别的距离 \(d \leq 2\) 能最优地捕获小的正字法变化(例如元音符号偏移或叠音化),而不会触发标准 WER 评估中典型的级联删除-插入对。
连音得分 \(\Sigma\) 通过验证音位合理性来解决 1:2 或 2:1 映射。如果一个合并形式匹配 \(w_1\) 的前缀和 \(w_2\) 的后缀,则该转换视为有效。我们将其评分为 \(\Sigma = \alpha + \sigma - d(b_{\text{split}}, b_{\text{mid}})/|s|\),其中 \(\sigma = -0.5\) 是连音惩罚。如果边界距离 \(d > 2\),则根据印度语言的形态音韵规则\[bhardwaj-etal-2018-sandhikosh, dasari-etal-2025-sandhi, thottingal-2019-finite\],该转换无效。图2(参见 https://arxiv.org/html/2605.20712#S3.F2)展示了SCRIBE正确解决马拉雅拉姆语中这些复杂词合并(如 "innu allenkil → innallenkil")和拆分(如 "naleyakatte → nale akatte")的能力。
**SCRIBE连音感知对齐**
\\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam ഇന്ന് \\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam അല്ലെങ്കിൽ \\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam നാളെയാകട്ടെ
\\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam ഇന്നല്ലെങ്കിൽ \\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam നാളെ \\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam ആകട്ടെ
MERGE (2:1) SPLIT (1:2)
E_lex = 0%: 正确解决语言上的合并与拆分
**标准1:1对齐 (JIWER)**
\\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam ഇന്ന് \\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam അല്ലെങ്കിൽ \\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam നാളെയാകട്ടെ
\\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam ഇന്നല്ലെങ്കിൽ \\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam നാളെ \\fontspec_if_script:nTFmlym\\addfontfeatureScript=Malayalam\\fontspec_if_language:nTFMAL\\addfontfeatureLanguage=Malayalam ആകട്ടെ
sub sub sub
WER = 100%: 由于词拆分与合并导致的对齐偏移
\\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English图2:标准库在语言合并与拆分时触发级联对齐偏移,抬高WER,而SCRIBE正确识别这些正字法变化,报告 ER_lex 为0%。
### \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English3.3 阶段3:分类错误聚合
SCRIBE 将错误聚合为一个诊断向量 **E** = [ER\_lex, ER\_punc, ER\_num, ER\_ent]。我们使用组合分母 \(N_{\text{comb}} = \sum_{t \in \mathcal{T}} \text{total}[t]\) 来计算分类错误率:ER\_t = (sub[t] + ins[t] + del[t]) / N_{\text{comb}}。这种统一缩放防止了稀疏类别孤立失败导致的误导性高比率。为了考虑专业听写中允许的格式选择,SCRIBE 可选地归一化日期和数字分隔符,确保可接受的正字法变化不会抬高 ER\_num。该框架生成带有绝对错误计数的详细报告,以支持细粒度诊断可视化,并为 ASR 系统制定有针对性的改进策略。
## \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English4 实验设置
我们通过一个完整的实验周期来验证 SCRIBE,该周期涉及针对印地语、马拉雅拉姆语和卡纳达语的富转录模型开发(图1,参见 https://arxiv.org/html/2605.20712#S1.F1)。本节描述:(1) 基于 LLM 的数据整理流程以及基于该流程训练的富转录模型;(2) 针对通用和领域评估发布的两个新基准测试;(3) 一项由专家语言学家参与的人工评估研究,旨在测试 SCRIBE 的分类错误率是否在单一的 WER 失效时与人类判断一致。
### \\fontspec_if_language:nTFENG\\addfontfeatureLanguage=English4.1 数据与模型
公开的印度语言语音语料库\[bhogale2023effectiveness,kathbath2022,prahallad2012iiit,gopinath2022imasc,javed2024indicvoices,baby2016resources,conneau2023fleurs\]主要提供逐词转录。我们使用 Gemini 2.5 Pro\[comanici2025gemini\] 结合语言特定的提示,将这些转录转换为富转录格式。相似文章
Indic DiarBench:面向印度语言的多语言联合说话人日志与自动语音识别基准
Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。
Vividh-ASR:面向稳健印度语音识别的复杂度分层基准与优化动态
介绍了用于印地语和马拉雅拉姆语ASR的复杂度分层基准Vividh-ASR,指出了微调中的录音室偏差,并提出了R-MFT以高效提升自发言语性能。
Voice of India:面向印度真实场景的大规模语音识别基准
研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。
@SarvamAI:我们开源两套评估印度语 ASR 的框架,并发布覆盖 22 种语言的完整评测指南。WER(…
SarvamAI 发布开源评估框架与指南,专为 22 种印度语言设计,解决传统 WER/CER 指标在该场景下的局限。
SamaVaani:印度语言多语言临床ASR的审计与去偏
本文对印度语言的精神病学访谈中的多语言临床ASR系统进行了系统性审计,并提出了SamaVaani,一种统一的去偏技术,旨在提升跨人口群体的性能与公平性。