@SarvamAI:我们开源两套评估印度语 ASR 的框架,并发布覆盖 22 种语言的完整评测指南。WER(…
摘要
SarvamAI 发布开源评估框架与指南,专为 22 种印度语言设计,解决传统 WER/CER 指标在该场景下的局限。
我们开源两套用于评估印度语 ASR 的框架,并发布一份覆盖 22 种语言的完整评测指南。WER(词错误率)和 CER(字错误率)最初为英语等语言设计,而印度语言的表现形态不同,正式与口语形式并存。
相似文章
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
先有种子,后有目标:重新思考低资源Garhwali语音识别的评估
本文认为,低资源自动语音识别中的单次运行评估不可靠,并通过一个新的多种子Garhwali语音识别基准证明,许多已报告的提升在种子级测试下消失,而使用w2v-BERT 2.0的标准CTC仍然是最稳健的方法。
构建了一个开源网关,让现有的 ElevenLabs / OpenAI / Deepgram 应用只需更改一行代码即可在 Sarvam AI 上运行。
sarvam-bridge 是一个开源网关,只需修改基础 URL,即可让现有的 ElevenLabs/OpenAI/Deepgram 应用切换到 Sarvam AI,并处理印度语言的特殊问题,如分块、音频重组和语言代码。作者详细介绍了技术决策、压力测试和一个崩溃 bug 的修复。
SamaVaani:印度语言多语言临床ASR的审计与去偏
本文对印度语言的精神病学访谈中的多语言临床ASR系统进行了系统性审计,并提出了SamaVaani,一种统一的去偏技术,旨在提升跨人口群体的性能与公平性。
Voice of India:面向印度真实场景的大规模语音识别基准
研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。