IndicTalk:面向印度语言的基于角色的大规模多语言对话语料库
摘要
IndicTalk 是一个大规模多语言对话语料库,涵盖9种印度语言,包含代码混合对话,通过自动化流水线生成,结合新闻基础(news grounding)和角色条件(persona conditioning),旨在推动面向代表性不足语言的对话AI发展。
arXiv:2607.23242v1 Announce Type: new
摘要:大型语言模型(LLMs)已改变了对话AI,但高质量的多语言代码混合对话资源仍然稀缺,尤其对于印度语言,因为说话者自然地在其母语和英语之间切换,包括本土文字和罗马化形式。我们提出了IndicTalk,这是最大的多语言印度代码混合对话语料库之一,包含超过1,328,604个基于事件的多轮对话,涵盖18种语言变体,涉及9种印度语言。该语料库通过全自动化流水线生成,结合真实世界新闻基础、使用多语言LLM的角色条件对话生成以及自动质量验证。广泛的语言学、自动和人工评估表明,IndicTalk在两种文字变体上都能产生流畅、连贯且自然代码混合的对话。我们将发布IndicTalk,以支持面向代表性不足的印度语言的多语言对话AI的开发与评估。该数据集可在以下网址获取:https://huggingface.co/datasets/LingoIITGN/IndicTalk
查看缓存全文
缓存时间: 2026/07/28 06:28
# IndicTalk:面向印度语言的大规模基于人格的多语种对话语料库 来源:https://arxiv.org/abs/2607.23242 查看 PDF (https://arxiv.org/pdf/2607.23242) > 摘要:大型语言模型(LLM)已彻底改变了对话式AI,但高质量的多语种代码混合对话资源仍然稀缺,尤其是在印度语言中——说话者自然地在英语和母语之间切换,并且同时使用原生文字和罗马化形式。我们推出了IndicTalk,这是目前最大的多语种印度语代码混合对话语料库之一,包含超过1,328,604个基于事件的多轮对话,涵盖9种印度语言的18种语言变体。该语料库通过一个完全自动化的流水线生成,该流水线结合了真实世界新闻事件驱动、基于多语种LLM的人格条件对话生成,以及自动质量验证。广泛的语言学、自动化和人工评估表明,IndicTalk在两种文字变体下都能产生流畅、连贯、自然代码混合的对话。我们将发布IndicTalk,以支持欠代表性印度语言的多语种对话式AI的开发与评估。数据集可在以下网址获取:this https URL (https://huggingface.co/datasets/LingoIITGN/IndicTalk)。 ## 提交历史 来自:Sahil Gawande [查看邮箱 (https://arxiv.org/show-email/da6b7807/2607.23242)] **[v1]** 2026年7月25日星期六 14:56:15 UTC (405 KB)
相似文章
通过经验回放和模型融合对 IndicTrans2 在 21 种印度语言上进行会话域适应
本文通过经验回放和模型融合技术,将 IndicTrans2-1B 适应到 21 种印度语言的会话语域,在保持通用领域性能的同时取得了会话性能提升,但人工评估表明,基于指标的性能提升可能并未反映感知质量的改善。
IndicMedDialog:面向印度语言可及医疗的并行多轮医疗对话数据集
IndicMedDialog 是一个并行多轮医疗对话数据集,涵盖英语和九种印度语言,并包含一个微调模型,用于个性化症状询问。该数据集源自 MDDial,通过LLM生成的合成咨询和专家验证进行增强,支持多语言医疗AI。
Indic DiarBench:面向印度语言的多语言联合说话人日志与自动语音识别基准
Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。
Voice of India:面向印度真实场景的大规模语音识别基准
研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。
从词汇到AI:面向低资源语言专业对话系统的结构化数据流水线
提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。