IndicTalk:面向印度语言的基于角色的大规模多语言对话语料库

arXiv cs.CL 论文

摘要

IndicTalk 是一个大规模多语言对话语料库,涵盖9种印度语言,包含代码混合对话,通过自动化流水线生成,结合新闻基础(news grounding)和角色条件(persona conditioning),旨在推动面向代表性不足语言的对话AI发展。

arXiv:2607.23242v1 Announce Type: new 摘要:大型语言模型(LLMs)已改变了对话AI,但高质量的多语言代码混合对话资源仍然稀缺,尤其对于印度语言,因为说话者自然地在其母语和英语之间切换,包括本土文字和罗马化形式。我们提出了IndicTalk,这是最大的多语言印度代码混合对话语料库之一,包含超过1,328,604个基于事件的多轮对话,涵盖18种语言变体,涉及9种印度语言。该语料库通过全自动化流水线生成,结合真实世界新闻基础、使用多语言LLM的角色条件对话生成以及自动质量验证。广泛的语言学、自动和人工评估表明,IndicTalk在两种文字变体上都能产生流畅、连贯且自然代码混合的对话。我们将发布IndicTalk,以支持面向代表性不足的印度语言的多语言对话AI的开发与评估。该数据集可在以下网址获取:https://huggingface.co/datasets/LingoIITGN/IndicTalk
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:28

# IndicTalk:面向印度语言的大规模基于人格的多语种对话语料库
来源:https://arxiv.org/abs/2607.23242  
查看 PDF (https://arxiv.org/pdf/2607.23242)

> 摘要:大型语言模型(LLM)已彻底改变了对话式AI,但高质量的多语种代码混合对话资源仍然稀缺,尤其是在印度语言中——说话者自然地在英语和母语之间切换,并且同时使用原生文字和罗马化形式。我们推出了IndicTalk,这是目前最大的多语种印度语代码混合对话语料库之一,包含超过1,328,604个基于事件的多轮对话,涵盖9种印度语言的18种语言变体。该语料库通过一个完全自动化的流水线生成,该流水线结合了真实世界新闻事件驱动、基于多语种LLM的人格条件对话生成,以及自动质量验证。广泛的语言学、自动化和人工评估表明,IndicTalk在两种文字变体下都能产生流畅、连贯、自然代码混合的对话。我们将发布IndicTalk,以支持欠代表性印度语言的多语种对话式AI的开发与评估。数据集可在以下网址获取:this https URL (https://huggingface.co/datasets/LingoIITGN/IndicTalk)。

## 提交历史

来自:Sahil Gawande [查看邮箱 (https://arxiv.org/show-email/da6b7807/2607.23242)]  
**[v1]** 2026年7月25日星期六 14:56:15 UTC (405 KB)

相似文章