indic-languages

标签

Cards List
#indic-languages

VakyArth: 评估LLMs在印度语言中的语用能力

arXiv cs.CL · 2026-09-03 缓存

本文介绍了VakyArth,这是首个针对印度语言的语用基准,评估LLMs在印地语、旁遮普语、泰米尔语和马拉雅拉姆语中的文化和上下文推理能力。研究发现模型在语用意义方面存在持续性失败,且在不同语言和任务间存在系统性差异。

0 人收藏 0 人点赞
#indic-languages

SuTRA:结构统一的词元化与根词意识

arXiv cs.CL · 2026-08-20 缓存

SuTRA是一种形态感知的词元化算法,它保留了印度语言中akshara的不可分割性,减少了形态破碎现象,并在机器翻译指标上相较于标准BPE方法有所提升。

0 人收藏 0 人点赞
#indic-languages

L3Cube-IndicQuest v2: 用于评估大型语言模型在印度语言中事实知识的大规模多语言基准测试

arXiv cs.CL · 2026-08-18 缓存

文章介绍了L3Cube-IndicQuest v2,这是一个大规模多语言基准测试,旨在评估大型语言模型在印度语言中的事实知识,并展示了六个模型的评估结果。

0 人收藏 0 人点赞
#indic-languages

用于资源匮乏的东北印度语言的BM25增强多示例翻译

arXiv cs.CL · 2026-08-17 缓存

本文提出了一种使用BM25和Gemini 2.5 Flash的检索增强翻译系统,针对资源匮乏的东北印度语言,提交至WMT26共享任务,无需模型微调。

0 人收藏 0 人点赞
#indic-languages

SurakshaEval:面向多语言大语言模型的印度语言安全基准

arXiv cs.CL · 2026-08-11 缓存

介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。

0 人收藏 0 人点赞
#indic-languages

构建了一个开源网关,让现有的 ElevenLabs / OpenAI / Deepgram 应用只需更改一行代码即可在 Sarvam AI 上运行。

Reddit r/ArtificialInteligence · 2026-08-08

sarvam-bridge 是一个开源网关,只需修改基础 URL,即可让现有的 ElevenLabs/OpenAI/Deepgram 应用切换到 Sarvam AI,并处理印度语言的特殊问题,如分块、音频重组和语言代码。作者详细介绍了技术决策、压力测试和一个崩溃 bug 的修复。

0 人收藏 0 人点赞
#indic-languages

IndicTalk:面向印度语言的基于角色的大规模多语言对话语料库

arXiv cs.CL · 2026-07-28 缓存

IndicTalk 是一个大规模多语言对话语料库,涵盖9种印度语言,包含代码混合对话,通过自动化流水线生成,结合新闻基础(news grounding)和角色条件(persona conditioning),旨在推动面向代表性不足语言的对话AI发展。

0 人收藏 0 人点赞
#indic-languages

Indi-RomCoM:评估LLM在罗马化印度语-英语混合指令上的代码混合基准

arXiv cs.CL · 2026-07-01 缓存

介绍了Indi-RomCoM,这是一个用于评估LLM在四种印度语言罗马化代码混合(RCM)指令上的基准,发现LLM在RCM任务上表现不佳,且性能随代码混合密度增加而下降。

0 人收藏 0 人点赞
#indic-languages

通过经验回放和模型融合对 IndicTrans2 在 21 种印度语言上进行会话域适应

arXiv cs.CL · 2026-06-30 缓存

本文通过经验回放和模型融合技术,将 IndicTrans2-1B 适应到 21 种印度语言的会话语域,在保持通用领域性能的同时取得了会话性能提升,但人工评估表明,基于指标的性能提升可能并未反映感知质量的改善。

0 人收藏 0 人点赞
#indic-languages

基于波你尼语法的印度语言处理基础

arXiv cs.CL · 2026-06-24 缓存

本文提出了一套基于波你尼语法的基准套件,旨在统一跨印度语言的处理,提高准确性、数据效率和可迁移性。

0 人收藏 0 人点赞
#indic-languages

LLM-as-Judge的几何学:为何LLM间共识并非人类对齐

arXiv cs.CL · 2026-06-03 缓存

本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。

0 人收藏 0 人点赞
#indic-languages

多阶段训练用于检测印度语言中的辱骂评论

arXiv cs.CL · 2026-05-22 缓存

本文提出了一种多阶段训练流程,利用基于语言的预处理和模型集成来检测印度语言中的辱骂评论,旨在最小化误报,同时保护言论自由。

0 人收藏 0 人点赞
#indic-languages

SCRIBE:面向Indic ASR的诊断评估与富转录模型

arXiv cs.CL · 2026-05-21 缓存

SCRIBE 是一个用于自动语音识别的诊断评估框架,为印度语言提供分类错误分解,并发布了 Hindi、Malayalam 和 Kannada 的基准和开源权重富转录模型。

0 人收藏 0 人点赞
#indic-languages

发布了免费的980万文档印度语系多语言语料库——印地语、孟加拉语、泰米尔语、泰卢固语及其他7种语言 (CC0许可, HuggingFace) [P]

Reddit r/MachineLearning · 2026-05-18

在HuggingFace上发布了一个免费的980万文档多语言印度语系语料库(11种语言,CC0许可),包含约84亿个token,专为多语言研究而构建。

0 人收藏 0 人点赞
#indic-languages

面向印地语系语言的视觉引导电影字幕翻译

arXiv cs.CL · 2026-05-13 缓存

本文针对资源匮乏的印地语系语言进行了一项关于视觉引导电影字幕翻译的案例研究,证明选择性视觉接地(visual grounding)在解决时间错位挑战的同时,能够有效提升翻译质量。

0 人收藏 0 人点赞
#indic-languages

IndicMedDialog:面向印度语言可及医疗的并行多轮医疗对话数据集

Hugging Face Daily Papers · 2026-05-13 缓存

IndicMedDialog 是一个并行多轮医疗对话数据集,涵盖英语和九种印度语言,并包含一个微调模型,用于个性化症状询问。该数据集源自 MDDial,通过LLM生成的合成咨询和专家验证进行增强,支持多语言医疗AI。

0 人收藏 0 人点赞
#indic-languages

Voice of India:面向印度真实场景的大规模语音识别基准

arXiv cs.CL · 2026-04-22 缓存

研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈