标签
本文介绍了 Observatorio Lázaro,这是一个持续更新的数据库和公共网络/API 资源,利用神经序列标注模型监测西班牙数字新闻中的英语借词使用情况,记录了 2020 年至 2026 年间超过两百万条借词。
本文介绍了一项基于语料库的研究,通过对北京话和台湾话口语语料库的语音和语义分析,使用广义加性模型和上下文嵌入,表明普通话中的轻声是一个具有自身调目标的词调。
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。