corpus-linguistics

标签

Cards List
#corpus-linguistics

Observatorio Lázaro:西班牙新闻界英语借词使用的自填充数据库

arXiv cs.CL · 2026-08-04 缓存

本文介绍了 Observatorio Lázaro,这是一个持续更新的数据库和公共网络/API 资源,利用神经序列标注模型监测西班牙数字新闻中的英语借词使用情况,记录了 2020 年至 2026 年间超过两百万条借词。

0 人收藏 0 人点赞
#corpus-linguistics

对北京话和台湾话口语语料库的语音和语义分析表明,轻声是一个词调

arXiv cs.CL · 2026-06-26 缓存

本文介绍了一项基于语料库的研究,通过对北京话和台湾话口语语料库的语音和语义分析,使用广义加性模型和上下文嵌入,表明普通话中的轻声是一个具有自身调目标的词调。

0 人收藏 0 人点赞
#corpus-linguistics

语言学奥林匹克竞赛:迈向语言学研究的新语料库?

arXiv cs.CL · 2026-06-15 缓存

本文提出利用语言学奥林匹克竞赛数据构建新的语言学研究语料库,旨在推动该领域发展。

0 人收藏 0 人点赞
#corpus-linguistics

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL · 2026-05-25 缓存

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈