标签
本文分析了波兰语中的BPE分词,重点探讨其在屈折语中的局限性,并提出通过语法形式锚定来改进语言模型。
本文提出了一种用于标注中文学习者写作中语法错误的分层分类体系,结合了计算和教学视角,并通过覆盖分析和与语言模型的一致性研究进行评估。
SynFlow 是一个开源工具包,用于多维度历时语义分析,通过共享的工作流程应用于语言表示,以研究句法、形态学和其他维度的词汇语义变化。
本文研究了多语言大语言模型生成的文本是否表现出翻译腔的迹象,并将其与人工翻译进行比较,以评估语言的自然度。
本文评估了Wiktionary作为符合伦理的众包英语方言词典,展示了其与传统词典相比的覆盖范围以及在地理标记社交媒体数据上的表现。
本文介绍了一个用于主动对话智能体的多模态情绪识别模块,该模块结合了面部识别与语言分析。一项涉及20名参与者的用户研究发现了一种“扑克脸”效应,即视觉线索不可靠,而语言分析则更为准确;研究还表明,智能体可以通过对话适应性来引发情绪。
一篇预印本提出包含33种特征的量化语言学框架,可区分专业编辑与自出版书籍,表现优于现有故事级评估指标。
本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。