标签
本文挑战了关于Voynich手稿语言单元的标准假设,通过定量分析表明,字形、记号和空格并不如普遍认为的那样对应于字母、单词和单词间隔。
本文系统比较了decoder-only语言模型在人工语言和自然语言中的词序偏好,发现这些偏好是数据驱动的,并且随着LLMs的广泛采用,可能会减少语言多样性。
本文研究内涵照应,认为基于描述的前提比现有的基于价值的解释更能说明代词的许可条件,并在一种名为 Plural Intensional Presuppositional predicate calculus (PIP) 的新逻辑中形式化了这一提议。
本文对古典阿拉伯语形态学进行数学建模,以反驳索绪尔的任意符号论和后现代语义不确定性,证明阿拉伯语词汇意义通过词根-词式配对在结构上被决定,并显示其与印欧语言相比存在系统复杂度不对称性。
本文认为,大语言模型的输出展现出类似人类个人言语的模型特定语言特征,通过分析2024年和2026年的语料库,揭示了代际变化以及稳定的个体模型画像。
本文探讨了汉语方言中语调与词汇声调的相互作用,利用边界现象考察疑问句与陈述句等句子层面功能的基频线索,并讨论了理论模型。
This paper probes character-level transformers to investigate whether they encode the Spanish L-shaped morphome, an irregular morphological pattern, as an abstract class or just surface alternations. The authors find that the encoding is item-specific and localized, but does not generalize like human learners.
This paper critiques recent methods claiming abstraction-first learning in large language models, showing that pure exemplar models can mimic abstraction-first learning depending on input distributional properties.
ChronoLens是一个框架,利用多语言语言模型和crosscoders测量五个议会传统(1803–2026年)中4498万篇文档跨语言层面的历史语言变化,表明变化幅度和方向在不同语言和不同时间会有所不同。
AI可以通过压缩手动交叉引用的过程来加速破译失传语言,但没有比较锚点和严格的人工审核,它无法产生确定的翻译,因为意义和统计模式并不相同。
本文提出一个标度律,表明人类语言中词序的上下文影响随距离近似以1/d的速率衰减,该衰减通过大型语言模型测得的困惑度降低来衡量,且在不同语言和语料库中均成立。
对Kalle Lyytinen的一次采访,他回顾了自己1985年在《MIS Quarterly》上发表的关于信息系统语言理论的文章,并讨论了其对现代AI(包括大语言模型和生成式AI)的影响。
本书探讨了代数模型与深度学习在自然语言习得中的作用,汇集了计算语言学、心理学和数理语言学领域顶尖研究者的观点。
本文认为,埃兰·巴伦霍茨(Elan Barenholtz)基于大语言模型行为提出的自生语言理论,通过为前瞻开放性以及语言与非语言符号的连续性提供结构机制,丰富了罗伊·哈里斯(Roy Harris)的整合语言学,为计算方法提供了解释性内容。
斯坦福NLP宣布,一篇题为《大语言模型中的未完成体悖论》的语言学视角NLP论文在ACL 2026上获得最佳论文奖,鼓励对大语言模型进行更细致的语言学评估。
本文分析了122种语言,表明依存长度最小化在功能性依存(短且不变)与词汇性依存(较长且可变)上的作用不同,这表明语法为语言处理提供了局部支撑。