标签
本文开发了一种用于形式语义的向量逻辑,描述了压缩向量表示何时允许对真值条件进行精确线性或仿射读出,并在GloVe和word2vec嵌入上进行了实验。
本文介绍了一种使用GPT-2标记预测意外度来标注儿童语言中有界性的方法,发现儿童模型依赖于句法线索(如动词后限定词),而成人模型更多使用语义特征,支持了句法引导理论。
FrameBench 是一个新的基准,用于评估大型语言模型是否能区分动词在上下文中的依赖框架语义的解释,针对英语和日语构建,使用 FrameNet 资源,并随代码发布。
本文提出了一种用于标注中文学习者写作中语法错误的分层分类体系,结合了计算和教学视角,并通过覆盖分析和与语言模型的一致性研究进行评估。
本研究使用多语言编码器来测量Wikipedia各语言版本间的框架差异,发现宗教和政治概念的分歧大于科学概念。
SynFlow 是一个开源工具包,用于多维度历时语义分析,通过共享的工作流程应用于语言表示,以研究句法、形态学和其他维度的词汇语义变化。
本文探讨了共享语言技术如何导致不对称的话语同质化,并基于Reddit讨论的实证证据。
本文提出了一种无监督方法,用于提取语言隐喻并将其分组为概念隐喻,并将该方法应用于分析左倾与右倾播客之间的框架差异。
本文介绍了一种使用Qwen3-8B的激活引导神经元干预框架,用于诱导阿尔茨海默病相关的计算语言表型,证明放大与AD相关的神经元会在多个认知领域产生分级损伤。
This paper tests whether statistical measures used to argue that undeciphered scripts like the Indus script encode language are specific to language, using a generative emblem system called Sigil. It finds that these measures detect organization without being specific to language, undermining claims that they establish encoded speech.
本文重新思考了“状态”这一语言学概念,将其视为跨综合语言的一种系统性形态句法机制,在基于模板的模块化认知框架中将其形式化为语法模板上的集值函数,并提供了一个统一的计算学习理论解释。
本研究应用计算语言学和监督式机器学习,仅凭文本描述即可预测早期初创企业的退出情况,发现创始人叙述携带预测信号,并引入了一个可量化的夸张得分(Hyping Score)。
作者使用迭代学习模型研究意义频率如何影响演化语言中组合性、表达性和稳定性的涌现。他们发现,高频的整体意义可以逃脱语法压力,但应用于子意义部分的频率会导致传播失败。
提出了一种用于东干语的双方言有限状态形态分析器,并通过多体裁评估来衡量词形变化、歧义和词汇覆盖情况。
本书探讨了代数模型与深度学习在自然语言习得中的作用,汇集了计算语言学、心理学和数理语言学领域顶尖研究者的观点。
本文介绍语义场理论(SFT),这是一种用于词汇语义的计算模型,通过语义场、语境变形、交互项和能量最小化来建模意义。提供了包括高斯积闭包、用于高阶交互的莫比乌斯反演和稳定性条件在内的形式化元素。
本研究表明,语境语义相关性(衡量一个词与其近期语义上下文的关联强度)能够可靠地预测两个数据集中自然言语理解过程中的fMRI BOLD响应,而意外度(局部概率期望)则不能。研究结果支持缓慢的血流动力学响应对语境语义整合(而非局部预测)尤为敏感。
本文将早期语言习得建模为基于图的心理词典上的搜索,采用扩散激活和类别探索,在模拟四种语言的规范词汇习得方面优于最短路径基线。
Emily Bender 澄清了她2021年论文中“stochastic parrots”的原始含义,驳斥了关于大语言模型的常见误解,并批评“人工智能”一词过度推销技术。
Svarna 是一个面向现代希腊语的开源网络语料库工作台,整合了多个数据库,包含超过 5.07 亿词,并提供多种语言分析工具,采用 MIT 许可证发布。