建模有界性习得的发展性转变

arXiv cs.CL 论文

摘要

本文介绍了一种使用GPT-2标记预测意外度来标注儿童语言中有界性的方法,发现儿童模型依赖于句法线索(如动词后限定词),而成人模型更多使用语义特征,支持了句法引导理论。

arXiv:2609.17996v1 公告类型:新 摘要:习得有界性,即区分有界事件(如吃了一个苹果)和无界事件(如吃了苹果),需要第一语言学习者将表层和语义线索映射到抽象的事件结构上,但这种映射的计算轨迹尚未被充分理解。我们引入了一种基于预测意外度差异的方法,该方法使用GPT-2标记预测意外度,通过成对的时间副词诊断(在一小时内与为时一小时)来自动标注英语CHILDES语料库中的有界性,并通过专家语言学家的判断进行验证。利用这些标签,我们在12个句法和词汇语义特征上训练诊断逻辑回归分类器,以比较儿童言语和儿童导向言语如何编码有界性。两个模型存在差异:儿童模型通过单一确定性线索(动词后限定词的存在)达到近乎完美的准确率,而成人模型更依赖动词类和其他词汇语义特征,限定词线索被中和。这一轨迹支持了句法引导理论:学习者首先利用高频结构线索作为支架进行引导,然后发展出完全组合的、基于动词的事件结构。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:03

# 建模 telicity 习得过程中的发展性转变
来源: https://arxiv.org/abs/2609.17996
查看PDF (https://arxiv.org/pdf/2609.17996)

> 摘要: telicity(即区分有界事件如“吃了一个苹果”与无界事件如“吃苹果”)的习得,要求母语学习者将表层与语义线索映射至抽象事件结构,但这一映射的计算过程尚未得到充分理解。本研究引入一种**惊讶度差异法**,通过 GPT2 对时间副词诊断对(“一小时内” vs “持续一小时”)的词元惊讶度进行分析,自动标注英语 CHILDES 语料库中的 telicity 特征,并经专业语言学家判断验证。基于这些标注,我们在 12 项句法与词汇语义特征上训练诊断性逻辑回归分类器,对比儿童语言与成人对儿童语言中 telicity 的编码方式。两个模型呈现差异:儿童模型通过单一确定性线索——动词后限定词的出现——达到近乎完美的准确率;而成人模型更依赖动词类别及其他词汇语义特征,且限定词线索的作用被弱化。这一发展轨迹支持**句法引导假说**:学习者首先利用高频结构线索作为脚手架进行引导式学习,而后逐步发展出基于动词的完全组合式事件结构。

## 提交历史

来自: Ellie Xia [查看邮件 (https://arxiv.org/show-email/5806bb7e/2609.17996)] **[版本1]** 2026年9月16日 周三 01:34:11 UTC (915 KB)

相似文章

Transformer语言模型中情境建模与心理化的发育轨迹

arXiv cs.CL

本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。

语言再生:信息局部性对重建影响的探究

arXiv cs.CL

本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。