建模有界性习得的发展性转变
摘要
本文介绍了一种使用GPT-2标记预测意外度来标注儿童语言中有界性的方法,发现儿童模型依赖于句法线索(如动词后限定词),而成人模型更多使用语义特征,支持了句法引导理论。
arXiv:2609.17996v1 公告类型:新
摘要:习得有界性,即区分有界事件(如吃了一个苹果)和无界事件(如吃了苹果),需要第一语言学习者将表层和语义线索映射到抽象的事件结构上,但这种映射的计算轨迹尚未被充分理解。我们引入了一种基于预测意外度差异的方法,该方法使用GPT-2标记预测意外度,通过成对的时间副词诊断(在一小时内与为时一小时)来自动标注英语CHILDES语料库中的有界性,并通过专家语言学家的判断进行验证。利用这些标签,我们在12个句法和词汇语义特征上训练诊断逻辑回归分类器,以比较儿童言语和儿童导向言语如何编码有界性。两个模型存在差异:儿童模型通过单一确定性线索(动词后限定词的存在)达到近乎完美的准确率,而成人模型更依赖动词类和其他词汇语义特征,限定词线索被中和。这一轨迹支持了句法引导理论:学习者首先利用高频结构线索作为支架进行引导,然后发展出完全组合的、基于动词的事件结构。
查看缓存全文
缓存时间: 2026/09/17 09:03
# 建模 telicity 习得过程中的发展性转变 来源: https://arxiv.org/abs/2609.17996 查看PDF (https://arxiv.org/pdf/2609.17996) > 摘要: telicity(即区分有界事件如“吃了一个苹果”与无界事件如“吃苹果”)的习得,要求母语学习者将表层与语义线索映射至抽象事件结构,但这一映射的计算过程尚未得到充分理解。本研究引入一种**惊讶度差异法**,通过 GPT2 对时间副词诊断对(“一小时内” vs “持续一小时”)的词元惊讶度进行分析,自动标注英语 CHILDES 语料库中的 telicity 特征,并经专业语言学家判断验证。基于这些标注,我们在 12 项句法与词汇语义特征上训练诊断性逻辑回归分类器,对比儿童语言与成人对儿童语言中 telicity 的编码方式。两个模型呈现差异:儿童模型通过单一确定性线索——动词后限定词的出现——达到近乎完美的准确率;而成人模型更依赖动词类别及其他词汇语义特征,且限定词线索的作用被弱化。这一发展轨迹支持**句法引导假说**:学习者首先利用高频结构线索作为脚手架进行引导式学习,而后逐步发展出基于动词的完全组合式事件结构。 ## 提交历史 来自: Ellie Xia [查看邮件 (https://arxiv.org/show-email/5806bb7e/2609.17996)] **[版本1]** 2026年9月16日 周三 01:34:11 UTC (915 KB)
相似文章
Transformer语言模型中情境建模与心理化的发育轨迹
本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。
语言再生:信息局部性对重建影响的探究
本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。
因果干预揭示多语言模型中的类型学组织句法机制
本文使用因果干预来研究多语言模型中的句法机制,揭示了基于类型学相似性的分级跨语言迁移。
搭配引导:关于人类与神经网络学习主谓一致的一种假说
本文提出搭配引导机制,即统计词语共现线索可辅助英语主谓一致的习得,并通过神经网络模拟和对儿童导向言语的分析予以支持。
通过行为微调对语言模型中的病理样行为模式进行建模
本文介绍了一个行为诱导框架,通过在结构化决策任务上微调语言模型,以引发生成分布中稳定的、上下文无关的偏移,从而模拟抑郁和偏执等病理样行为模式。