通过扩散激活与类别探索在复杂网络中的早期语言学习
摘要
本文将早期语言习得建模为基于图的心理词典上的搜索,采用扩散激活和类别探索,在模拟四种语言的规范词汇习得方面优于最短路径基线。
arXiv:2607.06258v1 公告类型:新论文
摘要:儿童词汇习得在语义和词汇类别方面是否不均匀?为了回答这个问题,我们将早期语言学习建模为基于图的心理词典上的搜索,由两个相互影响的过程驱动:扩散激活和词汇类别的强制探索(而非利用)。我们使用四种语言(德语、英语、荷兰语和拉普拉塔河西班牙语)评估模型性能,以CDI作为词汇类别的真实数据,来自Wordbank数据库的规范年龄,以及用于重建词语相似度图的最先进资源。我们发现扩散激活在模拟规范词汇习得方面优于最短路径基线。在类别层面,我们强调了CDI之间的复杂转换。通过研究它们在突发性和同一CDI内平均持久时间方面的序列,我们发现扩散激活更好地捕捉到了经验观察到的探索动态。总体而言,我们的发现表明,词汇发展可以通过激活动力学与调节词汇类别访问的某种约束之间的复杂相互作用来理解。
查看缓存全文
缓存时间: 2026/07/08 04:42
# 早期语言学习中复杂网络内的激活扩散与类别探索 来源:https://arxiv.org/abs/2607.06258 查看 PDF (https://arxiv.org/pdf/2607.06258)HTML(实验性)(https://arxiv.org/html/2607.06258v1) > **摘要:**儿童词汇习得是否在语义和词汇类别上存在不均衡现象?为回答这一问题,我们将早期语言学习建模为基于图的心理词典中的一次搜索过程,由两种相互作用的机制驱动:激活扩散机制,以及对词汇类别实施强制性探索(而非利用)的机制。我们使用CDI(交际发展量表)作为词汇类别的真实数据,从Wordbank语料库获取规范年龄信息,并利用最先进的资源构建词语相似度图,在四种语言(德语、英语、荷兰语和里奥普拉塔西班牙语)上评估模型性能。我们发现,在模拟规范词汇习得过程中,激活扩散机制优于基于最短路径的基线模型。在类别层面,我们揭示了CDI之间的复杂转换。通过研究这些转换序列的突发性及在同一CDI内的平均驻留时间,我们发现激活扩散机制能更好地捕捉经验观察到的探索动态。总体而言,我们的研究结果表明,词汇发展可以通过激活动态与约束词汇类别访问的某种程度调节之间的非平凡相互作用来理解。 ## 提交历史 来自:Salvatore Citraro [查看邮件](https://arxiv.org/show-email/6fdc9121/2607.06258) **[v1]** 2026年7月7日 星期二 13:25:18 UTC(12,927 KB)
相似文章
跨语言探索参数化知识
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。
大语言模型中的语言习得装置
本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。
跨语言模型架构的神经激活模式:认知任务性能的综合分析
本文分析了六种LLM架构在认知任务上的神经激活模式,揭示了编码器和解码器模型在注意力熵和稀疏性上的差异。
词类表征从基于自然语言训练的后继表征中自发涌现
本文将从强化学习中继承的后继表征应用于自然语言,训练神经网络预测未来词的期望分布。研究表明,词性、词汇子类等语言类别无需显式监督即可自发涌现。
发展性方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化
本文采用发展性方法研究神经语言模型(特别是Transformer)如何从人工语法中学习统计模式,发现它们首先获取全局抽象统计信息,然后学习局部依赖关系,并在早期出现过度泛化。