Dango:一个严格仅限L1的大型语言模型,用于研究第二语言习得
摘要
Dango是一个18亿参数的大型语言模型,严格使用日语(L1)进行预训练,然后使用英语(L2)进行微调,以研究第二语言习得中的语言迁移效应。该模型从预训练语料库中过滤掉英语污染,并展现出类似人类的L2输出模式。
arXiv:2606.19170v1 公告类型:新
摘要:我们介绍了Dango,一个18亿参数的大型语言模型,旨在用于第二语言习得(SLA)中L1到L2(日语到英语)迁移的受控研究。虽然先前的研究已经在语言模型中探索了SLA,但它们主要依赖较小或非解码器模型,限制了生成开放式文本的能力,并降低了其作为实用L2模拟器的适用性。我们发现了将模型扩展到这一尺寸时的一个关键挑战:用于L1习得的“单语”预训练语料库中的L2污染。为了解决这个问题,我们提出了一种过滤方法,在保留现实的、最小暴露的同时,减少过早接触英语。然后,我们在LLM生成的L2学习课程上对模型进行微调,以模拟L2习得过程。我们的评估确认,Dango发展出类似人类的L2输出模式,优于未过滤和标准的多语言基线。我们发布了模型、数据和代码,以促进可重现的计算SLA研究和面向学习者的应用。
查看缓存全文
缓存时间: 2026/06/18 05:47
# 一个严格仅使用第一语言的大语言模型用于研究第二语言习得
来源:https://arxiv.org/html/2606.19170
Shiho Matta¹, Yin Jou Huang¹, Fei Cheng¹, Takashi Kodama², Hirokazu Kiyomaru², Yugo Murawaki¹
¹京都大学 ²NII-LLMC
{matta, huang, feicheng, murawaki}@nlp.ist.i.kyoto-u.ac.jp
{tkodama, kiyomaru}@nii.ac.jp
###### 摘要
我们介绍了 **Dango**,一个 1.8B 参数的大语言模型,旨在用于第二语言习得(SLA)中 L1→L2(日语→英语)迁移的可控研究。虽然以往的研究已经探索了语言模型中的 SLA,但它们主要依赖于较小或非解码器模型,限制了生成开放式文本的能力,并降低了其作为实用 L2 模拟器的适用性。我们发现将模型扩展到这一规模时面临一个关键挑战:用于 L1 习得的“单语”预训练语料中存在 L2 污染。为了解决这一问题,我们提出了一种过滤方法,以减少过早接触英语,同时保留真实的最小暴露。然后,我们在 LLM 生成的 L2 学习课程上对模型进行微调,以模拟 L2 习得过程。我们的评估证实,Dango 发展了类似人类的 L2 生产模式,优于未过滤和标准多语言基线。我们即将发布模型、数据和代码,以促进可重复的计算 SLA 研究和面向学习者的应用。¹¹¹我们即将发布模型、数据和代码。
**Dango: 一个严格仅使用第一语言的大语言模型用于研究第二语言习得**
Shiho Matta¹, Yin Jou Huang¹, Fei Cheng¹, Takashi Kodama², Hirokazu Kiyomaru², Yugo Murawaki¹
¹京都大学 ²NII-LLMC
{matta, huang, feicheng, murawaki}@nlp.ist.i.kyoto-u.ac.jp
{tkodama, kiyomaru}@nii.ac.jp
## 1 引言
第二语言习得(SLA)是指在第一语言(L1)已母语习得后学习第二语言(L2)。在人类中,L1 的影响在某些情况下促进 L2 学习,在另一些情况下则干扰,这一现象广泛称为语言迁移效应 Lado (1957 (https://arxiv.org/html/2606.19170#bib.bib26)); Odlin (1989 (https://arxiv.org/html/2606.19170#bib.bib27))。这可能导致说话者 L2 输出中某些语言特征的过度使用、回避和误用模式 Jarvis and Pavlenko (2008 (https://arxiv.org/html/2606.19170#bib.bib44))。例如,由于日语缺乏语法冠词系统,母语为日语的学习者在英语冠词使用上常常出现困难 Murakami and Alexopoulou (2015 (https://arxiv.org/html/2606.19170#bib.bib39))。这可能导致冠词省略错误,例如“I went to library”而非“I went to the library”。
参考图 1 说明:英语污染示例:严重的翻译对情况与日语使用者典型的少量英语暴露。
随着基于 Transformer 的语言模型(LMs)在众多语言任务上展现出强大性能 Lai et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib25)),许多研究探讨了它们是否也表现出此类人类迁移效应 Oba et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib5)); Aoyama and Schneider (2024 (https://arxiv.org/html/2606.19170#bib.bib6)); Yadavalli et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib10)); Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30))。这些研究从头开始依次在 L1 和 L2 上训练 LM,从而模拟人类学习语言的顺序。然后评估迁移效应,例如通过测试模型对 L2 的语法判断,并将其与人类倾向进行比较 Yadavalli et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib10))。尽管这些研究提供了关于 LM 中迁移效应的宝贵见解,但它们作为 L2 说话者实用模拟器的使用仍然有限。这主要归因于架构和规模的局限性。先前工作使用了仅编码器模型 Oba et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib5)); Yadavalli et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib10)); Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30)) 或小型仅解码器模型,例如 Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30)) 中的 137M 参数 GPT-2。因此,这些模型不太适合稳健的开放式或交互式生成,也不适用于潜在应用,例如 L2 学习者支持 Lyu et al. (2024 (https://arxiv.org/html/2606.19170#bib.bib15)) 和利用虚拟 L2 说话者进行教师培训 Vasmatzoglou and Ní Chiaráin (2020 (https://arxiv.org/html/2606.19170#bib.bib14))。
为了使未来的 SLA 研究拥有更现代、更强大的模型,并实现更广泛的实用应用,我们发布了 **Dango**,一个类似 Llama-2 的仅解码器 Transformer,以 L1→L2 的方式在更大规模上训练。Dango 具有 1.8B 参数,并在比以往工作多得多的数据上预训练,L1 阶段高达 100B 个 token。为了以这种规模训练 LLM,网络爬取文本是唯一可行的数据源 Hoffmann et al. (2022 (https://arxiv.org/html/2606.19170#bib.bib18))。然而,我们用于 L1 习得的日语网络语料包含了大量的意外英语暴露。我们将此问题称为 **L2 污染**。虽然日语使用者通过外来词、专有名词和语码转换自然接触到英语 Hyde (2002 (https://arxiv.org/html/2606.19170#bib.bib32)); Stanlaw (2004 (https://arxiv.org/html/2606.19170#bib.bib16)),但在课堂式教育环境之外,系统性地习得英语相对罕见 Barrs (2020 (https://arxiv.org/html/2606.19170#bib.bib33))。因此,自然需要将语料重塑为更接近典型日语使用者环境的状态:去除结构性英语内容(例如最坏情况下的翻译对),同时保留少量英语,如品牌名称和简单短语(图 1 (https://arxiv.org/html/2606.19170#S1.F1))。
我们设计了一个过滤流水线,去除过多的英语暴露,将语料大小减少了 30%(图 2 (https://arxiv.org/html/2606.19170#S1.F2))。在 L2 习得阶段,我们在 LLM 合成的类似教科书的课程上对 Dango 进行微调。课程遵循渐进的难度进展,因为它们基于从带难度标签的词表中提取的英语种子词。课程以日语和英语为锚,包含:(i) 种子词的日语解释,(ii) 使用该词的英语示例句,配以日语翻译,以及 (iii) 针对相关语法或用法的简短日语评论。通过这种方式,Dango 在接触英语的同时,指令和元语言推理以其 L1 进行,这反映了常见的教科书学习实践 Nakayama (2022 (https://arxiv.org/html/2606.19170#bib.bib34))。
我们的实验表明,Dango 获得了英语生成能力,包括生成其严格过滤的预训练数据中不存在的长英语句子的能力。评估进一步显示,在所有方法中,Dango 的英语输出最接近人类日语英语学习者的输出,优于未过滤和多语言基线,并与带提示的 GPT-5.5 相匹配。这些结果提供了成功语言迁移的证据。我们发布 Dango 的代码和检查点,以支持可控的 SLA 研究和实际应用。
参考图 2:我们提出的方法论概览。
## 2 相关工作
### 2.1 使用语言模型(LMs)的第二语言习得(SLA)
##### 通过 L1→L2 设置训练来建模 SLA。
以往研究依次在 L1 和 L2 上训练 LM 以模拟人类 L2 习得。Oba et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib5)) 训练了 18M 参数的仅编码器模型,并分析了不同的 L1 预训练语言如何塑造 L2 语法泛化的轨迹和最终成功。Yadavalli et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib10)) 也训练了 110M 参数的仅编码器模型,但旨在隔离正迁移和负跨语言迁移。Aoyama and Schneider (2024 (https://arxiv.org/html/2606.19170#bib.bib6)) 训练了 11M 参数(我们的估计)的 GPT-2 模型作为 L2 英语说话者,研究迁移效应,并显示 LM 的 surprisal 有助于预测 L2 英语阅读者的逐词阅读时间。Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30)) 训练了 125M 参数的仅编码器和 137M 参数的仅解码器模型,但其重点在于重现人类中观察到的关键期效应,而非直接检验迁移效应。
##### 训练数据。
训练数据是建模 SLA 的核心。一些工作尝试通过使用源自人类语音的数据来创建更类似人类的设置。例如,Yadavalli et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib10)) 使用了面向儿童的语音,Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30)) 部分使用了口语数据。然而,这些数据源规模有限,Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30)) 不得不包含网络文本以获得足够的数据和跨语言覆盖。另一方面,Oba et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib5)) 和 Aoyama and Schneider (2024 (https://arxiv.org/html/2606.19170#bib.bib6)) 依赖 CC-100 Conneau et al. (2020 (https://arxiv.org/html/2606.19170#bib.bib36)); Wenzek et al. (2020 (https://arxiv.org/html/2606.19170#bib.bib35)) 网络爬取数据进行 L1 训练。
##### 评估迁移效应。
Oba et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib5)), Aoyama and Schneider (2024 (https://arxiv.org/html/2606.19170#bib.bib6)), Yadavalli et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib10)), 和 Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30)) 使用了 BLiMP Warstadt et al. (2020 (https://arxiv.org/html/2606.19170#bib.bib7)) 来测量 L2(英语)语法泛化。其他探测方法包括困惑度 Aoyama and Schneider (2024 (https://arxiv.org/html/2606.19170#bib.bib6)); Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30))、模型 surprisal Aoyama and Schneider (2024 (https://arxiv.org/html/2606.19170#bib.bib6)) 和基于知识的多项选择题 Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30))。然而,由于这些探测方法完全依赖现有基准中的预定义输入,它们并未真正测试模型的生成能力。为解决此限制,我们使用 Gao et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib4)) 引入的自动 LLM-as-a-judge 框架评估 Dango 英语文本生成中的迁移效应。我们直接在模型输出中标注语言特征,将其分布与真实人类 L2 输出进行比较。
### 2.2 控制预训练期间的知识暴露
##### 具有知识截止的 LLM。
最近的努力强调了严格受限的预训练环境的必要性,以从标准 LLM 中固有的海量数据污染中隔离特定现象。例如,TimeCapsule LLM 仅使用限定历史时期的文本进行训练,以准确模拟该时代的词汇和世界观,而不受现代概念的侵入。²²²https://github.com/haykgrigo3/TimeCapsuleLLM 类似地,History LLMs 从头开始训练,使用严格的时间知识截止,完全防止未来知识的泄露。³³³https://github.com/DGoettlich/history-llms 这些项目表明,真正的行为模拟需要可验证的、无污染的训练基线。
##### 网络语料中的 L2 污染。
L2 污染在第二语言习得和迁移效应的可控研究中至关重要。由于语言识别不完美,旨在为非英语的语料通常仍然包含英语数据 Caswell et al. (2020 (https://arxiv.org/html/2606.19170#bib.bib37))。在受控实验中,这种意外暴露可能会引入意外的跨语言迁移 Blevins and Zettlemoyer (2022 (https://arxiv.org/html/2606.19170#bib.bib38))。这个问题可能也适用于先前使用网络语料训练的工作 Oba et al. (2023 (https://arxiv.org/html/2606.19170#bib.bib5)); Aoyama and Schneider (2024 (https://arxiv.org/html/2606.19170#bib.bib6)); Constantinescu et al. (2025 (https://arxiv.org/html/2606.19170#bib.bib30)),尽管任何由此产生的失败在其规模上可能过于细微而难以检测。据我们所知,我们的工作是第一个直接解决计算 SLA 中 L2 污染问题的研究。
## 3 方法论
Dango 的训练包括两个阶段(图 2 (https://arxiv.org/html/2606.19170#S1.F2))。首先,我们通过在严格过滤的日语语料上预训练一个仅解码器语言模型来建模 L1(日语)习得(§3.1 (https://arxiv.org/html/2606.19170#S3.SS1)),得到 **Dango-pretrained** 模型。其次,我们通过在 LLM 生成的 L2 学习数据上微调预训练模型来建模 L2(英语)习得,得到 **Dango**(§3.2 (https://arxiv.org/html/2606.19170#S3.SS2))。
### 3.1 L1 习得
我们对日语语料进行了过滤,以去除非日语暴露,并在所得数据上训练了一个仅解码器 Transformer 模型。
#### 3.1.1 L1 习得语料与过滤
为了从既定基线开始我们的研究,我们采用了 llm-jp 项目发布的训练语料 llm-jp-corpus-v3。⁴⁴⁴https://gitlab.llm-jp.nii.ac.jp/datasets/llm-jp-corpus-v3/-/tree/main 该完整语料是多语言的,包含日语、英语、中文、韩语和代码数据。在本工作中,我们仅使用了日语部分,主要由日语 Common Crawl 数据⁵⁵⁵https://commoncrawl.org/ 和来自国会图书馆网络存档项目(WARP)的 PDF 数据组成。⁶⁶⁶日本国立国会图书馆。NDL Web Archiving Project (WARP),https://warp.ndl.go.jp/。尽管如此,我们观察到该子集仍然包含不可忽视的英语文本。我们构建了一个过滤流水线,以限制对英语语法和长结构化英语句子的暴露,这些可能混淆 L1→L2 迁移 Barrs (2020 (https://arxiv.org/html/2606.19170#bib.bib33)); Blevins and Zettlemoyer (2022 (https://arxiv.org/html/2606.19170#bib.bib38)),同时保留日语文本中常见的良性英语信号,如日常词汇、短语和专有名词 Hyde (2002 (https://arxiv.org/html/2606.19170#bib.bib32)); Stanlaw (2004 (https://arxiv.org/html/2606.19170#bib.bib16))。该流水线结合了白名单过滤和黑名单过滤,分别在文档级别和行级别应用。
白名单过滤定义了以日语为中心的文本允许的字符集,包括日语假名、常见中日韩统一表意文字、标点符号、符号和其他常见标记。字符超出清单比例超过 1‰ 的文档被丢弃,这移除了大多数非中日韩和非拉丁字符的文本,如俄语和阿拉伯语。接下来,黑名单过滤移除包含过多英语或中文字符的按“\\n”分隔的行。例如,英语过滤器移除包含超过四个连续英语单词、超过 20 个拉丁字母或日语与英文字符比例低于 40% 的行。如果文档中超过 5% 的行被移除,则整个文档被丢弃,以避免上下文受损。进一步的实现细节见附录 A (https://arxiv.org/html相似文章
大语言模型中的语言习得装置
本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。
DataFlex:面向大语言模型数据驱动动态训练的统一框架
DataFlex是一个面向大语言模型数据驱动动态训练的统一框架,集成了样本选择、领域混合调整和样本重加权,兼容标准工作流程并支持高效大规模部署,相比静态训练实现了一致的性能提升。
东干语的形态核心:双方言有限状态模型与多体裁评估
提出了一种用于东干语的双方言有限状态形态分析器,并通过多体裁评估来衡量词形变化、歧义和词汇覆盖情况。
改进的大型语言扩散模型
iLLaDA是一个80亿参数的掩码扩散语言模型,具有完全双向注意力机制,从头开始在12万亿token上训练。与LLaDA相比,它在多个方面都有显著改进,并在多个基准测试上与Qwen2.5 7B保持竞争力。模型和代码已开源。
DiaLLM:英语方言适应中鲁棒性与生成能力差距的研究
本文介绍了DiaLLM,一个将LLMs适应英语方言的框架,揭示了方言鲁棒性(理解)与生成(产生方言文本)之间的差距,并表明明确的变体目标对齐能改进生成,但不一定符合人类偏好。