教育科技中的激励因素:EduNLP研究的系统综述

arXiv cs.CL 论文

摘要

这项对204篇EduNLP论文的系统综述揭示,教师作为受影响最大的群体,在受益者中代表性不足;实际部署仍属罕见;伦理参与更倾向于承认而非行动——突显了私营部门激励因素与基础性教育需求之间的张力。

arXiv:2606.13691v1 公告类型:交叉 摘要:尽管自然语言处理社区投入了大量资源开发支持这一转型的教育技术(EdTech),但在教育利益相关者中,究竟谁的利益得到了最好满足,仍不明确。 本文对2024至2025年间发表于计算语言学协会教育应用建设特别兴趣小组会议上的204篇论文进行了系统性文献综述,并与更广泛的ACL Anthology中的EdTech论文进行了交叉验证。通过考察利益相关者的包容性以及研究任务的优先级,我们的发现揭示了一种关键张力:私营部门激励因素与教育基础设施基础需求之间的博弈。分析表明,教师作为受影响最深的群体,在研究受益者中系统性代表性不足(33.3%);实际部署仍属罕见(9.8%);而伦理参与更倾向于承认而非实际行动。基于语料库中的典型案例,我们为更负责任的EduNLP研究实践提出了具体建议。
查看原文
查看缓存全文

缓存时间: 2026/06/15 08:59

# 教育科技的激励因素:EduNLP 研究系统性综述 来源:https://arxiv.org/html/2606.13691 Gabrielle Gaudeau¹、Aoife O'Driscoll¹、Jasper Degraeuwe²、Andrew Caines¹、Donya Rooein³、Zeerak Talat⁴ ¹ALTA Institute, Computer Laboratory, University of Cambridge (英国), ²Ghent University (比利时), ³Bocconi University (意大利), ⁴University of Edinburgh (英国) 通讯作者:[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected]) ###### 摘要 全球教师短缺正推动学校和机构日益依赖人工智能。尽管自然语言处理社区投入了大量资源开发支持这一转变的教育技术(EdTech),但教育利益相关者中谁的利益得到了最好服务仍不清楚。本文对 2024 年和 2025 年发表在计算语言学协会教育应用构建特别兴趣组(ACL SIGEDU)会议上的 204 篇论文进行了系统性文献综述,并与更广泛的 ACL Anthology 中的 EdTech 论文进行了交叉验证。通过考察利益相关者的纳入情况和研究任务的优先级排序,我们的发现揭示了一个关键张力:私营部门激励与教育基础设施的基本需求之间的推拉关系。我们的分析表明,教师作为研究的受益者被系统性低估(33.3%),尽管他们受此影响最大;实际部署仍然罕见(9.8%);伦理参与往往停留在承认层面而非实际行动。基于我们语料库中的示范性论文,我们提出了更负责任的 EduNLP 研究实践的具体建议。 教育科技的激励因素:EduNLP 研究系统性综述 Gabrielle Gaudeau¹、Aoife O'Driscoll¹、Jasper Degraeuwe²、Andrew Caines¹、Donya Rooein³、Zeerak Talat⁴ ¹ALTA Institute, Computer Laboratory, University of Cambridge (英国)、²Ghent University (比利时)、³Bocconi University (意大利)、⁴University of Edinburgh (英国) 通讯作者:[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected])、[email protected] (https://arxiv.org/html/2606.13691v1/mailto:[email protected]) ## 1 引言 教育长期以来一直是人工智能(AI)和自然语言处理(NLP)的灵感来源。从早期基于特征的自动评分器(例如 e‑rater®; ,2006 (https://arxiv.org/html/2606.13691#bib.bib246))到基于大型语言模型(LLM)的智能辅导系统(ITS)(例如 Khan Academy 的 Khanmigo¹¹¹https://www.khanmigo.ai/),目标始终如一:让技术延伸优质教学的触角,并支持那些可能无法获得教育机会的学习者。这些目标意义重大——具有社会紧迫性、技术挑战性,并且值得科学投资——而近年来,随着全球教师短缺(UNESCO,2026 (https://arxiv.org/html/2606.13691#bib.bib245))、公平差距扩大(World Inequality Lab,2026 (https://arxiv.org/html/2606.13691#bib.bib243))以及面向教育领域的商业 AI 产品快速普及(Gomes,2026 (https://arxiv.org/html/2606.13691#bib.bib244)),这些目标的紧迫性只增不减。综合来看,这些因素使得技术支持教育的作用问题比以往任何时候都更加紧迫。

深度嵌入一个快速发展的研究领域会带来一种特殊风险:我们越是贴近眼前的技术问题,就越容易忽视总体目标。作为研究人员,我们被吸引向熟悉的 datasets、信任的指标、以及进展清晰可辨的任务。专业化是必要的,但它会悄然缩小参照框架,直到"这个系统能工作吗?"这个问题挤掉了最重要的问题:"这个系统真的服务于我们宣称要为其构建的人群吗?"

本文在一定程度上是试图从这种窄化中退后一步,直白地发问:作为一个领域,我们是否达到了自己的期望?为了回答这个问题,我们对 EduNLP 研究进行了系统性文献综述。我们调查了 2024 年和 2025 年发表在 ACL SIGEDU 会议(BEA²²²Workshop on Innovative Use of NLP for Building Educational Applications 和 NLP4CALL³³³Workshop on NLP for Computer‑Assisted Language Learning 研讨会)以及 *ACL 主会上的 204 篇论文。据我们所知,这是第一篇聚焦 ACL Anthology 出版物、对 EduNLP 研究进行的系统性综述。对于每篇论文,我们考察了其任务、动机、利益相关者纳入情况、激励因素以及对伦理风险的参与程度,以回答三个研究问题:
1.  RQ 1  EduNLP 研究中哪些任务被优先考虑?其动机是什么?最终系统在哪些场景中得以部署?
2.  RQ 2  EduNLP 研究的利益相关者是谁?他们如何被纳入?研究服务于谁的利益?
3.  RQ 3  提出了哪些风险、担忧和限制?研究在多大程度上缓解了这些问题?

我们的发现显示,教师作为 EduNLP 研究的受益者被系统性低估,真实世界的部署很少见,伦理参与往往停留在承认层面而非实际行动。我们识别了示范性的反例,并从中推导出一系列对该领域的具体建议。

## 2 相关工作 教育作为创新领域已有数千年历史。数字技术是这段悠久历史的现代特征:20 世纪关于 AI 的许多早期开创性工作都指向人工智能教育(AIED)中的教育目标与应用(Newellet al.,1958 (https://arxiv.org/html/2606.13691#bib.bib300); Minsky,1974 (https://arxiv.org/html/2606.13691#bib.bib299); Papert,1980 (https://arxiv.org/html/2606.13691#bib.bib301); Doroudi,2023 (https://arxiv.org/html/2606.13691#bib.bib302))。近年来,对 LLM 日益增长的兴趣也带来了其在教育领域越来越多的应用(Caineset al.,2023 (https://arxiv.org/html/2606.13691#bib.bib303); Daviset al.,2024 (https://arxiv.org/html/2606.13691#bib.bib309); Packet al.,2024 (https://arxiv.org/html/2606.13691#bib.bib308)),这进一步由年度 Workshop on Innovative Use of NLP for Building Educational Applications (BEA) 的日益流行、2017 年 ACL SIGEDU 的成立⁴⁴⁴https://sig-edu.org/,以及大型科技公司对 Google LearnLM⁵⁵⁵https://cloud.google.com/solutions/learnlm 和 OpenAI ChatGPT Edu⁶⁶⁶https://openai.com/chatgpt/education/ 等产品的投资所证明。

EdTech 涵盖用于教育目的的各种应用,通常涉及 AI 或 NLP。已有若干关于 EdTech 及其在课堂支持、虚拟学习环境、网站和辅导聊天机器人等不同领域使用的调查(Ahmadet al.,2024 (https://arxiv.org/html/2606.13691#bib.bib289); Benedettoet al.,2023 (https://arxiv.org/html/2606.13691#bib.bib305); Hidayat and Firmanti,2024 (https://arxiv.org/html/2606.13691#bib.bib304))。在本文中,我们聚焦于伦理问题,这在更广泛的 AI 和 NLP 领域已受到越来越多的关注,包括识别"机器学习生命周期"中的不同偏见类型(Suresh and Guttag,2021 (https://arxiv.org/html/2606.13691#bib.bib306))。

在 EdTech 领域内,若干调研和立场文章已涉及伦理问题。Yanet al. (2025 (https://arxiv.org/html/2606.13691#bib.bib1)) 对 2020-2024 年间 34 篇涉及中小学或高等教育中 AI 教育科技(EdTech)的出版物进行了系统性综述,报告了围绕算法偏见、数据隐私、透明度、问责制和学术诚信的"反复出现的伦理张力群"。他们观察到这些是 AI 应用中已知的问题,并建议与利益相关者共同设计、强调可解释性、改进监管,以及为教师提供 AI 素养培训。Alfredoet al. (2024 (https://arxiv.org/html/2606.13691#bib.bib296)) 通过对 108 篇与以人为本或参与式设计及学习分析相关的论文的综述得出了类似结论。Fu 和 Weng (2024 (https://arxiv.org/html/2606.13691#bib.bib284)) 对聚焦 EdTech 与负责任 AI 的实证研究进行了系统性综述,基于 40 篇选定的论文得出了与 Yanet al. (2025 (https://arxiv.org/html/2606.13691#bib.bib1)) 相似的结论。他们提出了"负责任且以人为本的 AIED"愿景,其中包括公平与平等、透明度与可理解性、能动性与自主权、隐私与安全,以及有益性与非伤害性等核心原则。Holmeset al. (2022 (https://arxiv.org/html/2606.13691#bib.bib286)) 调查了 EdTech 研究人员,报告称尽管高度关注伦理问题,但信心不足,这归因于 AI 相关课程中缺乏伦理培训。他们提出了一个 AIED 伦理框架,旨在确保"伦理设计为本"的研究,并强调了跨学科参与的重要性。综合来看,这些综述汇聚于一个共同的诊断:伦理考虑在原则上得到广泛认可,但在实践中却未能得到持续贯彻。本综述通过纳入整个 2025 年发表的研究,并考察来自 *ACL 主会议和研讨会论文集 204 篇 EduNLP 论文的任务、背景、利益相关者、激励因素和风险,从而扩展了这些先前的工作。

## 3 研究方法 ### 搜索协议。我们收集了 2024 年和 2025 年发表在 BEA 和 NLP4CALL 研讨会上的所有论文。我们还使用 Anthology API⁷⁷⁷https://acl-anthology.readthedocs.io/py-v0.5.3/api/ 对 ACL Anthology 进行了搜索,查找发表于 *ACL 主会及相关会议、其标题或摘要包含至少一个 EduNLP 相关搜索词(例如"学生建模";参见附录 B (https://arxiv.org/html/2606.13691#A2) 获取完整的会议列表和搜索词)的论文。⁸⁸⁸搜索于 2026 年 1 月 21 日进行。这种采样方法虽然以牺牲纵向分析为代价,但能提供对当前趋势的深入观察。此次搜索从两个研讨会获得了 191 篇论文,从 *ACL 会议获得了 316 篇论文。对于 BEA 和 NLP4CALL,我们为每个共享任务随机抽取 25% 的贡献(每个任务最低采样门槛为 5 篇论文)。我们还纳入了所有共享任务概述论文,因为它们代表了一种性质不同的贡献类型。对于 *ACL 主会议论文,我们审查了所有摘要的相关性,排除了 214 篇不相关论文。剩下的 102 篇论文按出版年份、会议和搜索词进行分层,最终抽取了 44 篇论文。最终样本包括来自 BEA 和 NLP4CALL 研讨会的 160 篇论文,以及来自 *ACL 会议的 44 篇论文,共计 204 篇(论文详情见表 8 (https://arxiv.org/html/2606.13691#A5.T8))。图 1 (https://arxiv.org/html/2606.13691#S3.F1) 显示了论文在不同会议和年份的分布。

参见标题图 1:每个会议和年份的论文数量。我们共审阅了 204 篇论文(160 篇 BEA+NLP4CALL 论文和 44 篇 ACL Anthology 主会议论文)。

### 数据提取。数据提取由三位作者使用共享提取模式手动进行(见附录 C (https://arxiv.org/html/2606.13691#A3))。该模式涵盖:所处理的特定任务;使用的数据集及其可用性;研究的明确动机;提及和纳入的利益相关者(附相关引述);利益相关者的纳入程度;任何系统的部署背景;研究所服务的激励因素(包括显性和隐性);提出的伦理风险和担忧;为应对这些风险所采取的措施;以及与风险、伦理或愿景相关的未来方向。提取分三个阶段进行。在第一阶段 (1),一篇论文被合作标注以开发和验证该模式。在第二阶段 (2),标注者独立审阅一批共享的 25 篇论文,⁹⁹⁹共享批次是从我们 204 篇论文的语料库中按会议和出版年份分层抽样得到的;包括 6 篇 BEA 2024、10 篇 BEA 2025、2 篇 NLP4CALL 2024、1 篇 NLP4CALL 2025、1 篇 EACL 2024、1 篇 LREC-COLING、1 篇 NAACL 2025、1 篇 ACL 2025 和 2 篇 Findings 2025 论文。然后开会讨论模式修订并解决歧义。注意第二阶段 (2) 是以迭代方式进行的:在第一阶段 (1) 之后,每次修订或扩展模式时,所有标注者都会更新其先前的第二阶段 (2) 标注以反映修订后的指南。在第三也是最终阶段 (3),剩余的论文由三位作者独立审阅。每位标注者平均每篇论文需要 45 分钟(范围在 30–60 分钟之间);我们估计此次审阅总共耗时约 190 小时。

参见标题图 2:每个高级任务的论文数量。详细映射见表 8 (https://arxiv.org/html/2606.13691#A5.T8)。

### 一致性。标注者间一致性(IAA)在第二阶段 (2) 独立审阅的共享批次上进行测量。附录 D (https://arxiv.org/html/2606.13691#A4) 中的表 1 (https://arxiv.org/html/2606.13691#A4.T1) 显示了基于百分比一致性(PA; Roaché,2017 (https://arxiv.org/html/2606.13691#bib.bib50))度量对模式中自由文本维度的一致性(参见表 6 (https://arxiv.org/html/2606.13691#A4.T6) 和 7 (https://arxiv.org/html/2606.13691#A4.T7) 了解自由文本一致性计算方式的示例)。对于四个多标签维度,我们在表 2 (https://arxiv.org/html/2606.13691#A4.T2)、3 (https://arxiv.org/html/2606.13691#A4.T3)、4 (https://arxiv.org/html/2606.13691#A4.T4) 和 5 (https://arxiv.org/html/2606.13691#A4.T5) 中同时报告 Krippendorff 的 α (Krippendorff,2011 (https://arxiv.org/html/2606.13691#bib.bib51)) 和 PA。对于自由文本字段,PA 范围在 0.52(隐性激励)到 1(部署)之间。对于多标签维度,PA 始终较高(总体 0.84–0.94),而 α 变化较大。关于利益相关者存在的一致性总体处于中等至强水平(α = 0.49–0.7,其中教师的一致性特别高,α = 0.79–0.84)。关于利益相关者纳入程度和风险参与程度的一致性较低(总体 α = 0.52–0.61)。考虑到标注任务的定性性质和固有诠释性(特别是对于风险/担忧等维度),我们认为这些一致性值足够高,足以证明在第三阶段 (3) 进行独立审阅是合理的。

## 4 任务、动机、部署 ### 任务。图 2 (https://arxiv.org/html/2606.13691#S3.F2) 显示了我们的论文语料库中高级任务的分布。自动化评估——即自动化作文评分 (AES) 和自动化简答评分 (ASAG)——是迄今为止最

相似文章

ConnectED:面向越南教学备课与学生学习的课程对齐AI系统

arXiv cs.AI

本文介绍了ConnectED,一个面向越南教育的以人为中心的AI系统,利用VietEduQwen大语言模型支持课程对齐的备课和互动式学生学习,将教师备课时间从数小时缩短至约30-45分钟,同时在全国考试题目上达到87%的准确率。