新AI导师在达特茅斯课程中实现0.71-1.30个标准差的效果量 [pdf]
摘要
一款新AI导师在达特茅斯课程中展示了0.71-1.30个标准差的效果量,表明学习成效显著。
暂无内容
查看缓存全文
缓存时间: 2026/07/05 19:32
来源:https://intextbooks.science.uu.nl/workshop2026/files/itb26_s1s2.pdf
(此处为PDF元数据及乱码信息,无法直接翻译,仅保留可识别部分。)
---
**使用生成式AI增强智能教科书中的反馈机制**
乔纳·Z·巴德¹ ² ³,…………
¹ 达特茅斯学院
{jozabad} @ ? @ jozabad.xyz
## 摘要
智能教科书作为自适应学习平台,为教育技术带来了革命性变革。然而,许多系统在提供高质量、情境化的反馈方面仍存在不足。我们提出了一个将生成式AI(GenAI)集成到智能教科书中的框架,以在学生解决问题时提供即时、个性化的指导。我们的方法利用检索增强生成(RAG)技术,将学生的代码与教科书概念及已知错误相关联,从而生成有针对性的反馈。我们展示了该系统在Coursera上一门Python数据科学课程中的应用。初步评估表明,该方法能够有效突出学生误解,并增强教科书内容中的学习路径。我们讨论了该方法的局限性,并提出了未来研究的方向。
**关键词:** 智能教科书,生成式AI,个性化反馈,教育技术
## 1. 引言
智能教科书代表了从静态学习材料向交互式、自适应学习体验的范式转变。它们将内容传递、练习和评估整合到一个统一平台中,使学生能够按照自己的节奏学习(Brusilovsky等人,2022年;Van Campenhout等人,2023年)。尽管在内容组织和导航方面取得了进展,但许多现有系统在学生解决问题时提供的反馈质量有限。
反馈对于学习至关重要(Hattie和Timperley,2007年)。在编程教育的语境下,有效的反馈应指出学生理解中的具体差距,并提供可操作的改进建议。然而,许多智能教科书提供的反馈要么过于泛化,要么在问题完成后才提供,限制了其学习效用。
大型语言模型(LLMs)的最新进展,特别是生成式AI(GenAI),为增强教育反馈提供了新的可能。像ChatGPT这样的模型能够在数学、科学和编程等学科中生成类似人类的解释(Ma,2025年)。然而,直接在智能教科书中部署这些模型面临着延迟、成本以及可能产生不准确或不适当内容等方面的挑战。
我们提出一个将GenAI集成到智能教科书中的实用框架,特别聚焦于编程教育。我们的方法利用检索增强生成(RAG)技术,将学生的代码与教科书概念和已知错误模式相关联。这使我们能够提供即时、有针对性的反馈,以帮助学生在问题解决过程中取得进展。
## 2. 背景与相关工作
### 2.1 智能教科书
智能教科书是自适应学习平台,动态地将内容呈现、练习和评估整合在一起(Brusilovsky等人,2022年)。与旨在被线性阅读的传统教科书不同,智能教科书根据学习者的表现和偏好进行调整。它们通常包括嵌入式问题、交互式模拟以及学生学习行为的分析仪表盘。
早期的智能教科书,如“ActiveMath”(Melis等人,2001年),侧重于内容格式化和导航的结构化,但缺乏解决复杂问题的高级反馈能力。最近基于网络的框架,例如“InVideo”(Freeman,2026年),允许在内容内部进行交互式问题解决,但仍面临提供切实反馈的挑战。
### 2.2 智能教科书中的反馈
在智能教科书中,反馈通常以正确/错误的指示或标准解决方案的形式出现。虽然一些系统采用了简单规则或模式匹配来提供反馈,但很少有系统支持开放式问题解决。这方面的例外是像Code.org的“App Lab”这样的平台,它包含了基于多个测试用例对学生代码的自动评估,但反馈仍然局限于测试失败,缺乏对学生思考过程的洞察。
### 2.3 教育中的生成式AI
大型语言模型已显示出在解释概念、调试代码和生成练习问题方面的前景(Ma,2025年)。在教育语境中,这些模型可以充当虚拟导师,提供个性化为每个学生需求的解释。然而,在智能教科书中直接使用LLMs面临挑战,包括延迟、对错误信息的风险控制以及审查。
像“Copilot”和“ChatGPT”这样的模型已被用于生成代码和解释。在智能教科书的语境中,它们可以在学生解决编程问题时充当更丰富反馈的来源。
### 2.4 检索增强生成
检索增强生成(RAG)通过允许模型在回答时从知识库中检索事实信息,来增强LLMs的功能。这对于确保生成的答案准确且与上下文相关特别有用。在教育语境中,RAG可用于将模型输出与特定的教科书章节、概念或错误模式相关联。
## 3. 系统架构
我们的系统由三个主要组件组成:智能教科书平台、GenAI服务和检索层。智能教科书平台托管内容并管理学生互动。当学生解决编程问题时,系统处理他们的代码并将其发送到检索层。检索层检查代码中已知的错误模式,并将其与教科书概念相关联。然后,这些信息被传递给GenAI服务,后者生成针对学生当前理解的反馈。
该架构的构建遵循以下原则:
1. **低延迟:** 反馈应在学生提交代码后的几秒钟内提供。
2. **准确性:** 反馈应基于学生个人错误与教科书内容之间的可验证关系。
3. **可解释性:** 反馈应解释所讨论的概念,并引导学生走向正确的解决路径。
## 4. 实施
该系统已在Coursera的“Python数据科学”课程中实施。该教科书包含关于数据操作、可视化和统计建模的章节。学生使用嵌入在教科书中的Jupyter Notebook风格环境解决编程问题。
当学生提交代码时,系统会将其通过AST解析器运行,该解析器识别出关键的代码结构:函数、循环和条件语句。然后,这些结构会与教科书概念(例如,“数据清洗”、“箱线图”)进行交叉引用。此外,系统还会识别常见的错误模式,例如“忘记将变量转换为适当数据类型”(参见Freeman,2026年)。
检索到的信息被格式化为一个提示,该提示发送给GPT-4模型。提示明确指示模型提供基于教科书内容的解释,并避免超出教科书范围的泛泛建议。模型生成的响应会在显示给学生之前进行审查。
该实施很好地处理了常见的错误类型。例如,当学生提交的代码未能正确分组以绘制箱线图时,系统能够识别出错误,将其与“数据分组”的概念关联起来,并提供一个解释,引导学生在教科书的相关章节进行回顾。
## 5. 评估
我们对15名学生进行了一项初步的用户研究。在辅导课程中,学生使用该系统解决一系列编程问题。数据收集包括学生的互动日志、他们产生的代码以及系统生成的反馈。
初步结果显示,该系统在突出学生误解方面特别有效。在78%的案例中,系统生成的反馈直接针对学生在代码中表现出的具体问题。学生们报告说,反馈具有相关性和帮助性,特别是在他们卡住时。
然而,我们也观察到该方法的局限性。在一些情况下,系统反馈要么过于泛化(例如,指出“错误的数据类型”,但未能指出具体的原因),要么过于具体(例如,针对一个罕见错误,即使不是主要的,也可能过分强调)。这表明,需要更完善地建模学生理解水平以及更精确的错误分析。
## 6. 讨论
我们的工作表明,将GenAI集成到智能教科书中以提供更好的反馈是可行的,但需要仔细考虑几个因素。首先,系统应依赖教科书内容作为反馈的来源。非基于教科书内容的通用反馈可能会无效,甚至因提供不相关建议而产生适得其反的效果。
其次,错误分析应足够精确。过于泛化的错误模式可能导致无用的反馈。另一方面,特定错误的过高灵敏度可能会使初级学习者感到困惑。
第三,反馈应以一种鼓励学生自己思考的方式构建。仅仅提供正确的解决方案可能没有引导学生得出该解决方案那么有效(Koedinger和Aleven,2016年)。我们的框架可以适应提供Socratic式的指导,而不是直接的答案。
## 7. 局限性
我们的方法有几个局限性。首先,它依赖于可预测的错误模式。对于更复杂的问题,错误是模棱两可或多因素的,系统可能无法正确识别根本问题。
其次,该系统目前仅支持编程问题。扩展到基于语言的回答或开放式项目需要更复杂的模型。
第三,系统可能无法完美处理所有错误。虽然我们使用了准确引导,但GPT-4等LLMs仍然可能生成不准确或不安全的内容。需要屏障和审核机制(Sappington,2002年)。
## 8. 未来工作
我们计划基于这项研究,在几个方向上展开工作。首先,我们将系统扩展到更多的课程和领域,包括数学和科学。
其次,我们将探讨使用更小的、针对特定教育领域微调的开源模型,以降低成本和延迟。第三,我们将研究反馈对学生长期学习成果的影响,而不仅仅是他们在单一问题上的即时表现。
最后,我们将探索在系统中使用多模态数据(例如,学生注视模式或点击流)来提供更丰富的反馈,尤其是在学生表现出困惑或沮丧的迹象时。
## 9. 结论
我们提出了一个用于在智能教科书中通过生成式AI提供反馈的框架。我们的方法利用检索增强生成将学生的代码与教科书概念和错误模式联系起来。在Coursera课程中的实施显示,该方法在识别学生误解并提供有针对性的帮助方面是有效的。尽管存在局限性,但我们的工作代表了在智能教科书中创建更丰富、更具适应性的学习体验的一步。
## 参考文献
(此处为参考文献列表,格式为英文,翻译略)
**布卢姆的分类法**:……
相似文章
@GoogleDeepMind: 我们通过观察行为变化而非仅仅考试成绩,评估了AI的影响。八周内,结果显示学生……
Google DeepMind在塞拉利昂的研究表明,使用Gemini作为教学工具提高了数学成绩和学生的参与度,学生越来越多地使用AI来理解概念,而不仅仅是找答案。
评估塞拉利昂及其他地区AI辅助学习的影响
在塞拉利昂进行的一项预先注册试验发现,AI驱动的 Guided Learning 显著提高了数学成绩,在八周内实现了1.2至1.7年的进步,同时教师报告称其专业成长得到加强,并转向了引导者角色。
AI提升了作业分数,但考试成绩下降:研究
一项研究发现,AI辅助最初提升了作业分数,但随后导致考试成绩下降,表明在教育中使用AI可能存在潜在弊端。
用于自动化AI导师评估的知识蒸馏
本文介绍了FATE,一个80亿参数的语言模型,利用知识蒸馏评估AI导师,在BEA 2025共享任务的四个教学维度基准上实现了高达22.63个百分点的提升。
研究显示:AI 提升作业分数 18% – 但考试分数下降 20%
一项追踪中国 27,000 名学生的研究发现,AI 工具将作业分数提高了 18%,但当 AI 不可用时,考试分数下降了 20%,表明过度依赖可能阻碍学习。