AI生成的幻灯片:它们好吗?学生能分辨吗?
摘要
本文研究了使用生成式AI工具(NotebookLM、Claude、M365 Copilot、Cursor、Claude Code)从教师笔记生成幻灯片,发现编程助手生成的幻灯片质量最佳,且学生无法可靠地区分AI生成的幻灯片与人工制作的幻灯片。
arXiv:2605.13532v1 Announce Type: new
摘要:随着生成式人工智能(GenAI)工具变得易于获取,使用这些工具支持教师教学的前景广阔。为此,本文研究了使用GenAI从教师编写的课程笔记中生成幻灯片,重点关注教师和学生的看法。我们评估了一款端到端教育工具(NotebookLM)、两款通用大语言模型(Claude、M365 Copilot)以及两款编程助手(Cursor、Claude Code)。我们首先通过教育者的叙述性评估分析GenAI生成的幻灯片是否“良好”,然后选择最佳幻灯片(经过一定修改)在真实课程中使用,并比较学生对人工和AI生成幻灯片的看法。我们发现,编程助手工具生成的幻灯片在准确性、完整性和教学法合理性方面表现最佳。此外,学生对GenAI幻灯片的评价与教师制作的幻灯片质量相当,并且无法可靠地识别哪些幻灯片是AI生成的。我们还发现,高质量评分与高“AI生成”评分之间存在负相关,表明学生将低质量与幻灯片来源为AI联系起来。这些发现突显了将GenAI整合到教学设计工作流程中的有希望的机会,并呼吁进一步研究教育者如何负责任且有效地利用这些工具。
查看缓存全文
缓存时间: 2026/05/14 06:16
# AI 生成的幻灯片:它们好吗?学生能分辨出来吗? 来源:https://arxiv.org/html/2605.13532 \(2026\) ###### 摘要。随着生成式人工智能(GenAI)工具的普及,利用这些工具辅助教师的工作前景广阔。为此,本文探讨了如何使用 GenAI 帮助教师从其编写的课程笔记中生成幻灯片,重点关注教师和学生的看法。我们考察了一款端到端教育工具(NotebookLM)、两款通用大语言模型(Claude、M365 Copilot)以及两款编码助手(Cursor、Claude Code)。首先,通过教育工作者对生成的幻灯片进行叙事评估,分析 GenAI 生成的幻灯片是否“好”。我们选出最佳的幻灯片(经过一些修改)在实际课程中使用,并比较学生对人工与 AI 生成幻灯片的看法。我们发现,编码助手工具生成的幻灯片在准确性、完整性和教学合理性方面表现最佳。此外,学生对 GenAI 幻灯片的评价与教师创建的质量相似,并且无法可靠地识别哪些幻灯片是 AI 生成的。同时,我们发现高质量评分与高“AI 生成”评分之间存在负相关,这表明学生将低质量与幻灯片由 AI 生成这一来源联系起来。这些发现为将 GenAI 整合到教学设计工作流程中提供了有希望的机遇,并呼吁进一步研究教育工作者如何负责任且有效地利用这些工具。计算机科学教育;计算教育;生成式人工智能;GenAI;大语言模型;LLMs;教育材料;教育材料的自动生成;Web 软件开发††journalyear:2026††copyright:cc††doi:XXXXXXX.XXXXXXX††conference:2026 年西加拿大计算教育会议;2026 年 4 月 30 日至 5 月 1 日;加拿大温哥华††isbn:978-1-4503-XXXX-X/2026/06††ccs:计算方法 人工智能††ccs:社会与专业主题 计算教育 ## 1. 引言 随着大语言模型(LLM)和 AI 驱动的教育工具快速发展,LLM 和生成式人工智能(GenAI)工具已被证明能够创建教育内容(Wang 等人,2025 (https://arxiv.org/html/2605.13532#bib.bib1))。它们被认为能提高编程任务(Peng 等人,2023 (https://arxiv.org/html/2605.13532#bib.bib32))和写作任务(Noy 和 Zhang,2023 (https://arxiv.org/html/2605.13532#bib.bib46))的生产力。然而,即使在软件工程领域,用户的看法也存在差异(Dakhel 等人,2023 (https://arxiv.org/html/2605.13532#bib.bib33)),GenAI 工具有时会生成不正确或产生幻觉的输出。因此,计算领域的教师在将 GenAI 融入教学实践时,既面临机遇也面临不确定性。学生对 AI 生成材料的看法则带来了更多复杂性(Li 等人,2024 (https://arxiv.org/html/2605.13532#bib.bib30))。 本文以一个高年级本科 Web 编程课程为背景,呈现了一个使用 GenAI 工具辅助教师从教师自编的在线教科书章节中生成幻灯片的案例研究。我们关注两个问题:(1) 它们好吗?这里的“它们”整体上指 GenAI 工具本身、使用这些工具的过程以及生成的幻灯片输出。我们探索并比较了不同类型的 GenAI 工具:学生可能已经在使用的端到端教育工具(例如 NotebookLM)、易于访问的通用 LLM(例如 Claude、M365 Copilot),以及已被证明对编程任务有帮助的编码助手(例如 Cursor、Claude Code)。我们报告教师的体验及其对事实准确性、完整性和教学合理性的叙事评估。这些因素与同期进行的类似工作(Xie 等人,2026 (https://arxiv.org/html/2605.13532#bib.bib47))相似。(2) 学生能分辨出来吗?我们选出各工具生成的最佳幻灯片,并经过一些修改,在实际课堂中评估其质量;随后报告学生对质量的看法以及他们识别 AI 生成内容的能力。具体来说,在将 GenAI 生成的幻灯片视觉风格匹配为教师偏好的格式并选择性删除内容后,我们将这些幻灯片与教师创建的幻灯片一起用于实际课程讲座。学生被告知讲座可能包含 GenAI 生成的内容,但未被告知是哪些部分或有多少。在每个讲座片段结束后,学生对幻灯片质量进行评分,并猜测幻灯片是由 AI 还是人类生成的。 我们选择易于访问(免费、低于 30 美元/月,或可通过机构许可获取)的工具。我们优先选择计算教育文献中尚未广泛讨论的工具(Prather 等人,2025 (https://arxiv.org/html/2605.13532#bib.bib34), 2023 (https://arxiv.org/html/2605.13532#bib.bib9)),以便向社区介绍新工具。此外,幻灯片是支持讲座的常用内容形式,且制作耗时。幻灯片对 GenAI 工具也具有挑战性,因为它的创建涉及文本、代码和图表之间的协调。由于作者是计算教育工作者和研究人员,在使用这些特定 GenAI 工具构建教育资源方面经验较少(少于 2 个月),我们提供了关于教师上手体验的真实视角。此外,其中一位研究者担任所研究课程的教师,具备评估内容质量和教学适当性的领域专业知识。学生评估是在实际课程中注册的高年级本科生中进行的,提供了来自学习者的真实反馈。 ## 2. 相关工作 最近的调查表明,LLM 被用于辅助学生、教师以及自适应学习(Wang 等人,2025 (https://arxiv.org/html/2605.13532#bib.bib1))。多模态模型——结合文本、图像和音频的模型——在 STEM 领域的潜力也正在被探索(例如,见 Xing 等人 (2024 (https://arxiv.org/html/2605.13532#bib.bib3)))。在计算教育中,早期工作表明,像 Codex 这样的代码感知模型可以解决大多数入门级编程问题(Finnie-Ansley 等人,2023 (https://arxiv.org/html/2605.13532#bib.bib13)),这引发了关于评估有效性和课程目标的质疑。最近,Denny 等人 (2023 (https://arxiv.org/html/2605.13532#bib.bib21)) 探索了使用自然语言提示生成 CS1 解决方案,而 Savelka 等人 (2023 (https://arxiv.org/html/2605.13532#bib.bib22)) 记录了 GPT-4 在高等教育编程评估中性能的提升,突显了能力的快速增长。近期工作发现,教师正在根据生成式 AI 工具的广泛可用性调整教学,例如改变评估实践和学习目标(Prather 等人,2025 (https://arxiv.org/html/2605.13532#bib.bib34))。 除了面向学生的应用,新兴工作也在探索对教师内容创作的支持。Sarsa 等人 (2022 (https://arxiv.org/html/2605.13532#bib.bib18)) 证明了 LLM 可以生成编程练习和解释,尽管在多样性和教学适当性方面存在局限。最近,Logacheva 等人 (2024 (https://arxiv.org/html/2605.13532#bib.bib38)) 发现,较新的 LLM 在生成具有主题背景的练习方面表现更好,尽管这种背景化通常较浅。Jordan 等人 (2024 (https://arxiv.org/html/2605.13532#bib.bib37)) 发现,LLM 可以创建多种语言的合适练习,尽管在低资源语言(如泰米尔语)中生成的练习质量较低。Villegas Molina 等人 (2024 (https://arxiv.org/html/2605.13532#bib.bib35)) 发现,LLM 可用于创建 CS1 中具有文化相关性的教材。综上所述,这些工作显示了在计算教育中利用 LLM 的潜力和兴趣。 特别是幻灯片生成,仍是一个未被充分探索的领域。早期自动幻灯片生成工作侧重于从科学论文中提取内容(Sefid 等人,2019 (https://arxiv.org/html/2605.13532#bib.bib50)),而最近的方法则利用了 LLM。Xie 等人 (2026 (https://arxiv.org/html/2605.13532#bib.bib47)) 提出了 SlideBot,这是一个多智能体框架,使用专门用于检索、摘要、图形生成和 LaTeX 格式化的智能体来生成教育幻灯片。其他近期系统包括用于自动幻灯片和语音生成的 PASS(Aggarwal 和 Bhand,2025 (https://arxiv.org/html/2605.13532#bib.bib51))、用于从头设计结构化视觉内容的 AutoPresent(Ge 等人,2025 (https://arxiv.org/html/2605.13532#bib.bib52)),以及作为上下文感知幻灯片生成智能体的 SlideCraft(Rao 等人,2025 (https://arxiv.org/html/2605.13532#bib.bib54))。这些工作主要侧重于系统开发和技术评估,而非教师和学生的体验。 关于学生对 LLM 生成的教育资源的看法的研究有限。先前工作表明,AI 辅助的披露会影响看法,例如在写作中(Li 等人,2024 (https://arxiv.org/html/2605.13532#bib.bib30))。然而,Leinonen 等人 (2023 (https://arxiv.org/html/2605.13532#bib.bib14)) 发现,LLM 生成的代码解释与学生写的评分相当。类似地,Henderson 等人 (2025 (https://arxiv.org/html/2605.13532#bib.bib56)) 比较了学生对生成式 AI 与教师反馈的看法,发现在感知有用性和可信度方面存在差异。对于幻灯片,Georgiev 和 Tinsley (2024 (https://arxiv.org/html/2605.13532#bib.bib55)) 考察了学生对教师创建的 AI 辅助 PowerPoint 幻灯片的看法,发现虽然学生对教师使用 AI 持有赞同意见,但他们也表达了对幻灯片设计的重大担忧,包括结构、文本与图像之间的一致性以及排版。 ## 3. 从教科书到幻灯片:在 Web 软件课程中,它们(GenAI 工具)好吗? 本节探讨 GenAI 工具是否以及如何帮助将在线 Web 编程教科书中的章节转化为讲座幻灯片。这项任务代表了一种常见需求:教师经常维护阅读材料并生成相应的幻灯片。我们使用了芬兰阿尔托大学 Web 软件开发(WSD)课程的教材:一门 5 ECTS¹¹¹欧洲学分转移系统,1 ECTS 约相当于 27 小时工作量。课程提供“全栈”视角,教授学生开发由数据库支持的后端的客户端和服务器端应用程序。课程早期部分侧重于使用 Svelte 和 SvelteKit 进行客户端开发,随后是设计与数据库交互的服务器端 API,然后再将其集成到客户端功能中。课程教师维护着一本在线交互式教科书,其中穿插了示例和练习。 我们通过为前两周涵盖的四个主题制作幻灯片来评估各种 GenAI 工具:基本的 HTML 和 Svelte、状态共享、CRUD(创建、读取、更新和删除)以及 Fetch API。课程教师选择这些主题是为了代表不同类型的内容——有些侧重于代码示例,有些侧重于图表或概念解释。对于每个主题,我们的目标是制作可在一段 10-15 分钟讲座片段中使用的幻灯片。我们探索了五种代表不同内容生成方法的 AI 工具:NotebookLM、M365 Copilot、Claude(Sonnet 4.5)、Cursor 和 Claude Code。选择这些工具是因为它们对计算教育工作者来说易于访问,并且在从自动化到教师参与的工作流程中代表了不同的点。 ### 3.1. 方法 两位研究者(均为计算教育工作者)在结对编程会议中共同探索了每种工具,迭代地开发和优化提示。为了模仿现有讲座材料的风格,我们收集了早期课程迭代中教师生成的讲座幻灯片。我们旨在遵循现实教师的工作流程:撰写直接的提示,无需提示工程专业知识,然后根据工具生成的内容进行改进。在初步合作探索后,一位研究者继续为所有讲座主题构建剩余材料。 对于大多数工具,我们使用了通过初始试验迭代开发的以下提示:“请从 <文件> 生成一组幻灯片。这些幻灯片计划在一所大学的 Web 软件开发课程中,于一次 2 小时 Web 编程讲座中用作 15 分钟的讲座片段。请在片段末尾包含一些同伴教学练习。”我们最初包含了样式规则,但发现这会降低内容质量,因此我们将样式作为第 4 节 (https://arxiv.org/html/2605.13532#S4) 中的后处理步骤分开处理。我们对所有工具使用了默认设置。对于所有工具,我们为测试的四个章节分别使用了一个独立的会话。 我们通过教师和两位非教师研究者对生成材料质量的叙事评估。我们考虑了三个因素,类似于 Xie 等人 (2026 (https://arxiv.org/html/2605.13532#bib.bib47))。**事实准确性**评估内容是否正确,通过参考源材料、核实示例、验证概念解释以及识别幻觉或误导性信息。**完整性**评估是否遗漏了重要概念、示例是否充分、材料是否能独立使用或是否需要大量补充。**教学合理性**评估生成的材料是否符合计算教育的既定原则,包括认知负荷管理(Sweller, 1988 (https://arxiv.org/html/2605.13532#bib.bib25); Mayer, 2005 (https://arxiv.org/html/2605.13532#bib.bib26))(以易于理解的单位呈现信息,避免过多细节)、双重编码和视觉支持(Clark 和 Paivio, 1991 (https://arxiv.org/html/2605.13532#bib.bib27); Mayer, 2005 (https://arxiv.org/html/2605.13532#bib.bib26))(使用图表和插图来强化而非重复文本),以及支架式和概念进阶(Winslow, 1996 (https://arxiv.org/html/2605.13532#bib.bib28); Sorva, 2013 (https://arxiv.org/html/2605.13532#bib.bib29))(从具体示例逐步构建到抽象,避免跳跃)。评估是定性和协作性的,优先考虑对实践者有用的叙事性见解而非评分者间信度。最初,两位研究者合作评估了几种生成的资源,包括每种 GenAI 工具至少两套幻灯片。研究者确定了与准确性、完整性和教学合理性相关的具体问题。通过这个过程,我们发现清晰度、重点和示例的使用是教学合理性的重要元素。然后,另一位研究者(即 Web 编程课程的教师)审阅了笔记,评估了剩余的幻灯片,并总结了发现。 ### 3.2. 结果 表 1 (https://arxiv.org/html/2605.13532#S3.T1) 总结了我们评估生成资源的结果。后续小节提供叙事细节。总体而言,基于编程的工具——Cursor 和 Claude Code——生成了最引人注目的幻灯片,并将在第 4 节 (https://arxiv.org/html/2605.13532#S4) 中使用。 表 1. 评估用于从 Web 编程课程教科书材料生成幻灯片的 GenAI 工具。 #### 3.2.1. NotebookLM NotebookLM 是一款免费、专注于教育的工具
相似文章
适合已有内容的用户的最佳AI幻灯片制作工具?
用户寻找一个AI工具,将杂乱的笔记、会议记录和文档转换为可读的演示幻灯片。
CubeOne 推出的 AI 幻灯片编辑器
CubeOne 推出了一款 AI 驱动的幻灯片编辑器,旨在改进 PowerPoint。
X+Slides:面向受众条件的幻灯片生成基准测试
X+Slides是一个新的基准,用于评估从源文档生成面向受众条件的幻灯片,它使用源基础探针和受众特定的效用权重。在DeepPresenter、SlideTailor和NotebookLM上的实验表明,当前系统能够恢复大量但不够完整的受众关键信息。
HTML AI PPT - 本地优先的AI幻灯片生成与编辑器
一款本地优先的AI幻灯片生成器,支持离线使用自有模型,兼容主流中文AI服务及基于HTML的演示文稿。
我制作了10套游戏化、交互式的演示文稿,用于教授Agentic AI(别再读白皮书读到昏昏欲睡了)。
一位开发者在AgentSwarms平台内构建了10套游戏化、交互式的幻灯片,用于教授Agentic AI概念(如ReAct循环、多智能体群体和生产级RAG),采用主动回忆而非被动阅读的方式。