在人工智能能完成所有作业后,我的教学调整

Hacker News Top 新闻

摘要

一位教育者描述了在人工智能工具如GPT-3能完成作业后,他们如何重新设计其机器学习生产课程的评估方式,将重点转向互动、考试和演示,同时允许使用AI。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/26 07:20

# AI代写所有作业后,我如何改变教学 来源:https://thelastsoftwareengineer.substack.com/p/how-i-changed-teaching-after-ai-managed 大约2021年,在ChatGPT发布前很久,Vincent Hellendoorn就建议我在课程的阅读测验中试用GPT-3。它能在未接触指定论文的情况下,生成符合我们评分标准的令人信服的答案。当时,我什么都没改。五年后的今天,AI智能体能完成我所有作业任务,我已重新设计了该课程的大部分评估方式,尽管我希望学生学习的内容几乎没变。策略始终如一:不再测试任何在家完成的对内容的理解,而是专注于与助教的互动、考试和视频演示。其中一些改变违背了基于证据的最佳教学实践,但我还是做了。 过去几年,我主要教授*《生产环境中的机器学习》(https://mlip-cmu.github.io/)*这门高级课程,聚焦于围绕ML模型构建生产就绪软件及MLOps,通常有100到170名学生。如今,与其他教育者交流时一个常见问题是:在生成式AI和编码智能体时代,我们如何改变教学?下面我概述一下我们的做法。 随着AI创新与工具的变化,我们调整了涵盖的主题,但我几乎没动过整体*学习目标(https://mlip-cmu.github.io/s2026/)*。我很庆幸这不是入门课,学习目标不在于编写代码或使用特定工具,而是关于工程权衡、预见与缓解风险以及团队协作。我认为这些技能仍然值得学习,即使部分能被模拟并交付给模型完成。(修订入门课或传统软件工程课程可能会大幅改变学习目标。) 同样重要的或许是:我们*允许学生(https://mlip-cmu.github.io/s2026/#course-syllabus-and-policies)*在所有场合以任何形式使用AI且无需标注,书面和口头考试除外。我们甚至鼓励在许多地方使用AI工具。我认为即使想监管AI也不可行,更重要的是,我认为学生无论如何都需要学习负责任地使用这些技术。 ![文章配图](https://substackcdn.com/image/fetch/$s_!aOO8!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fbce79a10-6491-4d9c-940d-eabbcfa263f4_2241x1687.png) 让我们先明确这一点,因为它比我们具体做法更重要:遗憾的是,AI正在积极破坏多项基于证据的教学实践(例如,参见*《学习的原理》(https://www.wiley.com/en-ie/How+Learning+Works:+Seven+Research+Based+Principles+for+Smart+Teaching-p-9780470617601)*和*《我们如何学习ABC》(https://wwnorton.com/books/The-ABCs-of-How-We-Learn/)*)。例如,证据支持频繁、低风险且带反馈的评估(如作业、小测),而非少数高风险评估(如考试)——但AI正在破坏低风险场景下的实践,将我们推向更多考试。 同样,我过去常提供“安全网”:学生可以犯错并重新提交有限次数的作业以挽回失分(这是*规格化评分(https://www.taylorfrancis.com/books/mono/10.4324/9781003447061/specifications-grading-linda-nilson-claudia-stanny)*和*公平评分(https://www.corwin.com/books/grading-for-equity-2nd-edition-281503)*的核心建议,旨在关注学习成果而非过程)。但我们发现这一过程被AI滥用了:先提交AI生成的作业答案,不经思考,然后只查看评分中指出的问题以便重交(典型的将AI使用成本外部化的故事)。为此,我们对重提交征收10%的扣分。 此外,课堂互动允许在早期低风险环境中接触材料,但借助AI,我看到许多学生小组将讨论题推给模型。纸笔提交可以解决这个问题,但除了增加评分负担外,也会增加学生压力、破坏低风险环境并延迟反馈。 总体而言,这是一种平衡,我倾向于保留低风险的重复互动,尽管可能被滥用。是的,一些学生可能在没有深入学习的情况下通过课程,但这为那些想学习的学生提供了更好的环境。我不想回到我在德国学习时的模式:大部分作业可选,期末考试占课程100%的成绩。这对自我激励、善于应试的学生(比如我)不错,但失败率和辍学率高达50%到80%。 现在谈谈课程的实际变化:我已放弃所有需要书面文本回答的作业部分。我仍要求学生提交描述解决方案并链接相关代码片段的报告,但这只是为了导航其解决方案,我接受AI生成的这类文档。相比之下,“反思文档”,如“哪些部分具有挑战性?”、“如何改进团队合作?”或阅读测验中的“对于场景X,识别一个你可能预期的、与论文中讨论的四种数据级联相关的数据质量问题...(https://dl.acm.org/doi/abs/10.1145/3411764.3445518)...”已变得毫无意义,完全可以委托给AI完成。除非隐藏评分标准,我无法想出如何说明我对好答案的期望,而不让LLM完全代劳。 对于书面反思——我过去几乎每项作业都有——我现在转为与助教进行面对面互动。每次作业后,每位学生需要预约与助教进行15分钟会议,通过实时对话回答几个问题(显然(https://x.com/kyanyang_/status/2102526669647188012?s=46)斯坦福CS221本学期也在进行类似对照实验)。我仍在作业中分享*反思提示(https://github.com/mlip-cmu/s2026/blob/main/assignments/I2_risk.md#deliverables)*作为示例。学生仍可使用LLM生成初始答案,但可能需要记住部分内容,我们会尝试用后续问题挑战他们。签到会议是作业的一部分,目前占作业分数的20%,按通过/不通过评分。不通过可重试,我鼓励助教保持相当高标准——我们通常会让不少学生初次不通过。 这种设计有缺点,但总体上我对权衡感到满意:无惩罚重试降低了助教口头评分公平性的顾虑;更严格的助教耗费学生时间,而非分数。口头签到对焦虑的学生要求更高,但书面考试也是如此,正式的残疾便利安排可为两种情况提供路径。实际上,技术工作的专业沟通是学习目标,口头签到比书面反思更能训练这一点。关于规模:我们以20:1的学生-助教比例运行课程,每位助教每周约10小时工作(我很幸运),因此签到大约每两周每位助教300分钟,这是可行的。 对于阅读测验,我直接放弃了。我认为在课堂进行纸笔测验带来的压力和不必要的记忆工作不值得。我实际上长期保留在线阅读测验,只是为了表明我希望学生阅读论文,完全理解大多数人只会问LLM。如今,我仍布置阅读,但数量减半且不计分。相反,我尝试将阅读中的教训融入课堂讨论。仍然,大多数学生不做阅读,只在课堂讲到相关部分时询问LLM(所以这点没变),但那些阅读的学生可能收获更多。 小提醒:我们观察到一些学生在Zoom实时讨论中使用AI(例如Cluely),未来我们可能只提供线下签到作为应对。 我们有*每周实验(https://github.com/mlip-cmu/s2026/tree/main/labs)*,是低风险的小任务,用于探索新工具(如Kafka、Grafana、Docker、Weights and Biases)。这些任务范围小,需要为初学者提供帮助——因此显然容易被编码智能体自动化。我们再次依赖线下签到——向助教展示完成任务的证据并能回答几个问题,按通过/不通过评分。同样,我们常让学生回去阅读更多文档(或让其聊天机器人总结相关部分),并让他们重试无惩罚,直到实验时间结束。 对于作业,我们使用与反思相同的助教签到,让他们解释技术解决方案的一部分。在团队合作中,每个里程碑后我们有较长的汇报会议(每团队30-60分钟)。如果助教能要求任何团队成员解释实现的任何部分,我们会为团队颁发“超越舒适区”加分。(是的,我知道,加分是骗分套路。我照样用。告我啊。) 此外,让学生制作短视频演示其实现的功能,对于扩展Web应用的作业效果很好,因为它要求功能在真实工作流中有用户界面并实际运行。我认为为其他部分制作视频也可能有效,只要不是朗读AI生成的脚本,而是基于某些实际技术工作。 正如我在许多其他课程中看到的,我们也更多地将分数从家庭活动(如作业)转移到课堂活动(如考试、参与度)。考试现在占25%,而非15%,我怀疑未来会进一步提高。汇报占作业和小组作业成绩的10%到20%。尽管大部分分数仍与家庭作业和小组作业相关,且大多数学生获得满分或接近满分,但主要的成绩区分现在来自考试成绩。 我尚未引入许多其他教师现在使用的书面纸笔课堂测验,但这是一种选择。目前我更倾向于助教汇报。 随着学生能更轻松地生成大量代码和冗长文本,传统人工评分变得更繁琐(典型的生产成本降低而人工审核成本未降的不对称)。我的转折点是去年,一位助教分享他感到荒谬地评阅一份提交信息中包含“由Claude Code编写”的解决方案。 此后我们建立了基础设施,用LLM(机构批准的LLM)自动评分代码和书面报告。自动评分采用相对直接的LLM-as-a-judge方法,其中LLM根据特定评分标准和指令以及解决方案的部分内容(如代码差异、报告)进行提示。为使自动评分更容易,我现在要求解决方案在代码库中使用多个Markdown文件而非单个PDF。自动评分器给出“通过”或“需审核”判断及给助教的评论。我们通常抽查少数“通过”评分(几乎从未发现问题),但助教大部分时间只处理“需审核”答案(许多实际通过)。LLM生成的注释也加快了人工审核过程,因为它能提供有意义的背景。最终,助教评分时间减少50%到80%(评分内容减少80%),更多时间与学生面对面互动——这也是他们更喜欢的。同时,我们仍坚持人工审核后才扣分。注意我们基于*规格化评分(https://www.taylorfrancis.com/books/mono/10.4324/9781003447061/specifications-grading-linda-nilson-claudia-stanny)*概念的明确通过/不通过标准评分,这非常适合此类评估,但也为学生的AI智能体提供了如何完成作业的非常清晰的指令。 我们现在使用相同的LLM-as-a-judge方法为课堂讨论提供反馈。每节课我们都有分组讨论(思考-结对-分享模式),并要求学生在讨论前将答案发布到共享Slack频道。在100到170名学生的规模下,我很少有时间提供个性化反馈,但现在我也自动化了这点。一个定制Slack机器人获取他们的答案,通过LLM-as-a-judge检查多项标准。我们通常在讲座内容中涵盖了这些标准的基础,但不与学生分享具体检查项。通过第二个提示,我们将检查结果转化为有建设性的反馈,作为Slack回复发布,鼓励学生修改答案,然后我们以相同方式提供第二轮反馈。提示和示例可在*此要点(https://gist.github.com/ckaestne/0911035e289e6c020cdf9c48df8218d6)*中找到。此反馈生成器稍后也可通过Web或Slack界面供学生使用,以在准备考试时尝试不同答案。我也在考虑在分组讨论期间就提供反馈,推动他们在发布前深入思考答案。 通常,自动评分和自动讨论反馈都需要校准,常调整提示以使模型不那么敏感或寻找特定问题。通常AI智能体有助于从幻灯片中创建检查的上下文和提示,并基于几个解决方案提出常见问题和相应检查。 鉴于学生花在手动阅读代码、学习库和编写代码上的时间减少,我们可以扩大工作范围。通常,我们将其扩展到当前AI智能体在没有更多实践指导和反馈的情况下无法完成任务的程度。 例如,我们*第一个作业(https://github.com/mlip-cmu/f2025/blob/main/assignments/I1_mlproduct.md)*原本用于筛选现有编码技能,是扩展一个Instagram克隆版,添加两个AI驱动功能。提供的起始代码*albumy(https://github.com/greyli/albumy)*是一个相对较小(1.2万行代码)、教科书式的干净实现。虽然正确解决方案可能只需约20行代码,但挑战过去在于理解代码、找到合适库、解决依赖不兼容问题并集成一切。作业范围有意设定得即使对HTML和Flask了解甚少也能扩展Web应用。这在2025年秋季变得轻而易举:Claude Code能解决整个作业,包括写作和反思,只需指向作业文本,无需任何交互。 我们用*类似任务(https://github.com/mlip-cmu/s2026/blob/main/assignments/I1_llm_features.md)*替换了该作业,也是实现两个AI驱动功能,但这次是在*Zulip(https://github.com/zulip/zulip)*——一个具有大型代码库(>50万行代码)的生产级团队聊天应用中。当前编码智能体可以处理此代码库,但

相似文章

利用人工智能进行教学

OpenAI Blog

OpenAI分享了教育工作者关于将ChatGPT等人工智能工具融入教学的观点,包括利用AI提供语言支持以及教导学生批判性思考AI生成内容的方法。