指控性AI:AI技术的广泛误用如何伤害学生
摘要
文章讨论了AI检测工具并不可靠,且被教育工作者滥用来惩罚学生,导致错误的作弊指控。文章强调,此类工具不应作为惩罚的唯一证据,并指出了透明度和适当评估的必要性。
暂无内容
查看缓存全文
缓存时间: 2026/08/06 04:25
# 指控性AI:一种广泛滥用的AI技术如何伤害学生 | Towards Data Science
来源:https://towardsdatascience.com/accusatory-ai-how-misuse-of-technology-is-harming-students-56ec50105fe5/
### 观点
用于检测AI系统生成内容的反作弊工具正被教育工作者广泛使用([链接](https://www.bloomberg.com/news/features/2024-10-18/do-ai-detectors-work-students-face-false-cheating-accusations)),用于检测和惩罚书面作业与编程作业中的作弊行为。然而,这些AI检测系统似乎并不十分可靠([链接](https://arstechnica.com/information-technology/2023/07/why-ai-detectors-think-the-us-constitution-was-written-by-ai/)),也不应被用来惩罚学生。即便最好的系统也会存在一定的非零误报率([链接](https://www.researchgate.net/publication/378200791_AI_Detection's_High_False_Positive_Rates_and_the_Psychological_and_Material_Impacts_on_Students)),这导致真正的学生——实际上确实是他们自己完成的作业——得到不及格(F)的成绩。AI检测器被广泛使用,被冤枉的学生从小学([链接](https://highschool.latimes.com/saint-ignatius-college-preparatory/opinion-a-generation-cheated-by-ai/#:~:text=Sydney%20Gill&text=Being%20falsely%20accused%20of%20using%20AI%20to%20cheat%20wasn't,partnered%20with%20my%20middle%20school))到研究生院([链接](https://pubmed.ncbi.nlm.nih.gov/38516933/))都有。
在这些被冤枉的案例中,造成伤害的不公正很可能并非提供工具的公司之过。如果你查阅他们的文档,通常会看到类似这样的说明:
> “AI生成内容的性质在不断变化。因此,这些结果不应被用来惩罚学生。……总会有一些边缘情况:AI被判定为人类,或人类被判定为AI。” —— *引自GPTZero常见问题解答([链接](https://support.gptzero.me/hc/en-us/articles/15129396117143-What-are-the-limitations-of-GPTZero-s-AI-classifier))。*
换言之,这些服务的开发者知道它们并不完美。像上述引用的公司那样负责任的公司,会明确承认这一点,并清楚表明其检测工具不应被用来惩罚,而应用来判断何时以建设性的方式与学生沟通是合适的。仅仅因为检测器发出警报就判定作业不及格,是评分者疏忽大意的懒惰行为。
如果你正面临涉及AI工具的作弊指控,或者你正在提出此类指控,那么请考虑以下关键问题:
- 使用了哪种检测工具?该工具具体声称能做什么?如果答案类似于上面引用的内容,明确说明结果并非用于惩罚学生,那么评分者就是在明确地误用该工具。
- 在你的具体案例中,举证责任是否在于施加惩罚的评分者?如果是,那么他们应该能够提供一些证据来支持该工具确实有效的说法。任何人都可以制作一个只是用LLM以肤浅方式评估输入的网站,但如果要将其用作对学生不利的证据,那么就需要对该工具进行正式评估,以证明其可靠。此外,该评估必须具有科学有效性,并由利益无关的第三方进行。
- 在你的具体案例中,学生是否有权查看用于指控他们的证据和方法?如果有,那么指控可能无效,因为AI检测软件通常不允许所需的透明度([链接](https://rtl.berkeley.edu/news/availability-turnitin-artificial-intelligence-detection))。
- 学生或家长是否以英语为第二语言?如果是,那么此案可能存在歧视因素。英语为第二语言的人常常会从母语中直译习语或其他常见短语和表达。由此产生的文本会包含不寻常的措辞,而这些措辞已知会([链接](https://hai.stanford.edu/news/ai-detectors-biased-against-non-native-english-writers))误触发这些检测器。
- 学生是否属于使用自己习语或英语方言的少数群体?与第二语言使用者一样,这些不太常见的措辞可能会误触发AI检测器([链接](https://www.edweek.org/technology/black-students-are-more-likely-to-be-falsely-accused-of-using-ai-to-cheat/2024/09))。
- 被指控的学生是否属于神经多样性人群?如果是,这可能是此案的另一个歧视因素。例如,自闭症患者可能会使用对他们来说完全合理、但其他人觉得奇怪的表达。这些表达本身没有错,但它们不寻常,AI检测器可能会被其触发([链接](http://www.autismpolicyblog.com/2023/07/autistic-language-patterns-and-problem.html))。
- 被指控的作业是否非常简短?AI检测器背后的核心思想是查找人类很少使用、而生成式AI经常使用的不寻常词语和/或代码指令组合。在长篇幅的作品中,可能会发现许多这样的组合,因此人类偶然使用所有这些组合的统计可能性可能会很小。然而,作品越短,偶然使用的几率就越高。
- 有何证据表明学生完成了作业?如果所涉作业不止几段文字或几行代码,那么很可能存在显示作业逐步形成过程的历史记录。Google Docs、Google Drive和iCloud Pages都会保存修改历史。大多数计算机也会在备份系统中保留版本历史,例如Apple的Time Machine。也许学生曾将不同草稿通过电子邮件发送给同伴、家长甚至老师,这些邮件构成了渐进式工作的记录。如果学生使用GitHub管理代码,那么会有清晰的提交历史。清晰的渐进式开发历史能够展示学生是如何一步步完成作业的。
需要说明的是,我认为这些AI检测工具在教育领域有其用武之地,但正如这些负责任的网站自己所明确指出的,其作用并不是抓作弊者并惩罚学生。事实上,其中许多网站都提供了关于如何以建设性方式处理疑似作弊行为的指导。这些AI检测器是工具,就像任何强大的工具一样,如果使用得当,它们可以非常出色;如果使用不当,则可能造成巨大伤害。
***如果你或你的孩子被不公平地指控使用AI代写并被惩罚,那么我建议你把这篇文章以及我链接的文章给老师/教授看。如果指控者不肯罢休,那么我建议你联系律师,探讨对老师和机构/学区提起诉讼的可能性。***
尽管我建议咨询律师,但我并不是反教育工作者,我认为好老师不应因成绩问题而被诉讼。然而,那些以伤害学生的方式滥用工具的老师并不是好老师。当然,一位善意的教育工作者可能会因为不了解工具的局限性而误用,但在获得新信息后应当重新评估。
> “让100个有罪之人逃脱,也好过一个无辜之人受苦。” —— _本杰明·富兰克林,1785年([链接](https://en.wikipedia.org/wiki/Blackstone%27s_ratio))_
作为一名教授,我也曾在课堂上应对过作弊问题。没有简单的解决办法,而用AI检测器让学生不及格不仅无效,而且不负责任。我们是教育者,不是警察或检察官。我们的角色应该是支持学生,而不是任意惩罚他们。这甚至包括那些作弊者,尽管他们可能不这么认为。作弊并不是对教育者的个人冒犯,也不是对其他学生的攻击。在课程结束时,唯一真正因作弊而受到伤害的人是作弊者本人——他们浪费了时间和金钱,却没有获得任何真正的知识或经验。(按曲线评分,或以其他方式让学生在彼此竞争中内卷,出于多种原因是糟糕的做法([链接](https://www.nytimes.com/2016/09/11/opinion/sunday/why-we-should-stop-grading-students-on-a-curve.html)),在我看来应该避免。)
最后,AI系统将长期存在,就像计算器和计算机一样,它们将在不久的将来彻底改变人们的工作方式([链接](https://medium.com/towards-data-science/the-end-of-required-work-universal-basic-income-and-ai-driven-prosperity-df7189b371fe))。教育需要与时俱进,教学生如何负责任且有效地使用AI。这篇文章的初稿是我自己写的,但随后我请一个LLM阅读它,给我反馈并提出建议。如果没有LLM,我可能也能得到类似的结果,但我很可能会请一位朋友来阅读并提出建议。那会花更长的时间。与LLM合作的过程并非我独有,而是被我的同事们广泛采用。也许,与其追查AI的使用,我们应该把它教给学生。当然,学生仍然需要学习基础知识,但他们也需要学习如何使用这些强大的工具。如果不这样做,那么他们那些会使用AI的同学将会拥有巨大的优势。
---
*关于作者:James F. O'Brien([链接](http://jamesobrien.com/))是加州大学伯克利分校计算机科学教授。他的研究兴趣包括计算机图形学、计算机动画、物理系统模拟、人类感知、渲染、图像合成、机器学习、虚拟现实、数字隐私以及图像和视频的法证分析。*
*如果你觉得这篇文章有趣,那么以下是常用的[关注](https://objf.medium.com/)和[订阅](https://objf.medium.com/subscribe)链接。你也可以在[Instagram](https://www.instagram.com/jamesfobrien/)、[LinkedIn](https://www.linkedin.com/in/jamesfobrien/)和[加州大学伯克利分校](http://obrien.berkeley.edu/)找到我。*
*免责声明:本文所表达的任何观点仅为作者作为个人之观点。本文中的任何内容都不应被解释为作者与任何机构相关的职业立场声明。*
*本文及所有嵌入图片版权所有 © 2024 作者。本文由人类撰写,并使用了一个LLM(Llama 3.2 3B)和其他人类进行校对和编辑建议。编辑图片由AI(Adobe Firefly)生成,随后由人类使用Photoshop进行了大幅编辑。*
相似文章
学生作弊现已成为无法检测的问题
文章探讨了人工智能的进步如何使得检测学生作弊几乎不可能,因为AI生成的内容已与人类作品难以区分。
对学生使用AI的思考
关于学生在教育环境中使用人工智能的讨论或观点文章
AI可能会让我挂科
一名学生表达了自己的沮丧:完全由人撰写的论文被查重系统标记为AI生成,突显了当前学术环境中AI检测工具的缺陷。
利用AI欺骗他人
探讨如何利用人工智能欺骗他人,引发伦理与安全方面的担忧。
我厌倦了被人指控用AI写文章。
一位作家抱怨屡次被指控使用AI写作,批评AI检测器不可靠及其对写作风格的寒蝉效应。