AI 炒作与软件工程现实之间日益扩大的差距
摘要
由于对LLM质量和欺骗性输出的担忧,开源项目越来越多地禁止AI辅助贡献,凸显了AI炒作与软件工程现实之间日益扩大的差距。
暂无内容
查看缓存全文
缓存时间: 2026/08/29 18:38
# AI炒作与软件工程现实之间日益扩大的鸿沟
来源:https://optimizedbyotto.com/post/why-open-source-projects-ban-ai/
当前金融市场存在AI泡沫已是广泛共识。温和观点认为大语言模型持续进步,终将接管越来越多的人类任务并提升生产力。**但大语言模型是真的在变得更智能,还是仅仅更擅长欺骗我们?**
一股技术专家阵营认为,大语言模型实际上对真正的进步有害,因此禁止其使用并要求纯人工工作,以确保质量和人类时间的高效利用。Rakshit Yadav 最近对120个开源项目的AI政策进行的审查(https://medium.com/@yadavrakshit60/i-read-the-ai-policies-of-120-open-source-projects-here-is-what-they-actually-say-9a5ea6897893)显示,其中37个项目选择了完全禁止AI。在Linux内核中,允许AI辅助贡献,但需注明所用大语言模型(https://docs.kernel.org/process/coding-assistants.html)以保证透明度;而GCC、QEMU、SDL、Gentoo、Zig和Ghostty等项目已采取政策拒绝所有AI辅助贡献。此外,Codeberg(https://blog.codeberg.org/protecting-our-floss-commons-from-llms.html)和Sourcehut(https://sourcehut.org/blog/2026-08-27-tos-changes-and-llms/)等开发平台,以及Flathub(https://docs.flathub.org/docs/for-app-authors/requirements#generative-ai-policy)等应用商店也禁止使用AI生成软件、文档、错误报告、评审评论等任何面向人类阅读的内容。允许使用AI的项目通常仍要求“人在环中”,提交者必须阅读并过滤大语言模型生成的所有内容,才让其他人接触,以遏制“AI废话”(https://en.wikipedia.org/wiki/AI_slop)的传播。
目前,Debian Linux发行版正在开发者间进行投票,决定是否允许或禁止使用AI为Debian做贡献(https://www.debian.org/vote/2026/vote_002)。选票中的一项提案是*全面禁止AI*用于代码、文档、翻译、错误报告等。多数人的第一反应是惊讶——为什么这些技术人员不想使用人类迄今最顶尖的技术?是不想让Debian借助AI更快进步吗?还是大语言模型实际上是骗局,无法真正为Debian提供帮助?**这些人是各自领域的杰出专家,绝不愚蠢,因此值得停下来理解他们为何提议AI禁令。**
另请记住,AI数据中心本身运行在Debian或其他基于Linux的系统上。全世界所有开源软件都曾被输入大语言模型,而软件开发是当前AI的主要用例之一。那么,为何许多开源项目的维护者不愿接受大语言模型辅助的贡献,尽管这些大语言模型几乎都运行于同样的软件栈之上,并使用相同的开源代码库学习软件开发?
## https://optimizedbyotto.com/post/why-open-source-projects-ban-ai/#why-llms-are-so-deceptive为何大语言模型如此具有欺骗性
大语言模型的输出通常看起来非常引人注目、专业且正确。**人类进化出基于易于检测的次要因素来信任或怀疑新信息的倾向,例如发言者的权威性,或信息传达的自信与雄辩程度。**然而,人类非常不擅长事实核查和交叉引用新信息,因为这需要大量精力,而人类倾向于节省能量、尽可能偷懒。
## https://optimizedbyotto.com/post/why-open-source-projects-ban-ai/#information-asymmetry信息不对称
**你对某事了解越少,就越容易在该领域被欺骗。**诺贝尔经济学奖曾授予研究信息不对称(https://en.wikipedia.org/wiki/Information_asymmetry)如何扭曲市场并导致次优结果的研究。在软件工程领域,我们现已目睹大量初级软件开发者使用AI创建看似可能有效、实则漏洞百出的软件。这些人本意良好,但缺乏专业知识来理解自己真正在做什么,也不具备必要的判断力来区分大语言模型何时生成真正有用的内容,何时主要制造垃圾。**我认为这种专业知识的不对称解释了当前开源项目中观察到的大多数冲突**——高级开发者被大量审查代码(https://optimizedbyotto.com/post/how-to-code-review/)的请求淹没,这些代码质量低劣,浪费所有相关人员的时间;而随着AI的普及,可能贡献并以更快速度制造更多“代码垃圾”的人群池不断扩大。
如果资深者教导初级者正确进行软件工程,信息不对称在一定程度上可以得到平衡,但快速大规模教育所有人当然是不可行的。此外,似乎许多人*不想学习*,而是期望将所有理解外包给大语言模型。许多资深者注意到这一点,已停止教导初级者,因为**资深者不喜欢将时间浪费在教导不想学习的人身上**。初级者可能都明白*最好*自己学习设计和编写软件,但使用大语言模型感觉太容易了。我完全理解人们为何选择阻力最小的道路。不幸的是,这条路往往通向死胡同。
## https://optimizedbyotto.com/post/why-open-source-projects-ban-ai/#humans-fall-too-easily-for-anthropomorphism人类太容易陷入拟人化思维
人类大脑天生认为无生命物体有生命且有感觉(https://en.wikipedia.org/wiki/Anthropomorphism)。小孩子像对待真人一样与毛绒玩具说话,许多成年人将周围发生的事情归因于神灵或精灵发怒等超自然行为。当我们看到机器像人一样写作,甚至更令人信服地听到它像生命体一样说话和回应时,**我们的大脑会自动假定它是有智能和感觉的生命体。**
这些生物生活在抽象的“云”中,仅通过我们掌中的门户出现,并以设计为最大化互动参与的方式行事,这一事实使错觉更加强烈。**我建议人们尝试在本地笔记本电脑上运行大语言模型**,看看“原始”的模型吐出词元(token)的过程,从而打破部分错觉。
同时,别再对大语言模型说“请”了。*它没有任何感觉。*
## https://optimizedbyotto.com/post/why-open-source-projects-ban-ai/#understanding-temperature理解“温度”
根据我的经验,理解大语言模型中“温度”(https://www.ibm.com/think/topics/llm-temperature)的概念有助于理解为何大语言模型可能自信地生成看似合理却完全错误的代码更改。大语言模型是统计机器,基于神经网络的输入(前序词元)预测输出内容(下一个词元)。运行大语言模型时,如果温度配置为零,输出非常可预测,总是遵循神经网络节点和层之间最强连接(即权重)的路径。与活生物的大脑不断学习和改变不同,大语言模型的权重只能在训练期间改变。当大语言模型处于“正常”使用状态(推理期间,生成下一个词元)时,权重是固定的,如果温度为零,对特定问题的答案将总是*完全相同*。这当然有点无聊且过于机械,因此通常大语言模型会设置一定的温度值,这会在神经网络遍历的连接中引入随机变化。
我再次建议人们尝试在本地运行小型大语言模型,其中温度和其他设置完全暴露且可配置,以便亲自观察。这是对抗大语言模型真正智能错觉的良好解药。
## https://optimizedbyotto.com/post/why-open-source-projects-ban-ai/#why-benchmarks-dont-tell-the-whole-story为何基准测试不能说明全貌
如果大语言模型持续产生如此多垃圾,为何基准测试显示它们在不断进步?AI模型确实在持续改进(https://optimizedbyotto.com/post/ai-models-plateaued-or-not/)。例如,CAIS AI仪表板(https://dashboard.safe.ai/)可视化了前沿模型在过去几年的演进。然而,最好的模型在“人类最后的考试”(https://agi.safe.ai/)上的通过率仍仅约50%。在SWE-bench(https://www.swebench.com/)上,当今最好的模型解决了略低于77%的问题。这意味着AI错误的情况相当常见。这与我的个人经历相符,著名的Greg Kroah-Hartman最近在Linux开发者邮件列表中写道(https://lore.kernel.org/all/2026080354-skater-urgent-31b2@gregkh/)*“即使使用当前和下一代的最佳工具,它们生成的结果中至少1/3是完全错误或有害的”*。
生成猫咪视频时错误率无关紧要,但在**工程领域,事情必须绝对正确**。诚然,人类也会犯错,但受过良好教育并得到适当激励的人类在许多方面远胜于大语言模型。我们能实现可靠运行的复杂事物,例如运营全球商业航空交通而不会每天都有飞机坠毁。
目前,许多人被激励去维护通用人工智能即将到来并将接管一切的叙事。事实上,整个金融体系目前都倾向于这种愿景(https://optimizedbyotto.com/post/when-everyone-else-is-wrong/),因为劳动力成本下降、利润增长以及对一切的垄断控制的承诺,前所未有的吸引着资本。
**在这种环境中,我们需要记住,机器和经济体系最终是人类的仆人,而非相反。**
大语言模型不是骗局,而是一种有用的技术工具,自有其用途。但认为AI已或即将在能力或效率上超越人类的观点,根本不符合事实。我们应该倾听那些创造了人类迄今最复杂系统(计算机和软件)的人的声音,他们在说大语言模型在许多情况下非常糟糕,在特定领域暂时完全禁止它们,可能比在阅读它们生成的文本和代码上浪费更有价值的人类时间更好。
时间不对称并非新现象,长期以来就有各种“脚本小子”。例如,一个人运行内存泄漏扫描器却不理解结果,花费10分钟提交错误报告,却可能迫使开源维护者花费一小时来证明和解释该发现是错误的。新的是AI用户盲目信任他们得到的输出,而开源领域尤其脆弱,因为没有经理来保护开发者的时间使用。
## https://optimizedbyotto.com/post/why-open-source-projects-ban-ai/#what-i-do-recommend-and-expect-to-see-in-the-next-stages我的实践、建议与对未来阶段的预期
我每天都在使用AI工具,并不断尝试新模型和新的使用方法。有时它们有效,常常无效。有时让AI自我循环可以使其修复自身错误,但有时它只是偏离轨道,永远无法得出正确解决方案。当大语言模型无法根据阅读我的邮件正确创建日程条目时,我很容易发现错误。我尽量避免在无法自行判断结果是否正确的情况下使用大语言模型。
**我也真诚希望其他人不要向我发送任何他们投入的努力少于我阅读和理解所需努力的东西。**这一原则并不新——许多人都听过“阅读代码所需的努力必须少于编写它所需的努力”的要求。
我始终对软件代码(https://optimizedbyotto.com/post/best-practices-corporate-open-source-contributions/)保持高标准,并要求开发伙伴确保其代码结构良好、易于理解和文档化。不幸的是,大语言模型使人们在这方面更容易作弊,但如果作弊变得更容易,也许惩罚和威慑现在也需要提高。随着许多开源项目采取政策对AI使用加以规范,我预计很快会看到政策被执行的案例,而违规如何被裁决将值得关注。
作为社会,我们或许还需要制定新的社会标准和规则,规范人机互动中可接受的人类对待方式,并且随着机器越来越独立地行动,或许还需要新的标准来显示人类对哪些机器负责。我鼓励人们参与这些讨论,如有疑虑,请倾向于支持真实人类互动的一方。与许多商界人士似乎认为的不同,尽管我自己总体上是个技术乐观主义者,但我认为没有必要急于采用AI。
相似文章
FT:AI编程热潮令开源维护者不堪重负
《金融时报》报道称,AI编程热潮正用低质量的AI生成贡献淹没开源维护者,消耗着整个生态系统。具体证据包括cURL关闭其漏洞奖励计划、Ghostty禁止AI代码、tldraw自动关闭PR,以及研究表明贡献者参与度下降。
了解你的敌人:对AI辅助软件开发的批判性探讨
Amy J. Ko 分享了她对AI辅助软件开发的批判性观点,探讨了使用LLM编写代码的前景与陷阱,并讲述了她为期三个月的实验,以评估对生产力和实践的真实影响。
AI正在摧毁开源,而它甚至还不够优秀
本文讨论了AI生成的代码和代理AI如何以低质量的拉取请求和错误报告淹没开源维护者,导致像curl这样的项目取消漏洞赏金,并导致维护者受到骚扰。
请停止用AI生成的低质量内容充斥我们的项目,只为充实你的简历
开源项目维护者正面临大量AI生成的贡献涌入,这些人利用AI工具提升其GitHub个人资料以求就业,这引发了关于这些提交的质量与意图的问题。
真正的分歧不在于“AI编码 vs 真实编码”,而在于“无监督生成 vs 经过验证的工程”。
文章认为,AI辅助开发中的真正分歧并非AI与人类编码的对立,而是无监督生成与经过验证的工程之间的对立;工程师应当围绕AI生成器构建验证与控制系统。