永恒的Sloptember

Lobsters Hottest 新闻

摘要

George Hotz认为,采用AI代理进行软件开发是一个代价高昂的错误,因为它们生成的是越来越难以检测的劣质代码(slop),而不是可靠的代码。他警告说,大型组织将比个人更受这一趋势的伤害。

<p><a href="https://lobste.rs/s/pwnqab/eternal_sloptember">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/05/25 01:03

# 永恒的 Sloptember 来源:https://geohot.github.io/blog/jekyll/update/2026/05/24/the-eternal-sloptember.html 我现在就预言,将 AI 智能体引入软件开发,将成为该领域历史上代价最惨重的错误之一。智能体根本不会编程,而且人们意识到这一点所花的时间越来越长。它们不过是一种高度精密的统计模型,旨在模仿编程的分布。其输出是烂的,但烂的方式却越来越难以察觉。而这恰恰是统计模型日益精确后我们所能预料的结果。 --- 起初,我拒绝相信这一点。我认同推特上关于“地位焦虑”的解释。我的自我价值一部分来自于编程能力,那么面对这种能力被取代的威胁,产生防御心理不是很合理吗?尽可能久地否认模型能编程,以维护我的自尊? 我是说,很明显它们能解决我穷尽一生也无法企及的数学问题。那么为什么它们就是不能编程呢?也许我只是不够优秀的程序员,无法领会它们的天才之处。 在过去的六个月里,我真的努力尝试过。我用智能体编写了 tinygrad 的部分代码(https://github.com/tinygrad/tinygrad/blob/master/test/mockgpu/amd/emu.py)。我用智能体逆向分析了 USB <-> PCIe 芯片(https://github.com/tinygrad/asm2464pd-firmware)。但每次我都觉得,手动完成会更好更快。智能体把进度都堆在前面,然后留给你一个老虎机拉杆,让你指望它能完成打磨。但它永远做不到。 当然,之前还有人说:“你用错了。”我试过所有不同的模型、不同的框架、不同的提示词。问题不在这里。说这种话的人,大概也会对老虎机说同样的话——你看,你得在拿到樱桃后下注五条线,难怪你赢不了! 我不是说 AI 没用,它显然有用。对大多数搜索来说,它绝对是一个更好的 Google。当你需要快速原型而且不在乎打磨时,它快得离谱。但它能算得上软件工程师吗?在我待过的任何一家公司,都远未达到标准。关键在于知道什么时候该用它,什么时候不该用。 我进一步思考了自我价值维护这件事。AFL(https://github.com/google/afl)比 LLM 发现了更多漏洞,但没人对此感到不安。国际象棋和围棋比以前更受欢迎。我他妈等不及拥有成群的我能信任的机器人 *助手* 来清理我的代码了!我并不害怕失去地位,我几乎觉得这是一场推销智能体的心理战。害怕失去是迫使大公司行动的唯一途径之一。不过我认为,在这种恐惧中,它们正在犯一个大错误。 --- 比起高绩效个人或小团队,智能体最终会伤害大型组织更多。过去的六个月里,我观察了我的朋友和同事如何采用这些工具。所有高绩效者都有一个共同特征——纠错能力,他们大多能很好地分辨什么是垃圾。他们只是需要一点时间来探索/利用,并调整外围循环——什么时候用、什么时候信任、怎么用等等——但我没看到任何人转向那种不仔细阅读和理解每一行代码的模式,除了一些受限领域。 相比之下,大型组织呢?反馈回路慢得多,对齐程度也低得多。底层执行者不会有这种自我检视。他们正是那些用智能体产出十倍输出的人。你觉得那个组织的平均输出正在发生什么变化?世界的平均输出又在发生什么变化? 智能体会最终产生比以往更多的代码、更多的应用、更多的功能。这是一个成堆成堆垃圾的黄金时代,也是一个精品匮乏的黑暗时代。 我听说苹果正要求所有工程师使用 AI。当人们进行抽象思考时,他们会认为 AI 能做所有这些事情,但让我们关注一个具体的例子:你认为在未来两年里,macOS 会变得更好还是更差? --- 当人们看到一件制品时,他们会对其创作过程做出假设。甚至不需要思考,他们就假设创作者具有基本的人类心智状态。这个假设不再成立。事物现在可以以从前不可能的方式坏掉,而像语法和句法这些反映底层质量的旧有指标已经失效。AI 产生的制品并非由与人类制品相同的过程产生,这种差异虽然在统计上极其微妙,但当你试图以人类的方式与之交互并在此基础上构建时,它就会变得显而易见。 不完全赞同他们所有的观点,我现在站在 LeCun/Marcus 关于 LLM 的阵营。我认为这类模型永远无法真正编程,我认为过程很重要。我认为深度学习仍然是解决方案,但真正的编程智能体需要世界模型,而不是那种会注释掉失败测试并告诉你所有测试都已通过的 RLVR 垃圾。 这个时代真正的故事,将是那些在 AI 精神错乱中设法避免自我伤害的人。

相似文章

如何避免AI代码质量下降

Reddit r/ArtificialInteligence

本期通讯文章讨论了AI生成代码速度超过人工代码审查速度所导致的“AI代码质量下降”问题,并提供了平衡速度与质量的策略。

“垃圾僵尸”的崛起

Reddit r/ArtificialInteligence

一篇评论文章,探讨了“垃圾僵尸”——即过度使用AI聊天机器人工作的员工,他们产出臃肿且错误频出的内容,削弱了批判性思维和生产力——的兴起。