为什么我仍然是一个怀疑论者

Lobsters Hottest 新闻

摘要

作者对LLMs在软件开发中的有效性表示怀疑,指出缺乏关于生产力提升的独立研究以及AI生成代码的质量问题。

<p><a href="https://lobste.rs/s/fooyux/why_i_remain_skeptic">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/08/15 13:43

# 我为何仍持怀疑态度 原文链接:https://blog.jsbarretto.com/post/i-remain-a-skeptic 我至今仍未在任何真正重要的场景中使用大语言模型。我能给出诸多理由:环境影响、社会效应、政治考量。技术生态锁定、技术依赖的养成、数字自主权问题、哲学层面的忧虑、劳动力议价能力的刻意削弱等都值得探讨。但在此所有论述之前,最根本的效能问题——它们究竟能否胜任构建有意义软件的核心需求——至今仍无定论。 以下是我保持怀疑的几个主要原因: - **这场“革命”已历经四年,行业却几乎拿不出像样的成果。**软件质量未见提升,开发速度未加快,生产成本未降低(若剔除那些无人敢碰的劣质演示产品),能力边界也未拓宽。安全性自然更无改善。技术革命通常伴随着旧帝国的崩塌与新势力、新思想的崛起。但过去数年间,除了AI狂热者的自说自话,我看不出行业产生了任何真正的新理念。所有人都在声嘶力竭地呐喊,却无人能交付真正实用的东西。 - **我并未因未使用LLM而感到落后,尽管我曾预料会如此。**尽管喧嚣不断,但至今无人能撼动我开源项目的声誉基础。或许你可以复制我代码的功能,但简单如`memcpy`也能做到:一个能获得社区信任并被广泛用于构建系统的开源项目,其价值远不止功能清单的堆砌。 - **证据薄弱且稀缺。**投入1.5万亿美元后,我们仍几乎找不到能证实AI带来顶级生产力提升的独立研究。考虑到当下半数经济体系都建立在这项核心主张之上,我们理应看到更多超越个别案例和轶事的实证。我所了解的所有研究,要么过度聚焦与顶级生产力无关的指标(如“代码行数”、“合并请求数”、“新增功能数”等),要么样本过小难以得出可靠结论。即便那些暗示存在学术价值的研究,所指向的也只是边际收益甚至是负生产力增长。 - **我收到的LLM生成代码依然糟糕。**代码的机械重复感和风格一致性有所改善,但适用性并无提升。其中值得合并的比例仍远低于人类编写的代码。有人批评说,由于AI输出略微脱离了公式化模板,现在更难区分人机代码。但最细心的人类也会在描述中留下零星错别字,因此我尚未相信机器人已能达到以假乱真的程度。 - **它们仍会遗漏显而易见的漏洞。**我的几个开源库出现在FAANG公司的依赖树中,曾多次收到基于前沿模型扫描的漏洞报告。其中部分确有价值,但多数是误报。我记得有多次情况,业余爱好者很快就能用常识发现重大漏洞,而前沿模型却视而不见。 - **AI狂热者宣扬的理念,与过去半个世纪关于软件开发本质的理论背道而驰。**我们都应明白,代码是软件开发过程的输入而非产出:但即便最具前瞻性的组织,仍暗中将代码行数视为生产力指标。无论这种粗糙代码来自机器,还是人类屈从于设计缺陷激励体系的副产品,这条路通向的都是不可维护的代码泥潭。Peter Naur的论述至今立于不败之地(https://pablo.rauzy.name/dev/naur1985programming.pdf)。 - **当人人皆超凡时,无人再特殊。**科技巨头强推LLM的隐秘目标,是将智力劳动同质化使其可替代。当劳动力可随意替换时,工人的议价能力便会削弱。软件开发曾是最后的“行会领域”之一,而我们正见证其工业化进程。通过不依赖LLM,我为自己保留了深耕特定技能领域的空间。目前看来这个主动选择效果良好,我对职业前景仍充满信心。 如您发现本站存在无障碍访问问题,请[告知我](mailto:[email protected])! © Joshua Barretto

相似文章

审查AI代码并非一个站得住脚的论点(2025)

Lobsters Hottest

文章认为,要求全面审查代码会抵消LLM编码助手所谓的生产力提升,因为实证研究显示它们并不能帮助写出更好或更快的代码,而且支持者未能解决固有的错误率问题。

LLMs 与表演式生产力

Lobsters Hottest

一位开发者反思使用 AI 代理的经历,并质疑表面上的生产力提升是真实的还是仅仅是表演性的,指出虽然任务完成得更快,但深层理解和真正价值可能会丢失。

技能成为新的代码检查工具

Reddit r/AI_Agents

作者认为,使用AI技能来自动化代码质量检查,会重现代码检查工具最初旨在解决的内存与可靠性问题,从而质疑基于大语言模型的技能作为替代方案的有效性。