AI软件开发——数据说了什么?
摘要
本文综合了近期关于LLMs在软件开发中的数据和研究,揭示了其在自主性、上下文处理和实际结果方面的显著局限,表明AI编码是放大现有优势,而非修复弱点。
<p><a href="https://lobste.rs/s/joyawz/ai_software_development_what_does_data">评论</a></p>
查看缓存全文
缓存时间: 2026/08/17 02:01
# AI软件开发:数据揭示了什么?
来源:https://codemanship.wordpress.com/2026/08/12/ai-software-development-what-does-the-data-say/
我正在整理一系列近期关于大语言模型在软件开发中应用的资料来源。
其中包含经过同行评审的研究、未经同行评审的行业报告。还有一份来自统计物理学的研究——想了解技术的极限?去问问物理学家吧。另外还有一篇博客文章,但其关于上下文长度影响的信息非常有价值。
大多数观点都得到了个人实验和团队观察的印证。随着时间推移和更多数据涌现,我的认知图谱也愈发清晰。
在引用来源之前,先为各位忙碌的管理者提供一份简要摘要:
- 完全自主且可靠的长周期智能体软件开发,在使用大语言模型的情况下几乎不可能实现,本质上仍是科幻场景。
- 包括超大规模“前沿”模型在内的大语言模型,其真正有效的最大上下文限制远低于宣传的限制——一旦超出此限,模型输出将变得不可用。厂商常用的“压缩”技术(通过模型总结上下文部分内容)本质是高度不可靠的信息有损过程。
- 大语言模型无法区分上下文中信息的新旧,模型训练时习得的“主导先验”信息往往比我们提供的实时信息更具影响力。对模型而言,只有token、权重和概率——无论对错新旧,最高概率者胜出。而大上下文和“注意力稀释”现象(概率值小到无法与模型内部概率竞争)会使这类问题加剧。
- 仓库级.md文件通常会降低模型性能,可能是因为在许多具体任务中它们带来的是噪声而非信号。而模型生成的.md文件在这方面问题尤为突出。结论:为每个任务都附上团队编码规范和架构概要可能适得其反。
- 大语言模型难以处理否定指令。告诉模型“不要做什么”往往等同于“要做什么”——难怪有些防护措施形同虚设。
- 大语言模型在接收示例(演示)时比单纯接收需求描述更准确。作为模式匹配器,我们应展示更多“像这样”,而非“做这个”(更别说“别做这个”)。
- 大规模行业研究显示明确趋势:代码产出量上升(更多代码、提交、差异),但实际成效并未同步增长。平均而言,团队甚至花了更长时间交付更差的软件。这再次印证软件开发绝非流水线作业。少数研究发现小部分团队取得有限成效,与其既有开发能力呈正相关。AI编程是开发优劣势的放大器,而非解决方案。
- 大语言使用的心理认知因素正成为严肃研究的新领域。有研究发现AI输出置信度与超自然信念存在显著相关性。多项研究表明,对大语言模型的依赖会抑制学习、认知与批判性思维。新研究指出开发者因长期使用而产生职业倦怠的反馈确有现实依据。
- 包括大语言模型在内的深度神经网络,始终难以学习长距离依赖模式。无论模型规模多大,它们都像“雾中行车”,局部短程概率总会压倒长程概率。这正是它们难以把握“全局”的原因——从概率角度看,全局图景本就是模糊的。
- 将大语言模型可靠性提升一个数量级(如错误率从30%降至3%)所需的能耗与算力,将是现有前沿模型的10^20倍。短期内别指望更可靠的模型出现。未来可靠性的提升必须通过更优的上下文工程(决定输入内容)和更有效的质量门控(处理输出)实现——这正是当前AI公司聚焦的方向。模型可能变得更强大,但未必更可靠。现实就是如此——只能善用现有工具!
- 部分AI倡导者会以众多显示大语言模型持续进步的基准测试,来反驳“模型性能无显著提升”的研究结论。但另有研究指出,我们应审慎看待基准测试表现:其一,许多流行测试仅衡量算法易测项——在此意义上与真实世界杂乱难测的问题存在本质差异;其二,“已公开的基准测试”这个说法本身已暗含问题。模型可能(有意或无意地)越来越倾向于“应试训练”——测试内容外泄,便可能混入训练数据。
**代码演进与长周期智能体工作流**
SWE-CI:通过持续集成评估智能体维护代码库的能力 https://arxiv.org/abs/2603.03823
SlopCodeBench:长周期迭代任务中编程智能体的性能衰退基准测试 https://arxiv.org/html/2603.24755v1
SWE-Milestone:评估AI智能体在持续软件演进中的表现 https://arxiv.org/abs/2603.13428
**基准测试与现实表现**
衡量关键指标:大语言模型基准测试的构念效度 https://arxiv.org/abs/2511.04703
研究更新:算法评估与整体评估(METR – 非同行评审) https://metr.org/blog/2025-08-12-research-update-towards-reconciling-slowdown-with-time-horizons/#background
大语言模型评估数据污染:如何衡量及其(何时)产生影响 https://arxiv.org/abs/2411.03923
**上下文工程**
上下文决定成败:大语言模型真实场景下的最大有效上下文窗口 https://arxiv.org/abs/2509.21361
超越RAG与长上下文:面向干扰感知的高效知识检索学习 https://arxiv.org/abs/2509.21865
评估AGENTS.MD:仓库级上下文文件对编程智能体有帮助吗? https://arxiv.org/abs/2602.11988
(博客文章 – 信息性内容,非同行评审研究)大语言模型token限制的隐藏原理(百万token模型如何实际运作) https://www.ashisharora.ai/post/the-hidden-science-behind-llm-token-limits-and-how-million-token-models-actually-work
语言模型并非否定者:大语言模型在否定基准测试中的分析 https://arxiv.org/abs/2602.11988
重思示例的作用:上下文学习何以奏效? https://aclanthology.org/2022.emnlp-main.759
STALE:大语言智能体能否感知记忆失效? https://arxiv.org/abs/2605.06527
任务特性:知识需求如何塑造大语言模型对上下文-记忆冲突的响应 https://aclanthology.org/2026.findings-acl.202
(我将模型内部信息压制上下文信息的现象称为“主导先验”)
**软件工程领域大规模行业研究**
2800万工作流揭示的AI编程最大风险(CircleCI) https://www.linkedin.com/pulse/what-28-million-workflows-reveal-ai-codings-biggest-risk-circleci-j9syc/
加速反噬效应 – 2026 AI工程报告(Faros) https://www.faros.ai/research/ai-acceleration-whiplash
2025年AI辅助软件开发现状(DORA) https://dora.dev/research/2025/dora-report/
**心理学、认知与学习**
超智能还是迷信?探究影响AI个人行为预测信念的心理因素 https://arxiv.org/html/2408.06602v3
生成式AI对批判性思维的影响:基于知识工作者调查的认知努力自评降低与置信效应 https://www.researchgate.net/publication/391270185_The_Impact_of_Generative_AI_on_Critical_Thinking_Self-Reported_Reductions_in_Cognitive_Effort_and_Confidence_Effects_From_a_Survey_of_Knowledge_Workers
大语言模型与网络搜索对学习深度影响的实验证据 https://www.researchgate.net/publication/397000021_Experimental_evidence_of_the_effects_of_large_language_models_versus_web_search_on_depth_of_learning
代价几何?生成式AI时代软件开发者的身心健康 https://ourarchive.otago.ac.nz/esploro/outputs/preprint/At-What-Cost-Software-Developers-Well-Being/9926870122801891
**大语言模型与深度学习的局限**
大语言模型面临的壁垒 –(统计力学研究) https://arxiv.org/abs/2507.19703
梯度下降学习长期依赖性的困境 https://pubmed.ncbi.nlm.nih.gov/18267787/ (深度神经网络在任何规模下都难以把握全局的根源)
*这些发现对使用该技术的团队有何启示?若您希望获得基于实证、无炒作的见解,了解敏捷软件开发技术实践为何与AI辅助及智能体软件工程如此契合,请于10月6日18:45(英国夏令时)加入我*。
*报名链接:https://www.tickettailor.com/events/codemanship/2324138*
相似文章
了解你的敌人:对AI辅助软件开发的批判性探讨
Amy J. Ko 分享了她对AI辅助软件开发的批判性观点,探讨了使用LLM编写代码的前景与陷阱,并讲述了她为期三个月的实验,以评估对生产力和实践的真实影响。
为什么我仍然是一个怀疑论者
作者对LLMs在软件开发中的有效性表示怀疑,指出缺乏关于生产力提升的独立研究以及AI生成代码的质量问题。
LLM生成的技能能否让AI数据科学家表现更佳?数据科学工作流的组件消融研究
本文研究了LLM生成的可复用技能文件是否能在数据科学工作流中提升AI数据科学家的表现。通过涉及超过9000次运行的广泛消融实验,作者发现生成的技能相较于基线提示并未带来显著改进,因此提醒不要默认使用它们。
AI在招聘时比人类更容易形成偏见
新研究显示,大型语言模型能够从经验中形成自身偏见,并且比人类更倾向于对求职者进行刻板印象评估,这引发了对AI用于招聘的担忧。
审查AI代码并非一个站得住脚的论点(2025)
文章认为,要求全面审查代码会抵消LLM编码助手所谓的生产力提升,因为实证研究显示它们并不能帮助写出更好或更快的代码,而且支持者未能解决固有的错误率问题。