标签
文章认为,在大型代码库中,只具备部分理解是可以接受的,甚至常常是必要的,这与Peter Naur在《编程即理论构建》中提倡的完全理解理想相反。它辩护了在高流动性、大规模环境中以有限理解进行工作的实践。
本文介绍了针对自主编码智能体的智能体-计算机接口(ACI),用专为导航、编辑和反馈设计的命令取代原始bash,在SWE-bench和HumanEvalFix上取得了最先进的结果。
与Lucas Wargha讨论软件工程师如何通过关注客户成果转向产品工程,以Gmail后台收件箱加载等为例。
Gergely Orosz主持了他的第一个AMA节目,回答了关于AI原生SDLC、AI在招聘中的应用、工程管理的问题,并分享了疫情如何促使他走上写作生涯。
文章警告说,依赖LLM编写代码而不保持良好模式,会教会AI不良习惯,导致代码库充满重复逻辑,代码质量不断恶化。
一条推文质疑:尽管声称用AI构建应用比以往任何时候都更容易,但为何AI驱动的应用质量并未显著提升。
总结了Matt Pocock的Grill-Me系列Skill中使用的专业术语(如Tracer Bullet、Seam、Design Tree、Throwaway Prototype),并解释它们如何帮助AI理解并生成更高效的开发方案。
文章分析了Claude Code等AI Agent发布后美国软件开发岗位招聘不降反升的现象,指出市场正在从需要执行者转向需要能驾驭Agent的高级开发者,Agent正在重新定义程序员的角色。
@Franc0Fernand0 的一条推文建议工程师在跳进LeetCode刷题之前,先掌握12个基础数据结构和算法主题,建议每周学习一个主题。
一条推文主张软件重写可以变得好、便宜且快速,尤其是随着AI模型在填补测试和验证缺口方面的改进。
OpenAI 描述了对 SWE-Bench Pro 的审计过程,使用了基于模型的调查代理和来自经验丰富的软件工程师的独立评审,以确保在大规模下的全面评估。
Databricks 分享了在其数百万行代码库上评估编码智能体的内部基准测试结果,揭示了能力层级和成本性能权衡,并强调了像 GLM 5.2 这样的开源模型的有效性。
Boris Cherny,Claude Code 的创建者,描述了一种工作流程:他不再直接编写代码,而是向 Claude 发出提示,并且常常让一个 Claude 去提示其他 Claude,这突显了 AI 为个体工程师提供的巨大杠杆效应。
讨论了软件中的Lindy effect,认为经过长时间验证的旧技术通常比新潮技术更可靠且风险更低。
作者描述了他们最喜欢的软件工程面试题:计算数组的中位数。他们讨论了这个问题在评估候选人编程技能时的多个角度,包括排序、边界情况、API设计和统计理解。
本文探讨了AI代理工作流如何重新引入软件工程在可重复性、可审计性和状态管理方面的挑战,这些挑战此前已通过版本控制、CI/CD和静态代码实践得以解决,同时提到了GitHub的Agentic Workflows和git原生方法等新兴解决方案。
Kent C. Dodds 分享了一期与 Lucas Wargha 的播客节目,讨论产品工程、用户对话和工程文化。
基准测试综述,涵盖 SWE-Bench Pro 和 312 个真实工作流任务,可能用于评估人工智能在软件工程挑战中的表现。