标签
Kent Beck认为,即使AI不断进步,软件工程也不会消失,因为编码涉及建立信任、理解和联系,而这些是无法自动化的。
该文章讨论了软件开发中关于代码评审真实目的的常见误解,强调其更多是关于知识共享和团队协作,而不仅仅是发现错误。
作者强调让AI Agent写好代码的关键在于遵循1990年代教材中的经典软件工程实践:写测试、做好CI/CD、进行自顶向下设计和模块化解耦等。
Senior SWE-Bench 是一个开源基准,用于评估AI代理在需要高级技能的软件工程任务上的表现。
批评Vibe Coding风格,指出自然语言需求的不精确性导致AI Agent产出需要大量返工,提倡spec-driven development以确保安全性和生产质量。
Senior SWE-Bench 是一个新的开源基准测试,旨在评估 AI 智能体在现实、未充分指定的软件工程任务上的表现,强调意图对齐和代码质量等技能,而非过于详细的规范。
一档播客访谈中,Kent Beck讲述了他的职业生涯,从早期编程到敏捷开发和测试驱动开发,强调了软件工程中人类技能的重要性。
SWE-rebench 排行榜已更新,新增了 GLM-5.2、Qwen3.6、Gemma 4 31B 等模型,并改进了 UI,展示了软件工程任务上的性能排名。
本文对比了旧的C++性能技巧与现代编译器的能力,表明编译器现在能够将朴素代码优化得比手工调整的技巧更好。包含在AMD Zen 5上使用Clang 21的基准测试。
本文介绍了InterFLOPBench,这是一个用于评估LLM在C代码中检测浮点错误的基准测试,发现最近的模型取得了较高的F1分数,但性能因错误类型而异。
Gergely Orosz 宣布明天将与 Kent Beck 举办一场活动。
本文审计了针对编码代理的三个性能优化基准(GSO、SWE-Perf、SWE-efficiency),发现运行时不稳定、评分规则和任务覆盖率显著影响可靠性,并且许多任务已经至少有一个公开提交解决了。
本文对在十五个独立开发的服务器中观察到的五个反复出现的MCP服务器架构模式进行了分类,提供了一个包含上下文、问题、解决方案和后果的分类法。还记录了反模式、横切关注点以及定量评估,包括评分者间信度和传输开销。
IBM Research 推出 ScarfBench,这是一个用于评估AI智能体在跨框架Java迁移任务中表现的开放基准测试,重点关注 Spring、Jakarta EE 和 Quarkus。与传统的代码生成基准不同,该基准主要评估迁移后的应用程序是否能够构建、部署并保持原有行为。
一条推文推荐观看Angie Jones关于构建AI代理的主题演讲,强调了核心工程原则,并提到了Python框架如DSPy、Functai和Mirascope。
本文探讨了AI代码生成在局部代码块方面表现出色,但在全局程序理解方面存在困难,导致过多的防御性检查。它考察了编程语言设计是否能有所帮助,并通过一个局部推理保证全局属性的例子进行说明。