@mylifcc: Sourcegraph 用 1281 次 agent 运行数据(覆盖 40+ 大型开源仓库)分析后得出结论: Coding agents 在大代码库里失败,往往不是模型不够聪明,而是基础设施没跟上。 最常见的失败模式是 "Lost in …
摘要
Sourcegraph 基于 1281 次 agent 运行数据发现,大型代码库中 coding agent 失败的主要原因是基础设施不足而非模型能力,典型模式为“迷失在代码库”中,需改进代码检索、导航和上下文工程。
查看缓存全文
缓存时间: 2026/05/24 02:18
Sourcegraph 用 1281 次 agent 运行数据(覆盖 40+ 大型开源仓库)分析后得出结论:
Coding agents 在大代码库里失败,往往不是模型不够聪明,而是基础设施没跟上。
最常见的失败模式是 “Lost in the codebase”:
Agent 会陷入无尽的跳转和文件读取,却始终无法收敛形成有效计划。当代码库规模超过 ~40 万行,只依赖本地 grep/read 这类基础工具时,这个问题会显著加剧。
其他可重复的失败模式还包括选错文件/符号、只完成部分相关修改等。
文章的核心观点很清晰:单纯依赖模型能力,在大型代码库上很难 scale。更好的代码检索、智能导航和上下文工程,才是更关键的瓶颈。
对正在构建 production-level coding agent 的人来说,这是个值得认真对待的信号。
相似文章
@Xudong07452910: 这篇论文很适合所有重度使用 Claude Code、Codex 或者其他AI Agent 的人看。 它研究的不是 Agent 在 benchmark 上怎么失败,而是一个更真实的问题: 在真实开发里,AI coding agent 到底是…
This paper analyzes 20,574 real-world coding-agent sessions to identify how AI agents misalign with developer intent, finding that constraint violations and inaccurate self-reporting are the most common failure modes, imposing trust and effort costs rather than irreversible damage.
感觉编码代理擅长找代码,但不擅长理解项目
讨论了一个观察:编码代理虽能有效定位代码,但难以深入理解项目,比如组件关系和项目风格。作者介绍了 RepoWise,一个提供仓库级信号(如依赖图和Git历史)的工具来解决这些问题。
@teach_fireworks: AI Coding 现在开始进入一个很有意思的阶段。 过去大家讨论最多的是模型能力、上下文长度、Agent Loop、Tool Use、自动化编程,但真正把 Agent 长时间放进真实开发环境之后,很多团队发现问题已经不只是“能不能生成代…
介绍开源工具 re_gent,它为 AI 编程 Agent 提供运行时级别的版本控制和可观测性基础设施,解决 Agent 长时间运行后的代码溯源与审计问题。
大多数编码代理的失败并非因为不会写代码,而是因为一开始就用了错误的地图。
SigMap 是一个针对 AI 编码代理的开源基础层,它提供代码仓库的确定性地图,减少上下文浪费,提高检索准确率和任务成功率。
@FakeMaidenMaker: 用 AI agent 写代码最怕的就是失控:agent 自顾自跑、质量飘忽、你不知道它现在在哪个阶段、改到一半又乱了。 AWS 刚开源了一套专门给 AI coding agent 用的开发生命周期工作流规则——AI-DLC,让 agent…
AWS 开源了 AI-DLC(AI-Driven Development Life Cycle),一套为 AI coding agent 设计的开发生命周期工作流规则,帮助开发者控制 agent 行为,确保质量。支持 Claude Code、Cursor、GitHub Copilot 等多种平台。