@mylifcc: Sourcegraph 用 1281 次 agent 运行数据(覆盖 40+ 大型开源仓库)分析后得出结论: Coding agents 在大代码库里失败,往往不是模型不够聪明,而是基础设施没跟上。 最常见的失败模式是 "Lost in …

X AI KOLs Timeline 新闻

摘要

Sourcegraph 基于 1281 次 agent 运行数据发现,大型代码库中 coding agent 失败的主要原因是基础设施不足而非模型能力,典型模式为“迷失在代码库”中,需改进代码检索、导航和上下文工程。

Sourcegraph 用 1281 次 agent 运行数据(覆盖 40+ 大型开源仓库)分析后得出结论: Coding agents 在大代码库里失败,往往不是模型不够聪明,而是基础设施没跟上。 最常见的失败模式是 "Lost in the codebase": Agent 会陷入无尽的跳转和文件读取,却始终无法收敛形成有效计划。当代码库规模超过 ~40 万行,只依赖本地 grep/read 这类基础工具时,这个问题会显著加剧。 其他可重复的失败模式还包括选错文件/符号、只完成部分相关修改等。 文章的核心观点很清晰:单纯依赖模型能力,在大型代码库上很难 scale。更好的代码检索、智能导航和上下文工程,才是更关键的瓶颈。 对正在构建 production-level coding agent 的人来说,这是个值得认真对待的信号。
查看原文
查看缓存全文

缓存时间: 2026/05/24 02:18

Sourcegraph 用 1281 次 agent 运行数据(覆盖 40+ 大型开源仓库)分析后得出结论:

Coding agents 在大代码库里失败,往往不是模型不够聪明,而是基础设施没跟上。

最常见的失败模式是 “Lost in the codebase”:

Agent 会陷入无尽的跳转和文件读取,却始终无法收敛形成有效计划。当代码库规模超过 ~40 万行,只依赖本地 grep/read 这类基础工具时,这个问题会显著加剧。

其他可重复的失败模式还包括选错文件/符号、只完成部分相关修改等。

文章的核心观点很清晰:单纯依赖模型能力,在大型代码库上很难 scale。更好的代码检索、智能导航和上下文工程,才是更关键的瓶颈。

对正在构建 production-level coding agent 的人来说,这是个值得认真对待的信号。

相似文章

@Xudong07452910: 这篇论文很适合所有重度使用 Claude Code、Codex 或者其他AI Agent 的人看。 它研究的不是 Agent 在 benchmark 上怎么失败,而是一个更真实的问题: 在真实开发里,AI coding agent 到底是…

X AI KOLs Timeline

This paper analyzes 20,574 real-world coding-agent sessions to identify how AI agents misalign with developer intent, finding that constraint violations and inaccurate self-reporting are the most common failure modes, imposing trust and effort costs rather than irreversible damage.

感觉编码代理擅长找代码,但不擅长理解项目

Reddit r/AI_Agents

讨论了一个观察:编码代理虽能有效定位代码,但难以深入理解项目,比如组件关系和项目风格。作者介绍了 RepoWise,一个提供仓库级信号(如依赖图和Git历史)的工具来解决这些问题。

@teach_fireworks: AI Coding 现在开始进入一个很有意思的阶段。 过去大家讨论最多的是模型能力、上下文长度、Agent Loop、Tool Use、自动化编程,但真正把 Agent 长时间放进真实开发环境之后,很多团队发现问题已经不只是“能不能生成代…

X AI KOLs Timeline

介绍开源工具 re_gent,它为 AI 编程 Agent 提供运行时级别的版本控制和可观测性基础设施,解决 Agent 长时间运行后的代码溯源与审计问题。

@FakeMaidenMaker: 用 AI agent 写代码最怕的就是失控:agent 自顾自跑、质量飘忽、你不知道它现在在哪个阶段、改到一半又乱了。 AWS 刚开源了一套专门给 AI coding agent 用的开发生命周期工作流规则——AI-DLC,让 agent…

X AI KOLs Timeline

AWS 开源了 AI-DLC(AI-Driven Development Life Cycle),一套为 AI coding agent 设计的开发生命周期工作流规则,帮助开发者控制 agent 行为,确保质量。支持 Claude Code、Cursor、GitHub Copilot 等多种平台。