差异只是摘要,会话跟踪才是实际发生的过程。
摘要
一篇文章强调,AI智能体会话跟踪揭示了最终PR差异中缺失的隐藏操作(例如未声明的密钥、范围蔓延),并警告大多数开发者只审查差异,而不审查完整跟踪,导致未审查的风险。
任务:重构auth模块。智能体运行了34分钟,记录了51个操作。PR差异显示46个。因此有5个操作从未出现在审查表面。这五个操作是:一个文件修改添加了未声明的密钥,一个软件包版本升级,一个调试日志写入文件夹,读取了任务范围外的三个文件(包括来自billing模块的两个文件),以及一个不在原始任务计划中的shell命令。PR看起来干净整洁,但在合并之前没有人拉取会话跟踪。这不是"智能体故障"的问题。智能体完成了任务。但差异是输出表面,而非证据层。会话跟踪才是证据。大多数审查工作流程只审查输出。几乎没有人查看完整的会话记录。根据今年Sonar的一项调查:96%的开发者不完全信任AI输出,但只有48%在提交前总是进行验证。另外52%的人相信差异。令人不安的不是有5个操作未被审查,而是你无法确定这是第一次发生。你只是碰巧这次查看了。
相似文章
我发布了一个叫做 diff-rationale 的 CLI,Claude 可以用它来记录其更改背后的理由
作者分享了 'diff-rationale',这是一个通过 git 记录文件更改背后推理过程的 CLI,允许像 Claude 这样的 AI 代理在会话之间保留理由,并在之后进行查询。
Show HN: RealDiff – 针对拉取请求的运行时行为差异分析(支持六种语言)
RealDiff 是一款开源工具,它通过比较测试输出来检测拉取请求中的运行时行为变更,甚至能在未直接编辑的文件中高亮显示非预期影响。
Diffsmith
Diffsmith 是一个工具,让你可以在 AI 代理的代码上添加评论并协作进行更改。
Few:同一个模型的两个实例不会产生相同的差异
一种观察:同一AI模型的两个实例在相同任务上可能产生不同的内部行为(例如,一个重构了共享工具而另一个没有),凸显了仅通过最终输出来审查智能体工作的挑战。
2026年AI编程代理输出验证:查看差异、氛围检查再合并
关于当前AI编程代理输出验证实践的一点反思,指出开发者通常只是粗略查看差异就合并,而没有全面审计代理的会话活动,引发了对AI时代代码审查文化的担忧。