同一个Agent,同一个提示,不同运行结果。你选择哪个输出上线?
摘要
作者注意到,在不同会话中用同一个Claude Code运行相同任务,会产生不同的决策模式,导致难以选择可以安全上线的输出,并指出目前缺乏评估Agent决策档案的工具。
这周我在几次不同的会话中,通过同一个Claude Code实例运行了相同的任务。不同日期,不同的上下文状态。输出结果有着显著差异。不是对错之分,而是:一次运行采取谨慎、循序渐进的步骤,每次写入前都明确检查文件;另一次运行速度更快,做了假设,生成的代码能用但包含三个未记录的行为。两次都通过了CI。问题不在于某次运行很差,而在于我没有一个原则性的方法来选择该发布哪个。我全凭感觉:选择看起来更谨慎的那次。这不是一个系统化的方法。我们有完善的工具评估输出:测试、lint工具、代码审查。但基本上没有任何工具可以评估Agent用来达成结果的决策模式。两种不同的行为特征,相同的产出形态,除非手动重放会话,否则无法区分。我不是在问评估基准或排行榜分数——那些是整体层面的信号。我指的是每个实例、每次执行的差异:这个特定的Agent实例,在这个特定的代码库上下文中,是否倾向于做出我可以认可的决定?很好奇人们发现了哪些跨越单一会话仍持续的模式。
相似文章
相同模型,相同提示词,4个不同的智能体
探讨了不同的智能体架构如何从相同的底层模型和提示词中产生不同的输出,强调了智能体设计对大型语言模型行为的影响。
相同模型,相同提示词,两个代理框架:45/50 vs 43/50
文章对相同的deepseek-v4-flash模型上的两个开源编码代理进行了基准测试,发现任务成功率相似,但在性能指标上存在显著差异,并且一个代理的错误处理中存在一个关键漏洞。
Agent 运行越久,我就越不在意提示词
作者反思了长期运行的人工智能代理如何遭遇与初始提示无关的失败,并认为环境设计(工具、文档、验证、架构规则)更为重要。他们讨论了诸如 harness 工程、保持 AGENTS.md 文件精简、使用 linter 和评估器代理等概念,同时指出了成本权衡。
你的智能体在做什么?
我们构建了一个开源的回顾性读取器,用于Claude Code,以分析智能体行为,利用真实的执行历史来指导运行时治理。
@dair_ai: If you maintain an AGENTS.md or a CLAUDE.md, this is worth a read. (bookmark it) 288 gold-test evaluated runs across Cl…
This paper presents a controlled ablation study across Claude Code and Codex, 17 real tasks, and 288 runs, finding that context files like AGENTS.md/CLAUDE.md do not measurably improve correctness; agents fail on implementation skill, not missing repository knowledge.