标签
Epoch AI 推出了 Benchmark Reviews,用于审计 AI 基准测试,揭示了 DeepSWE v1.1 等案例中验证器在不通知模型的情况下丢弃更改,导致失败的缺陷。
观察从应对AI幻觉转向更紧迫的生产级AI故障问题,强调企业部署中需要系统可靠性、决策追踪和限制爆炸半径。
文章认为,AI编码代理的许多失败源于模糊的规格,而不仅仅是模型弱点。它建议,编写更清晰、更详细的工作包可能是使用编码代理的开发人员的下一个基本技能。
一篇观点文章,认为长上下文窗口并不等同于记忆,代理失败通常很普通,比如忘记约束或重新读取文件,强调可靠性取决于上下文架构决策。
一个名为Agent Fail Museum的档案库记录了反复出现的AI失败模式,并为提交的失败案例提供回归测试草案,旨在防止重复事故。