标签
本文讨论了在AI系统中,特别是使用大语言模型和智能体时,重试如何可能在根本问题未解决时加剧故障,导致重复错误并增加成本和延迟。
这篇博客文章分析了一次由错误配置的自动扩展策略引起的 GitHub 宕机事件,讨论了云基础设施中自动扩展的挑战,并引用组件替代谬误以强调系统性问题。
解释了为什么无界队列是软件系统中的一个bug,利用利特尔法则和浴缸类比说明队列只能吸收波动,而非持续负载。讨论了延迟死亡螺旋,并主张改用背压机制。
文章讨论了智能体 AI 系统中的常见失败模式,特别是“弱智 AI 循环”,并引用了在 Claude Code 部署中观察到的状态污染和数据泄露等问题。