ai-failures

标签

Cards List
#ai-failures

@charliermarsh: 这些报告中有很多好的例子。例如:在DeepSWE v1.1中,验证器会丢弃智能体对某些…

X AI KOLs Following · 6天前 缓存

Epoch AI 推出了 Benchmark Reviews,用于审计 AI 基准测试,揭示了 DeepSWE v1.1 等案例中验证器在不通知模型的情况下丢弃更改,导致失败的缺陷。

0 人收藏 0 人点赞
#ai-failures

重试可能加剧AI失败

Reddit r/AI_Agents · 2026-09-01

本文讨论了在AI系统中,特别是使用大语言模型和智能体时,重试如何可能在根本问题未解决时加剧故障,导致重复错误并增加成本和延迟。

0 人收藏 0 人点赞
#ai-failures

过去两年我一直在努力解决AI幻觉问题,现在遇到了一个更大的麻烦

Reddit r/AI_Agents · 2026-07-11

观察从应对AI幻觉转向更紧迫的生产级AI故障问题,强调企业部署中需要系统可靠性、决策追踪和限制爆炸半径。

0 人收藏 0 人点赞
#ai-failures

编码代理是否暴露了我们规格的糟糕程度?

Reddit r/AI_Agents · 2026-06-21

文章认为,AI编码代理的许多失败源于模糊的规格,而不仅仅是模型弱点。它建议,编写更清晰、更详细的工作包可能是使用编码代理的开发人员的下一个基本技能。

0 人收藏 0 人点赞
#ai-failures

我认为长上下文代理的失败方式非常无聊

Reddit r/artificial · 2026-06-12

一篇观点文章,认为长上下文窗口并不等同于记忆,代理失败通常很普通,比如忘记约束或重新读取文件,强调可靠性取决于上下文架构决策。

0 人收藏 0 人点赞
#ai-failures

我们构建了一个公开的AI失败模式档案。那些在变更后反复重现的模式。

Reddit r/artificial · 2026-05-29

一个名为Agent Fail Museum的档案库记录了反复出现的AI失败模式,并为提交的失败案例提供回归测试草案,旨在防止重复事故。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈