failure-analysis

标签

Cards List
#failure-analysis

逐一审查单个AI输出无法扩展。审查失败模式才行,但几乎没人做后者。

Reddit r/artificial · 4天前

本文探讨了团队通常单独修复不良AI输出的做法无法扩展。文章主张记录失败情况以识别模式,从而实现系统性改进,而非临时补救。

0 人收藏 0 人点赞
#failure-analysis

@0xNixxx: Anthropic 同时运行同一智能体10次以获得3个有效结果 运行10次 → 保留3次 → 分析7次失败 → 修复测试框架 → 再次运行 - …

X AI KOLs Timeline · 5天前 缓存

Anthropic 使用一种方法,多次并行运行同一AI智能体,保留成功的运行,分析失败,并迭代改进流程以提升性能。

0 人收藏 0 人点赞
#failure-analysis

@FilipPanoski: SaaS 最难的部分:意识到没人想要你构建的东西。然后做出决定:→ 转型 → 坚持 → 放弃

X AI KOLs Following · 6天前 缓存

Filip Panoski 分享了他七年构建失败的 SaaS 副项目的历程,强调了决定转型、坚持或放弃项目以最终找到成功的重要性。

0 人收藏 0 人点赞
#failure-analysis

AutoSaddler:基于智能体执行轨迹的持久化更新自动套件优化

Hugging Face Daily Papers · 2026-08-24 缓存

AutoSaddler是一个自动套件优化框架,通过使用失败信号迭代更新套件,提升LLM智能体在长期任务上的表现,在GAIA2和SWE-Bench等基准测试中实现了显著提升。

0 人收藏 0 人点赞
#failure-analysis

Sal Khan的AI教育工具为何失败:论通过实践学习与通过讲授教学的对比

Hacker News Top · 2026-08-23 缓存

这篇文章批评了AI辅导聊天机器人Khanmigo的失败,认为其设计作为‘说教式教学’工具存在根本缺陷,并对比了通过制作和探索进行的有效学习。

0 人收藏 0 人点赞
#failure-analysis

复杂系统如何失效

Hacker News Top · 2026-08-23 缓存

本文讨论了复杂系统失效的基本原理,强调失效是固有的,而灾难需要多个同时失效的事件发生。

0 人收藏 0 人点赞
#failure-analysis

@Xudong07452910: 如果你最近在关注 AI Scientist,我很推荐这篇文章。 现在很多 Research Agent 还是先生成大量实验和假设,再让 Judge 选最好的。 做研究往往是一次失败以后,能不能知道自己哪里理解错了,还有哪些地方没探索过。 …

X AI KOLs Timeline · 2026-08-20 缓存

这篇文章推荐关注AI Scientist,并讨论研究代理如何通过类比模糊测试来学习失败,从而绘制未知地图并指导后续实验。

0 人收藏 0 人点赞
#failure-analysis

ComponentBench: 诊断计算机使用代理中的组件级故障

arXiv cs.AI · 2026-08-20 缓存

ComponentBench 引入了一个基准和诊断管道,用于评估计算机使用代理在现代网页用户界面中的组件级交互,通过关注现实、短暂的交互来诊断跨模型的故障,从而填补当前评估方法的空白。

0 人收藏 0 人点赞
#failure-analysis

立场:多智能体系统应优先考虑并发控制

arXiv cs.AI · 2026-08-20 缓存

该立场论文认为,基于LLM的多智能体系统的故障本质上是并发控制问题,并主张将显式并发控制机制作为核心设计关切优先考虑。

0 人收藏 0 人点赞
#failure-analysis

让我损失最惨重的智能体故障全都声称成功

Reddit r/AI_Agents · 2026-08-18

作者分析了155个AI智能体任务,发现大多数故障源于基础设施问题,如超时和虚假成功信号,而非模型错误,从而提出了基于效果断言和使用多条验证路径等实践方法。

0 人收藏 0 人点赞
#failure-analysis

智能体在AutoResearch上的失败分析:基于100个真实前沿研究任务的端到端诊断评估

arXiv cs.CL · 2026-08-18 缓存

本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。

0 人收藏 0 人点赞
#failure-analysis

我并行运行了11个研究代理一天。诚实记录,包括那两个什么都没做的。

Reddit r/AI_Agents · 2026-08-15

并行运行11个研究代理进行数据扫描,将处理时间减半,但暴露了空白简报和API速率限制等失败,强调编排和验证比使用具体工具更为关键。

0 人收藏 0 人点赞
#failure-analysis

@plantegg: 我现在离职很久了,可以谈谈这个故障,2023年11月12号的这个故障差不多是福报云历史上最严重的故障吧(故障的直接人是我当年面试招的,后来我特意当面找他复盘了一次,所以我很了解哦) 这个故障乘以10倍都不够2026年07月26号菊花云的故…

X AI KOLs Timeline · 2026-08-13 缓存

一位前员工回顾了福报云(阿里云)2023年11月12日的严重故障,并称2026年7月26日菊花云(华为云)的故障规模是其百倍以上,涉及数百万实例被锁停,凸显云厂商在熔断和人工确认机制上的缺失。

0 人收藏 0 人点赞
#failure-analysis

多页视觉丰富文档理解中的故障定位:一项实证归因研究

arXiv cs.AI · 2026-08-11 缓存

一项关于多页视觉丰富文档理解(MP-VRDU)失败的实证归因研究,隔离了表示、选择与推理三种失败模式,并为在固定计算预算下构建此类系统提供了指导。

0 人收藏 0 人点赞
#failure-analysis

SearchAuditor:长时程搜索智能体故障的审计与归因

arXiv cs.AI · 2026-08-07 缓存

本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。

0 人收藏 0 人点赞
#failure-analysis

显性还是隐性?多模态临床AI中逐模态失败分析的可复用框架

Hugging Face Daily Papers · 2026-08-02 缓存

本文提出了一个与模型无关的框架,用于多模态临床AI中的逐模态失败分析,以区分在丢弃某个模态时出现的显性失败与隐性失败。该框架在植入的ground truth上进行了验证,并应用于EchoJEPA和HuBERT-ECG嵌入进行LVEF预测,结果表明丢弃echo后误差几乎翻倍。

0 人收藏 0 人点赞
#failure-analysis

分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害

arXiv cs.LG · 2026-07-31 缓存

本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。

0 人收藏 0 人点赞
#failure-analysis

我们不断看到AI代理意外地修改或部署真实基础设施——你希望在实际故障发生前捕捉到哪种具体失败?

Reddit r/AI_Agents · 2026-07-24

本文强调了AI代理无意中修改或部署真实基础设施这一反复出现的问题,并引发了一场关于应在故障发生前捕捉哪些类型失败的讨论。

0 人收藏 0 人点赞
#failure-analysis

预训练的LLMs是一个没有‘hippocampus’的‘cortex’,我认为这就是它们在真实的公司工作中失败的原因。

Reddit r/artificial · 2026-07-22

作者认为,预训练的LLMs在真实的公司工作中失败,是因为它们缺少一个类似hippocampus的快速学习系统来捕捉具体、分散的工作流程,这与人类大脑的互补学习系统不同。他们提出,将工作片段整合为经过批准、有版本控制的程序,并辅以治理,可能是一个解决方案。

0 人收藏 0 人点赞
#failure-analysis

你的智能体什么都记得,唯独忘了怎么干活

Reddit r/AI_Agents · 2026-07-21

分析 LLM 智能体中情景记忆与程序性记忆之间的差距,引用浙江大学和阿里巴巴的一篇新论文 (Memp),该论文从智能体轨迹中构建程序性记忆,并利用失败信号修正存储的程序。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈