标签
本文探讨了团队通常单独修复不良AI输出的做法无法扩展。文章主张记录失败情况以识别模式,从而实现系统性改进,而非临时补救。
Anthropic 使用一种方法,多次并行运行同一AI智能体,保留成功的运行,分析失败,并迭代改进流程以提升性能。
Filip Panoski 分享了他七年构建失败的 SaaS 副项目的历程,强调了决定转型、坚持或放弃项目以最终找到成功的重要性。
AutoSaddler是一个自动套件优化框架,通过使用失败信号迭代更新套件,提升LLM智能体在长期任务上的表现,在GAIA2和SWE-Bench等基准测试中实现了显著提升。
这篇文章批评了AI辅导聊天机器人Khanmigo的失败,认为其设计作为‘说教式教学’工具存在根本缺陷,并对比了通过制作和探索进行的有效学习。
这篇文章推荐关注AI Scientist,并讨论研究代理如何通过类比模糊测试来学习失败,从而绘制未知地图并指导后续实验。
ComponentBench 引入了一个基准和诊断管道,用于评估计算机使用代理在现代网页用户界面中的组件级交互,通过关注现实、短暂的交互来诊断跨模型的故障,从而填补当前评估方法的空白。
该立场论文认为,基于LLM的多智能体系统的故障本质上是并发控制问题,并主张将显式并发控制机制作为核心设计关切优先考虑。
作者分析了155个AI智能体任务,发现大多数故障源于基础设施问题,如超时和虚假成功信号,而非模型错误,从而提出了基于效果断言和使用多条验证路径等实践方法。
本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。
并行运行11个研究代理进行数据扫描,将处理时间减半,但暴露了空白简报和API速率限制等失败,强调编排和验证比使用具体工具更为关键。
一位前员工回顾了福报云(阿里云)2023年11月12日的严重故障,并称2026年7月26日菊花云(华为云)的故障规模是其百倍以上,涉及数百万实例被锁停,凸显云厂商在熔断和人工确认机制上的缺失。
一项关于多页视觉丰富文档理解(MP-VRDU)失败的实证归因研究,隔离了表示、选择与推理三种失败模式,并为在固定计算预算下构建此类系统提供了指导。
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
本文提出了一个与模型无关的框架,用于多模态临床AI中的逐模态失败分析,以区分在丢弃某个模态时出现的显性失败与隐性失败。该框架在植入的ground truth上进行了验证,并应用于EchoJEPA和HuBERT-ECG嵌入进行LVEF预测,结果表明丢弃echo后误差几乎翻倍。
本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。
本文强调了AI代理无意中修改或部署真实基础设施这一反复出现的问题,并引发了一场关于应在故障发生前捕捉哪些类型失败的讨论。
作者认为,预训练的LLMs在真实的公司工作中失败,是因为它们缺少一个类似hippocampus的快速学习系统来捕捉具体、分散的工作流程,这与人类大脑的互补学习系统不同。他们提出,将工作片段整合为经过批准、有版本控制的程序,并辅以治理,可能是一个解决方案。
分析 LLM 智能体中情景记忆与程序性记忆之间的差距,引用浙江大学和阿里巴巴的一篇新论文 (Memp),该论文从智能体轨迹中构建程序性记忆,并利用失败信号修正存储的程序。