failure-analysis

标签

Cards List
#failure-analysis

AgentDebugX:用于LLM Agent故障可观测性、归因和恢复的开源工具包

Hugging Face Daily Papers · 2026-07-21 缓存

AgentDebugX 是一个面向 LLM Agent 的开源调试框架,将故障调试组织为检测、归因、恢复和重试的闭环。其核心组件 DeepDebug 在基准测试中实现了强大的归因准确性和修复能力。

0 人收藏 0 人点赞
#failure-analysis

一个基于薄弱运行事实构建的高能力智能体在生产中仍然失败。

Reddit r/AI_Agents · 2026-07-09

讨论了即使是一个高能力AI智能体,如果其底层运行事实薄弱,也可能在生产中失败,这凸显了实际部署中的挑战。

0 人收藏 0 人点赞
#failure-analysis

超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析

arXiv cs.AI · 2026-07-08 缓存

本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。

0 人收藏 0 人点赞
#failure-analysis

我对我们自主研究代理发布的32项已发布“发现”进行了审计。按表述来看,没有一项是新颖的——标签失效的程度远超过测量本身。

Reddit r/AI_Agents · 2026-07-05

一位审计员发现,自主研究代理发布的32项“发现”中,按表述没有一项是新颖的,主要问题在于过度贴标签而非测量错误。

0 人收藏 0 人点赞
#failure-analysis

诊断是生产代理中缺失的技能

Reddit r/AI_Agents · 2026-07-03

文章认为,诊断——用操作术语解释代理为何失败以及接下来安全做什么——是生产代理栈中缺失的一等技能,比让代理听起来聪明更重要。

0 人收藏 0 人点赞
#failure-analysis

本季度构建了6个AI代理。模型从未成为瓶颈,真正持续导致失败的是其他问题。

Reddit r/AI_Agents · 2026-06-25

构建6个AI代理的经验表明,模型性能并非瓶颈;相反,其他实际问题持续导致失败。

0 人收藏 0 人点赞
#failure-analysis

@DataScienceDojo:大多数AI代理一遍又一遍地在相同任务上失败。不是因为模型不好,而是因为没人告诉它该如何工作……

X AI KOLs Timeline · 2026-06-25 缓存

一篇新论文介绍了Self-Harness,一种让AI代理通过分析自身失败、生成修复方案并测试它们来自我改进的方法,从而将通过率提高了最多21个百分点。

0 人收藏 0 人点赞
#failure-analysis

全息记忆用于知识图谱中的零样本组合推理:失败位置与原因的机制研究

arXiv cs.LG · 2026-06-25 缓存

本文研究了全息约简表示在知识图谱中零样本组合推理的应用,发现虽然单跳性能强劲,但组合推理仍因叠加记忆中的检索容量和干扰效应而失败,而非绑定-解绑代数的问题。

0 人收藏 0 人点赞
#failure-analysis

@ItsRoboki: /loop 和 /goal 并不验证你的工作。它们只会放大你给予它们的验证。真正的问题在于:智能体……

X AI KOLs Timeline · 2026-06-24 缓存

对 AI 智能体循环持续运行而不进行推理的批评,建议智能体应定期暂停,分析失败原因并提出理论后再重试。

0 人收藏 0 人点赞
#failure-analysis

FailureScope:跨场景语言模型弱点的行为诊断方法

arXiv cs.LG · 2026-06-10 缓存

FailureScope是一种行为诊断方法,通过跨模型的通过/失败模式对评估探针进行聚类,生成可解释的失败分类体系,并在单轮基准测试、多轮对话和对抗性智能体攻击中得到了验证。

0 人收藏 0 人点赞
#failure-analysis

指令层级失效之处:诊断与修复推理语言模型中的故障

arXiv cs.AI · 2026-06-09 缓存

本文引入了一个白盒诊断框架,将推理语言模型中的指令层级故障定位为识别、冲突解决和响应实现三个阶段。该框架评估了多个模型,并提出了两种无需训练的自我监控机制,可将违规率降低81%–99%。

0 人收藏 0 人点赞
#failure-analysis

连续六周每日使用开源桌面Agent Shell的三模型拆分(Haiku三分类器 → Sonnet审查器 → Opus执行器)的真实成本数据与故障记录。

Reddit r/AI_Agents · 2026-06-05

一项为期六周的真实世界实验,使用开源桌面Agent Shell的三模型拆分(Haiku三分类器、Sonnet审查器、Opus执行器),报告了64%的成本降低,并详细描述了诸如上下文膨胀和子Agent失控等故障模式。

0 人收藏 0 人点赞
#failure-analysis

GTBench:一个基于课程体系的图论数学研究助手大语言模型评估基准

arXiv cs.AI · 2026-06-03 缓存

论文介绍了GTBench,这是一个基于课程体系的基准,用于评估大语言模型在图论中作为数学研究助手的能力,包含63个问题,分为三个难度级别。它评估了五个前沿模型,发现性能随难度增加而下降,其中GPT-5在基础问题上近乎完美,但在研究生级别的证明上仅达到82%。

0 人收藏 0 人点赞
#failure-analysis

@SoHarshhh: 非常高兴地分享,“ToolFailBench” 已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。大多数基准测试…

X AI KOLs Following · 2026-06-01 缓存

ToolFailBench,一个用于评估工具使用型代理的诊断基准,已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。

0 人收藏 0 人点赞
#failure-analysis

BenchTrace:用于测试LLM智能体反思能力与受控演进的基准

arXiv cs.AI · 2026-05-29 缓存

BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。

0 人收藏 0 人点赞
#failure-analysis

Insights Generator:面向 LLM 智能体的系统性语料级轨迹诊断

arXiv cs.AI · 2026-05-22 缓存

本文介绍了 Insights Generator,一个用于 LLM 智能体系统性语料级轨迹诊断的多智能体系统。它通过在执行轨迹中提出并测试假设,生成有证据支撑的洞察。实验表明,使用 Insights Generator 报告可使脚手架性能提升 30.4 个百分点。

0 人收藏 0 人点赞
#failure-analysis

LinAlg-Bench:揭示大语言模型数学推理中结构性失败模式的诊断性基准

arXiv cs.AI · 2026-05-19 缓存

介绍了LinAlg-Bench,这是一个诊断性基准,用于评估10个前沿大语言模型在矩阵维度上的结构化线性代数计算,揭示了大语言模型的数学失败在结构上受到约束,并在4x4规模下从执行错误过渡到计算放弃。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈