failure-detection

标签

Cards List
#failure-detection

明晰的失败:检测和修复上下文绑定错误

arXiv cs.LG · 3天前 缓存

本文介绍了语言模型中的'明晰的失败',即模型在隐藏状态中拥有正确信息但未能使用,并表明线性探针可以通过引导干预检测和修复此类失败。

0 人收藏 0 人点赞
#failure-detection

Agnost AI

Product Hunt · 2026-08-23

Agnost AI 是一个旨在发现AI代理评估中传统方法可能遗漏的失败的产品。

0 人收藏 0 人点赞
#failure-detection

从序列到结构:LLM智能体的关系不确定性传播

Hugging Face Daily Papers · 2026-08-17 缓存

本文提出RUPA,一个框架,将LLM智能体的执行建模为依赖图以传播不确定性,改进长轨迹中的故障检测和置信度估计。

0 人收藏 0 人点赞
#failure-detection

“错误消失了”和“任务完成了”对智能体来说是两件不同的事,而默认只会检查其中一件

Reddit r/AI_Agents · 2026-08-13

关于AI智能体经常将“错误清除”与“任务真正解决”混为一谈的反思,以及需要一种结构上不同的第二验证步骤来捕获被掩盖的失败。

0 人收藏 0 人点赞
#failure-detection

通过内部激活的频谱分析检测神经网络故障

arXiv cs.LG · 2026-07-24 缓存

本文识别了神经网络在错误分类期间内部激活中的频谱漂移,并引入了自检测神经网络(SDNN),通过监控频谱动态来检测故障,在CIFAR-10上实现了79%的AUROC,比基于置信度的方法高出25-30个百分点。

0 人收藏 0 人点赞
#failure-detection

面向移动核心网业务影响故障检测的自适应两阶段在线学习

arXiv cs.LG · 2026-07-22 缓存

本文提出一种两阶段在线学习框架,通过对正常流量动态进行建模并分析残差,检测移动核心网中影响业务的故障,相比静态阈值取得了更优的精确率-召回率权衡。

0 人收藏 0 人点赞
#failure-detection

为什么你的智能体“成功”了,三天后却发现其实没有

Reddit r/AI_Agents · 2026-07-13

探讨AI智能体在任务中看似成功,但后来暴露失败的现象,突出了智能体评估与监控中的挑战。

0 人收藏 0 人点赞
#failure-detection

从一开始就注定失败:通过召回控制探针级联提前终止LLM代理任务轮次

arXiv cs.AI · 2026-07-08 缓存

本文提出了一种召回控制的中止级联方法,通过在LLM代理的内部表示上使用轻量级探针,早期检测并中止注定失败的任务轮次,在保持高召回率成功轮次的同时,最多可节省47%的推理计算量。

0 人收藏 0 人点赞
#failure-detection

Foresight: 长时域机器人操作中基于动作条件的世界模型潜在表示的故障检测

Hugging Face Daily Papers · 2026-06-22 缓存

Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。

0 人收藏 0 人点赞
#failure-detection

我问大家如何处理智能体记忆。以下是回复中的模式,以及无人真正解决的一个问题。

Reddit r/AI_Agents · 2026-06-09

关于智能体记忆的社区讨论显示,尽管在记录什么(如纯文本文件、分层记忆、事后总结)方面存在各种补丁方案,但未解决的问题是保留什么——检测失败是可处理的,但决定哪些教训应持续保留仍需要人类判断。

0 人收藏 0 人点赞
#failure-detection

语言模型如何失败:承诺性与持续性推理失败的词元级特征

arXiv cs.CL · 2026-06-08 缓存

本文通过词元级不确定性信号,刻画了语言模型在推理中失败的两种不同过程——承诺性失败与持续性不确定性,并展示了其对自一致性及失败检测策略的启示。

0 人收藏 0 人点赞
#failure-detection

AEGIS:物理AI的备份反射

arXiv cs.AI · 2026-06-08 缓存

AEGIS 使用激活探针早期预警,在长时域机器人操作中故障累积之前切换到更强的策略,恢复的故障次数是预算匹配升级策略的两倍。

0 人收藏 0 人点赞
#failure-detection

轨迹中的Hide-and-Seek:发现VLA运行时监控的故障信号

Hugging Face Daily Papers · 2026-05-29 缓存

Hide-and-Seek是一个通过对比学习定位故障指示动作来检测VLA模型中机器人执行故障的框架,无需步骤级标注,实现了最先进的多任务故障检测性能。

0 人收藏 0 人点赞
#failure-detection

迷失在折叠中:交叉验证并非不确定性估计的深度集成

Hugging Face Daily Papers · 2026-05-18 缓存

本文比较了交叉验证集成与深度集成在医学图像分割中的不确定性估计。深度集成在校准和故障检测方面优于交叉验证集成,而交叉验证集成能更好地近似评估者间变异性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈