@rohanpaul_ai: 非常重要的工作。模型可能看起来有罪,但实际上,真正的失败往往始于其周围的上下文环境……

X AI KOLs Following 论文

摘要

这项研究发现,AI代理通常失败是由于糟糕的上下文(指令、工具、证据等)而非模型本身,并提出一个跨七个维度的上下文评分系统,该系统与行为分数无关。从模糊的上下文切换到结构化的上下文,在300次测试中显著提高了代理的性能。

非常重要的工作。 模型可能看起来有罪,但实际上,真正的失败往往始于其周围的上下文环境。 通过观察AI代理的环境,我们可以在它完成任务或获得行为评分之前就判断出它何时会崩溃。 研究发现,代理大部分时间失败是因为它们没有良好的指令、工具、证据、记忆或安全规则。 它对这个操作上下文在七个维度上分配分数:角色清晰度、工具描述、事实支持、规则一致性、安全性和令牌使用。 该分数与代理的实际行为分数无关,因此测试不会奖励猜测将要发生什么。 由于从模糊转向结构化,相同的固定模型在300次测试和7500轮互动中表现更好。 更多的事实支持与更少的幻觉相关,更清晰的工具描述与更好的工具使用相关,更强大的护栏与抵抗操纵相关。 添加更多安全规则并没有改善每个任务的结果,因为强化后的代理有时变得过于谨慎,这暴露了一个真正的权衡。 --- – arxiv. org/abs/2607.14275 标题:“AI代理并非独自失败:上下文首先失败”
查看原文
查看缓存全文

缓存时间: 2026/07/20 13:32

非常重要的工作。

模型可能看起来有责任,但真正的失败通常始于其上下文环境。

通过观察AI代理的环境,我们可以在它完成任务或获得行为评分之前,就预判其即将崩溃。

研究发现,代理失败的主要原因在于缺乏清晰的指令、合适的工具、充分的证据、有效的记忆或完善的安全规则。

该研究从七个维度对这一运行上下文进行评分:角色清晰度、工具描述、事实支持、规则一致性、安全性以及令牌使用。

该评分与代理的实际行为评分无关,因此测试不会奖励对结果的猜测。

从模糊到结构化的转变,使得相同的固定模型在300次测试和7500轮交互中表现显著提升。

更多的事实支持与更少的幻觉相关,更清晰的工具描述与更好的工具使用相关,更强的护栏与对操控的抵抗性相关。

增加安全规则并未改善所有任务的结果,因为强化后的代理有时会变得过于谨慎,这揭示了真实的权衡关系。


– arxiv.org/abs/2607.14275

标题:“AI代理不会单独失败:上下文首先崩溃”

相似文章

AI代理最诡异的一点:人类失败模式开始显现

Reddit r/AI_Agents

作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。