对'为什么它会那样做'没有答案——将判断置于模型之外
摘要
本文提出,为解决AI智能体错误缺乏可解释性的问题,应将控制机制移出黑箱模型,通过预定义的检查和日志记录实现有效调试和监督。
对'为什么它会那样做'没有答案——将判断置于模型之外 一个智能体调用了错误的工具,或者用无人提供的数值调用了正确的工具。你只能问一个问题:模型为什么那样做?但没有答案。如果你不知道原因,就不知道该修复什么。所以只剩下一个应对方式:换一个更好的模型。人们真正害怕的,一旦赋予智能体执行能力,并不是它偶尔出错。而是当它出错时,无计可施。这就是为什么我们许多人最终在提示中写入越来越长的规则块。目标相同。但写在提示中的规则由模型读取,而模型决定是否应用它。你将控制规则的执行权交给了你试图控制的东西。所以改变方向。让模型保持为黑箱。将判断移出模型。预先将执行所需的值和条件固定为一个列表。每个槽位只由能够填充的一方填充——工具提供者声明的,只有用户能回答的,系统检查的。如果槽位仍为空,则不执行。因为列表位于模型外部,判断不再是推理,而是计数。计数不会出错。改变的不是准确性,而是你是否能掌控它。什么被检查了,什么没有,都作为列表留存。当出现问题时,你可以指出哪个槽位为空。被阻止的执行也会被记录。如果只记录执行,日志会撒谎。“为什么它会那样做”有答案的原因不是你查看了模型内部。而是检查位于模型外部。没有必要在所有地方应用这一点,也不现实。将其应用于不可撤销的操作。我已经将原因和提出的结构写成了一份文档,并附带了一个骨架实现。我建议先阅读文档。
相似文章
你的代理失败不是因为模型,而是因为没人构建一个停止按钮
文章认为,AI代理在生产中的主要失败点并非模型本身,而是缺乏基础设施,如停止按钮、账单监控以及工具调用的可追溯性。
智能体给出的正确答案不代表它做对了事
本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。
模型能给出正确答案,但代理仍然无法完成任务
文章讨论了在外部系统上的AI代理评估中,模型决策质量与执行完整性之间的差距,提出了对决策正确性和任务成功完成分别计分的方式。
AI代理的失败方式鲜有人论及。以下是我亲眼所见。
文章强调了AI代理工作流程中实际的系统级失败,例如上下文泄漏和幻觉细节,认为这些通常是基础设施问题而非模型缺陷。
如果你的代理在执行自主操作时出错,你能重建其决策原因或仅知道它做了什么吗?
一位开发自主计费代理的开发者讨论了事后重建代理决策原因的困难,并描述构建了一个工具(Attova),该工具记录决策的证据、替代方案和置信度,以改进调试和人工审查。