对'为什么它会那样做'没有答案——将判断置于模型之外

Reddit r/AI_Agents 论文

摘要

本文提出,为解决AI智能体错误缺乏可解释性的问题,应将控制机制移出黑箱模型,通过预定义的检查和日志记录实现有效调试和监督。

对'为什么它会那样做'没有答案——将判断置于模型之外 一个智能体调用了错误的工具,或者用无人提供的数值调用了正确的工具。你只能问一个问题:模型为什么那样做?但没有答案。如果你不知道原因,就不知道该修复什么。所以只剩下一个应对方式:换一个更好的模型。人们真正害怕的,一旦赋予智能体执行能力,并不是它偶尔出错。而是当它出错时,无计可施。这就是为什么我们许多人最终在提示中写入越来越长的规则块。目标相同。但写在提示中的规则由模型读取,而模型决定是否应用它。你将控制规则的执行权交给了你试图控制的东西。所以改变方向。让模型保持为黑箱。将判断移出模型。预先将执行所需的值和条件固定为一个列表。每个槽位只由能够填充的一方填充——工具提供者声明的,只有用户能回答的,系统检查的。如果槽位仍为空,则不执行。因为列表位于模型外部,判断不再是推理,而是计数。计数不会出错。改变的不是准确性,而是你是否能掌控它。什么被检查了,什么没有,都作为列表留存。当出现问题时,你可以指出哪个槽位为空。被阻止的执行也会被记录。如果只记录执行,日志会撒谎。“为什么它会那样做”有答案的原因不是你查看了模型内部。而是检查位于模型外部。没有必要在所有地方应用这一点,也不现实。将其应用于不可撤销的操作。我已经将原因和提出的结构写成了一份文档,并附带了一个骨架实现。我建议先阅读文档。
查看原文

相似文章

智能体给出的正确答案不代表它做对了事

Reddit r/AI_Agents

本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。