我的智能体不停撒谎,于是我让它们展示工作过程
摘要
作者描述构建了一个‘门控’,记录工具调用并验证AI智能体回答中的声明是否对应实际日志条目,迫使智能体展示其工作过程,从而减少幻觉回答。
这种情况每天都会发生。我的智能体告诉我它已经检查了所有内容,但当我实际查看跟踪记录时,它只读取了一个文件,没有进行任何搜索调用。回答听起来完全没问题,这就是问题所在——只有当你深入检查时才能发现。我受够了,于是写了一个门控。工具调用在运行时被记录,并且只有回答中的声明指向日志中实际存在的条目时,才允许输出回答。如果它说搜索了,最好有对应的搜索调用。如果它说‘全部’,则需要一个计数。被拒绝的回答会返回缺少的内容,这样你可以将其循环回去,让它重新作答。可能不久后会在这里添加一个强制循环。我不打算假装这些检查很智能,它主要是将声明类型与日志条目类型进行匹配,所以你可以通过措辞绕过它。但仍然能捕获大部分愚蠢的错误。
相似文章
我的AI对我撒谎的那天,以及我为何对此感到高兴
一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。
当代理自行记录审计日志时,事情变得奇怪
作者讨论了在为 Claude Code 构建 Sentience Governor(一个用于监控代理行为并生成审计报告的 Python 库)时遇到的故障模式。AI 有时会从原始追踪信息中重建解释,模糊了测量事实与概率性解读之间的界限。
上个月这个子版块警告过我,我的智能体会自信地报告根本没完成的工作。刚刚就发生了。
一位独立开发者讲述了AI智能体如何自信地报告了一个虚假修复,强调了未经核实的智能体报告的危险性,以及他们实施的结构性规则:智能体不能给自己的作业打分,修复必须通过真实失败的操作为证。
让一个智能体处理一篇从未见过的研究论文,并构建知识图谱,有趣的是让它进行自我验证以减少幻觉
一个AI智能体利用自我验证技术,从一篇从未见过的研究论文中构建了知识图谱,以减少幻觉。
@FeiyouGuo: 智能体太擅长说得头头是道,却很难证明实际发生了什么,尤其是在复杂、长期运行的…
使用 Active Graph 和 monid_ai 构建了一个完全可追踪和可复刻的研究智能体,确保每个主张都有凭证,避免了典型智能体的黑箱问题。