我们向AI智能体展示了它自己的治理记录,结果它开始用了起来
摘要
一项针对AI编码智能体的本地治理框架实验表明,当智能体自身的治理记录在其上下文中呈现时,智能体会开始自我纠偏,遵循策略并请求意图声明,而无需强制执行。
我一直在尝试为AI编码智能体构建一个本地治理框架,其中一个结果让我感到惊讶。该框架记录了智能体的实际行为:执行的操作、与声明意图的偏差、策略规则匹配、代币消耗以及咨询性风险信号。然后,它将这份记录转化为一份可度量的报告,并重新反馈到同一智能体会话的上下文中。以下是一次长时间运行的示例:
Sentience Pulse — 会话 f41ee94f...
总事件数:8471
总轮次:8261
持续时间:18h 58m 30s
未声明意图的消耗:9,488,772 个代币(共 3,996,963,297 个)附加到了未声明意图的轮次上。
策略违规消耗率:52 个触发违规的轮次 · 9,488,772 个代币
POL-001:52 轮次,9,488,772 个代币 — 执行前声明意图…
POL-003:52 轮次,9,488,772 个代币 — 供应商应标记工具响应…
POL-004:6 轮次,1,457,324 个代币 — 内存写入必须包含…
咨询性标志:
CONTEXT_UNCLASSIFIED:131
INTENT_MISSING:1
MEMORY_WRITE_CANDIDATE:8
SCOPE_INTENT_MISMATCH:69
SCOPE_OPERATION_UNEXPECTED:51
重要提示:这不是强制措施。它不会阻止智能体。它不会改变策略。它也不会让智能体自动进行自我治理。有趣的部分更简单:一旦治理产物在运行上下文中可见,智能体就开始使用它。在一次内部试用运行中,智能体读取了治理档案,找到了意图提示模板,并在继续之前要求声明意图。不是因为被阻止了。而是因为边界作为上下文中的产物而存在。
这感觉像是一个有用的中间层,介于“完全信任模型”和“硬运行时强制执行”之间。模型是非确定性的,且可被说服;框架是确定性的,且归运维人员所有。因此,智能体治理的第一步或许不是完全阻断。它可能是一个可测量但智能体无法控制的镜子。
好奇各位如何看待:这种由治理产物驱动的自我纠偏是否构成一个有意义的治理层?还是说,治理只有在能够强制执行行为时才真正成为现实?
相似文章
我开源了一个 AI 智能体的执行记录工具(意图与现实)
作者宣布开源 Sentience Governor,一个面向 AI 智能体的开源治理运行时,它将声明的意图、记录的执行和事后的解释分离开来,并通过 MCP 将观察到的工具活动与声明的范围进行核对。
真的有人在执行AI治理,还是仅仅在制定政策?
文章讨论了书面AI治理政策与实际在运行时AI代理工作流中执行这些规则之间的差距。
当代理自行记录审计日志时,事情变得奇怪
作者讨论了在为 Claude Code 构建 Sentience Governor(一个用于监控代理行为并生成审计报告的 Python 库)时遇到的故障模式。AI 有时会从原始追踪信息中重建解释,模糊了测量事实与概率性解读之间的界限。
治理行动,而非智能体:将机构认证作为自主AI系统的治理模型
本文提出了一种基于机构认证的自主AI智能体治理模型,其中行动通过独立认证的证据进行治理,而非监控智能体推理。该模型通过概念验证实现进行了形式化,适用于临床处方和软件部署等高风险行动。
AI治理的警醒之谈
这篇Reddit帖子讨论了一篇研究论文,该论文揭示了AI治理中的根本性挑战,包括社会攻击面、基于LLM的代理在社会一致性上的失败,以及当前治理工具对代理系统的不充分性。