我开源了一个 AI 智能体的执行记录工具(意图与现实)
摘要
作者宣布开源 Sentience Governor,一个面向 AI 智能体的开源治理运行时,它将声明的意图、记录的执行和事后的解释分离开来,并通过 MCP 将观察到的工具活动与声明的范围进行核对。
智能体系统有一件事让我困扰:在长时间运行之后,我们经常让智能体自己描述发生了什么。那个答案可能不错。但智能体的解释和执行记录并不是一回事。这促使我构建了 Sentience Governor,一个面向 AI 智能体的开源治理运行时。我是用 Claude Code 构建的。核心思想是分离:1. 声明的意图——智能体说它计划做什么 2. 记录的执行——实际观察到的工具活动 3. 事后的解释——智能体后来声称它做了什么
Sentience 记录可观察到的工具活动,并将其与执行前声明的目标和范围进行核对。通过 MCP,智能体也可以查询该记录,而不是完全依赖上下文中残留的信息。声明本身并不自动可信——智能体仍可能声明过于宽泛或根本错误的内容。我关心的区别是:智能体的解释不是证据。记录的执行轨迹才是。
目前 Sentience 只观察和报告,尚不阻止任何操作。这正是我现在正在思考的部分:你真的会信任治理层去阻止哪些操作?超出声明范围的工具调用?破坏性操作?智能体未声明意图就开始工作?还是治理层应该保持建议性?
如果你正在构建智能体或智能体基础设施,我特别想听听你认为这个模型会在哪里失效。我会把开源仓库链接放在评论中,供想尝试或查看实现的人使用。
相似文章
我开源了用于让AI代理保持在正轨上的指令。
这个开源工具为编码代理提供了一个可移植且与代理无关的控制平面,通过一组可放入任何代码仓库的文件,提供一致的操作规则、分阶段项目规划、记忆、技能和运行手册。
我们向AI智能体展示了它自己的治理记录,结果它开始用了起来
一项针对AI编码智能体的本地治理框架实验表明,当智能体自身的治理记录在其上下文中呈现时,智能体会开始自我纠偏,遵循策略并请求意图声明,而无需强制执行。
我开源了AI代理的“适配层”:使用受管控的MCP工具(浏览器、编辑器、密钥管理器)运行Claude Code/Codex/Gemini
开源了一个桌面工作空间,为AI编码代理提供受管控的运行时环境,包含100多个MCP工具、RBAC权限控制以及一个可自我演化的工具箱。
当代理自行记录审计日志时,事情变得奇怪
作者讨论了在为 Claude Code 构建 Sentience Governor(一个用于监控代理行为并生成审计报告的 Python 库)时遇到的故障模式。AI 有时会从原始追踪信息中重建解释,模糊了测量事实与概率性解读之间的界限。
我把我的AI代理治理平台上线了。来试试攻破它。
作者发布了Bendex Arc,一个面向AI代理的开源治理层,用于强制权限、阻止操控,并包含一个用于测试的实时演示。