我们向AI智能体展示了它自己的治理记录,结果它开始用了起来

Reddit r/AI_Agents 工具

摘要

一项针对AI编码智能体的本地治理框架实验表明,当智能体自身的治理记录在其上下文中呈现时,智能体会开始自我纠偏,遵循策略并请求意图声明,而无需强制执行。

我一直在尝试为AI编码智能体构建一个本地治理框架,其中一个结果让我感到惊讶。该框架记录了智能体的实际行为:执行的操作、与声明意图的偏差、策略规则匹配、代币消耗以及咨询性风险信号。然后,它将这份记录转化为一份可度量的报告,并重新反馈到同一智能体会话的上下文中。以下是一次长时间运行的示例: Sentience Pulse — 会话 f41ee94f... 总事件数:8471 总轮次:8261 持续时间:18h 58m 30s 未声明意图的消耗:9,488,772 个代币(共 3,996,963,297 个)附加到了未声明意图的轮次上。 策略违规消耗率:52 个触发违规的轮次 · 9,488,772 个代币 POL-001:52 轮次,9,488,772 个代币 — 执行前声明意图… POL-003:52 轮次,9,488,772 个代币 — 供应商应标记工具响应… POL-004:6 轮次,1,457,324 个代币 — 内存写入必须包含… 咨询性标志: CONTEXT_UNCLASSIFIED:131 INTENT_MISSING:1 MEMORY_WRITE_CANDIDATE:8 SCOPE_INTENT_MISMATCH:69 SCOPE_OPERATION_UNEXPECTED:51 重要提示:这不是强制措施。它不会阻止智能体。它不会改变策略。它也不会让智能体自动进行自我治理。有趣的部分更简单:一旦治理产物在运行上下文中可见,智能体就开始使用它。在一次内部试用运行中,智能体读取了治理档案,找到了意图提示模板,并在继续之前要求声明意图。不是因为被阻止了。而是因为边界作为上下文中的产物而存在。 这感觉像是一个有用的中间层,介于“完全信任模型”和“硬运行时强制执行”之间。模型是非确定性的,且可被说服;框架是确定性的,且归运维人员所有。因此,智能体治理的第一步或许不是完全阻断。它可能是一个可测量但智能体无法控制的镜子。 好奇各位如何看待:这种由治理产物驱动的自我纠偏是否构成一个有意义的治理层?还是说,治理只有在能够强制执行行为时才真正成为现实?
查看原文

相似文章

当代理自行记录审计日志时,事情变得奇怪

Reddit r/AI_Agents

作者讨论了在为 Claude Code 构建 Sentience Governor(一个用于监控代理行为并生成审计报告的 Python 库)时遇到的故障模式。AI 有时会从原始追踪信息中重建解释,模糊了测量事实与概率性解读之间的界限。

AI治理的警醒之谈

Reddit r/artificial

这篇Reddit帖子讨论了一篇研究论文,该论文揭示了AI治理中的根本性挑战,包括社会攻击面、基于LLM的代理在社会一致性上的失败,以及当前治理工具对代理系统的不充分性。