当你的代理在没有人类参与的情况下打开一个 PR 或花费资金时,谁来负责?我为这个问题构建了一个检查器。
摘要
AgenRACI 是一个基于 YAML 的章程检查器,通过定义每个操作类型的角色、权限、审批和升级规则来规范化代理的问责机制,可通过 CI 或预提交钩子进行验证。
我使用代理进行构建,而一直困扰我的问题与模型质量无关:当代理自主行动时——打开一个 PR、给客户发邮件、转移资金——通常没有书面记录来说明谁应该负责、它被允许接触什么、或者当两个角色意见不一致时谁说了算。这些信息散落在代码、零散的配置和人们的头脑中。AgenRACI 是我尝试让这一切变得明确且可检查的方案。你编写一个 YAML 文件(一份“章程”),针对每\*种\*操作类型,声明:谁执行操作、唯一的负责人、谁需要被咨询/通知、涉及哪些权限、需要什么审批、以及当审批人始终不响应时该怎么做(超时 + 紧急绕过)。然后一个检查器会验证该文件的一致性,并以非零退出码退出,从而可以作为 CI 门禁或预提交钩子运行。它能发现的问题包括:没有负责人的操作、两个角色都声称负责、你授予了但从未使用的权限、没有超时设置的审批路径(静默死锁)、或者无限循环的升级链。坦诚地说一下范围:它\*\*编写并检查\*\*章程——它不会在运行时拦截工具调用或强制执行审批。LangGraph/CrewAI 负责运行代理;HumanLayer 添加人工审批步骤。这是位于它们之上的框架无关层,用于声明规则,这样你的问责映射在切换运行环境时仍然有效。有一个浏览器游乐场(通过 Pyodide 运行真实的检查器,无需安装),以及实际示例(包括一个全代理、零人类团队),并且该仓库使用章程自我管理其开发。我很想听听这个模型在你的设置中有什么不适用之处,尤其是在多代理团队中。
相似文章
Karpathy 称这是智能体的十年。行吧。那总得有人来构建那个枯燥的部分:对智能体说“不”的那一层。
GraphARC 是一个开源的受治理智能体运行时,使用确定性检查器在执行前批准或拒绝提议的智能体图操作,提供审计追踪和成本跟踪。它演示了如何使用结构化拒绝来引导智能体远离被禁止的操作。
我构建了一个AI代理的问责层——在行动前约束其能力,在行动后证明其行为
Cinchor是一个开源工具,为AI代理提供问责层,允许开发者通过哈希、签名、仅追加记录在行动前约束代理能力,并在行动后证明行为。它包含TypeScript、Python和Go的SDK,无需代币、钱包或Gas即可运行。
要真正实现A2A,你的智能体行为由你负责。
本文认为,在多智能体社交应用中,用户应为其智能体的行为负责,将责任从开发者转移到用户,以确保对齐和实践测试。
Prime Agent:一个自我改进的RLM智能体
Prime Intellect 推出 Prime Agent,这是一个完全开源、自我改进的编码工具(harness),围绕递归语言模型(RLM)和 Continual Harness 抽象构建,通过基于 REPL 的接口实现持久子智能体和动态工具。
你们如何处理AI代理做出的承诺?我经常遇到这个问题
作者描述了一个问题:AI代理做出承诺但未跟踪履约情况,提出了一个使用状态机的问责层,并向他人征求生产环境的解决方案建议。