用于编程代理的基于证据的治理工具——期待试用与建设性反馈

Reddit r/AI_Agents 工具

摘要

MARGINAL 是一个面向编程代理的开源治理层,通过监控代理轨迹来预防低效操作,并配备影子模式与赢得执行功能以增强可靠性。

我一直在开发 MARGINAL,一个面向编程代理的开源治理层。如果您使用 Codex 或其他编程代理,非常欢迎您在实际工作中试用它,并告诉我它在哪些方面有帮助、哪些方面造成阻碍,或者设计上的错误。我特别关注:技术批评、不良案例和可复现的失败。 这个想法很简单:代理擅长执行操作,但并不总是能判断下一个操作是否还值得计算资源。MARGINAL 监控轨迹,寻找诸如重复操作、进展薄弱、冗余验证和低价值延续等问题。它可以先以 Shadow Mode 运行,这样它就能观察并记录它本会执行的操作,而不阻塞任何操作。 当前的重点是可靠性,而不仅仅是令牌减少。几个核心部分:本地优先的轨迹和证据追踪、决策的确定性原因代码和哈希、治理开销测量、重放和基准测试支持、强制执行前的 Shadow Mode。赢得执行:MARGINAL 必须在仓库上证明其可靠性后,才能获得阻止或重定向代理的权限。如果置信度下降,自动回退到 Shadow Mode。 我目前正在开发下一层:反事实评估和干预遗憾。目标是回答一个比“MARGINAL 是否阻止了某些操作?”更难的问题:如果 MARGINAL 不干预,代理实际上是否能做得更好?我认为这才是使其超越另一个循环检测器或令牌限制器的关键部分。
查看原文

相似文章

AgentBound: 自主AI智能体的可验证行为治理

arXiv cs.AI

AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。

你的智能体在做什么?

Reddit r/AI_Agents

我们构建了一个开源的回顾性读取器,用于Claude Code,以分析智能体行为,利用真实的执行历史来指导运行时治理。