用于编程代理的基于证据的治理工具——期待试用与建设性反馈
摘要
MARGINAL 是一个面向编程代理的开源治理层,通过监控代理轨迹来预防低效操作,并配备影子模式与赢得执行功能以增强可靠性。
我一直在开发 MARGINAL,一个面向编程代理的开源治理层。如果您使用 Codex 或其他编程代理,非常欢迎您在实际工作中试用它,并告诉我它在哪些方面有帮助、哪些方面造成阻碍,或者设计上的错误。我特别关注:技术批评、不良案例和可复现的失败。
这个想法很简单:代理擅长执行操作,但并不总是能判断下一个操作是否还值得计算资源。MARGINAL 监控轨迹,寻找诸如重复操作、进展薄弱、冗余验证和低价值延续等问题。它可以先以 Shadow Mode 运行,这样它就能观察并记录它本会执行的操作,而不阻塞任何操作。
当前的重点是可靠性,而不仅仅是令牌减少。几个核心部分:本地优先的轨迹和证据追踪、决策的确定性原因代码和哈希、治理开销测量、重放和基准测试支持、强制执行前的 Shadow Mode。赢得执行:MARGINAL 必须在仓库上证明其可靠性后,才能获得阻止或重定向代理的权限。如果置信度下降,自动回退到 Shadow Mode。
我目前正在开发下一层:反事实评估和干预遗憾。目标是回答一个比“MARGINAL 是否阻止了某些操作?”更难的问题:如果 MARGINAL 不干预,代理实际上是否能做得更好?我认为这才是使其超越另一个循环检测器或令牌限制器的关键部分。
相似文章
AgentBound: 自主AI智能体的可验证行为治理
AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。
Agentao:面向工具使用LLM代理的受控本地优先运行时
Agentao 介绍了一种用于使用工具的LLM代理的受控本地优先运行时,通过将模型生成的操作与主机授权的执行分离,以提高安全性和治理性。
你的智能体拥有基因组:LLM驱动的自主智能体的序列级行为分析与运行时治理
本文介绍了Base Sequence Analysis框架,该框架将LLM智能体的运行时行为编码为紧凑序列,揭示了高风险模式(如'P-X-P'三元组)和验证缺失。它提出了Governor,一个运行时干预系统,使任务成功率提高了6.2%,并将令牌消耗减少了44%。
具有审计功能的智能体执行引擎,解决提示注入问题
该工具基于纯数学和确定性构建,用于解决间接提示注入和智能体漂移,提供纯审计追踪链。创建者正在寻找试点兴趣。
你的智能体在做什么?
我们构建了一个开源的回顾性读取器,用于Claude Code,以分析智能体行为,利用真实的执行历史来指导运行时治理。