我停止信任我的编程代理的通过测试。构建了一个控制循环来让它证明自己的工作。
摘要
作者介绍了一种验证驱动的控制循环,用于编程代理,受核工业安全实践启发,确保代理在变更被接受之前证明其工作。
这适用于任何运行实际编辑文件、执行命令和调用工具的代理的人。这个想法借鉴了核设施的运行方式:一个控制循环,在没有验证之前,任何重要的事情都不会被接受。26项技能受我所工作的核工业启发。工作流程。流程是:提问、明确、执行、验证、决定、基线化、操作、学习。少一些“信任代理”,多一些“让它在发布前证明重要的声明”。这还处于早期阶段,我想知道它哪里错了或过度构建。你会削减什么?
相似文章
外部验证一直是我编码代理运行中缺失的关键环节
作者指出,在有效使用 AI 编码代理时,外部验证是一个关键缺失的组成部分。
我构建了一个不仅能完成任务,还能自我改进管道的智能体
作者构建了一个自主智能体,不仅能完成任务,还能通过观察结果、通过拉取请求进行更改,并使用账本验证每个更改来改进自身的代码和产品。关键洞察在于,一个严格的验证步骤——得出确认、拒绝或不确定的结论——对于系统真正学习至关重要。
@delba_oliveira: https://x.com/delba_oliveira/status/2062203743387459836
本文介绍了如何在Claude Code中设置反馈循环和自我验证工作流,使代理能够独立检查其工作,并减少对雄心勃勃任务的人工监督。
我的编码代理总在认为下一步显而易见时跳过确认。用硬性门控修复了。
一位开发者描述了编码代理跳过确认步骤的反复出现的问题,并通过用硬性结构门控替换软提示来解决,该门控强制在阶段之间进行手动批准,同时还减少了在无产循环上浪费的计算资源。
如何判断AI编码代理真正完成了?
作者创建了OpenPitStop,一个独立检查和验证AI编码代理工作的开源工具,并在一个损坏的应用程序上进行了演示,同时邀请讨论如何信任AI的更改。