我的编码代理现在会在合并前将自己的更改部署到沙箱并进行测试
摘要
作者介绍了如何使用 Mastra 的新预览部署功能,让编码代理自动将更改部署到沙箱,通过 API 和 UI 进行测试,然后开启 PR,从而弥合了验证缺口。
我在其中一个仓库里有一个机器人,会在测试后为新问题起草回复(有点像 Greptile?)。现在,Claude Code 已经承担了其中大部分代码编写工作,但我一直有个验证缺口没有解决。此前,我的检查方式是本地运行代码,自己手动点击浏览应用——每次改动都要这样。我一直在寻找类似预览部署但面向代理服务器的方案,结果发现 Mastra(这个机器人基于的 TypeScript 代理框架)几天前刚发布了这个功能。新的流程是:编码代理现在会把整个项目部署到一个一次性沙箱(E2B、Daytona),拿到一个 API 的公网 URL 和一个聊天 UI 的 URL;它会先 curl 自己的接口并检查响应,然后再开启 PR;沙箱会按定时器过期,无需清理。这一次,测试全绿,我也无需在本地运行任何东西。值得一试。
相似文章
@AniHermit: 我正在思考如何将编码代理部署到云端,用于大规模自动化审查+质量保证,从接口测试…
文章讨论了将编码代理部署用于大规模自动化审查和质量保证,并介绍了'agent-sandbox'作为一个基于Kubernetes的工具,用于管理隔离的AI代理工作负载。
我一直放弃多智能体工作流,因为我无法验证它们提交的代码。你们是怎么处理的?
一位开发者分享了他在使用多智能体编码工作流时的困扰——并行 PR 的产出难以逐一验证——并描述了他如何构建一个 AI QA 智能体,通过真实浏览器(借助 Browserbase)自动点击预览部署,对无法正常运行的 PR 标记失败。
在发布变更之前,你是如何测试智能体的?
作者介绍了一种智能体回归测试工具,帮助开发人员在代码变更后验证工具调用及工作流执行结果。
@claudeai: Code with Claude London 现场直播:我们正在推出自托管沙箱(公开测试版)和MCP隧道(研究预览…
Anthropic在Claude Managed Agents中推出自托管沙箱(公开测试版)和MCP隧道(研究预览),使代理能够在用户自己的安全边界内运行,并默认应用安全控制。
GitHub 为 Copilot 添加了本地沙箱功能。这是否让你更放心让代理在无人值守的情况下运行?
GitHub 已为 Copilot 添加本地沙箱,以限制编码代理可能造成的损害,但此次更新引发了关于其是否充分解决了无人值守操作的信任问题的疑问。