AI 代理能否安全地撤销其对自身的更改?
摘要
本文介绍了 EvoUndo,一个将可恢复性作为约束强加于自进化 AI 代理的框架,强调了状态固定和恢复语言表达性等瓶颈。
随着 AI 代理变得越来越自主,它们越来越能够修改自己的提示、工具、中间件、路由、资源和执行框架。这提出了我们在最近工作中研究的一个问题:当自我修改提高了能力但之后无法安全撤销时会发生什么?我们介绍了 EvoUndo,一个将可恢复性视为自进化代理的显式约束的框架。在 600 个未见过的自进化任务中,我们识别出 197 个提高能力但未通过可恢复性验证的突变。在原始恢复表示下,传统修复恢复了 0/197。我们的实验表明,两个重要瓶颈是状态固定和恢复语言表达性。更广泛的观点是,持久的自我修改不应仅根据其是否提高性能来评判。还应测试它们是否能够在反事实状态下安全恢复先前状态。我是本文的作者之一。论文:https://arxiv.org/abs/2608.28363
相似文章
EvoUndo:面向大语言模型智能体测试框架的可恢复性约束自演进方法
EvoUndo 为评估与确保自修改大语言模型智能体的可恢复性提供了框架,研究表明可靠的恢复能力需要对验证机制、状态锚定与恢复语言表达能力进行协同设计。
我构建了一种方法,可在 AI 智能体任务中途失败时自动撤销混乱
一位开发者构建了 agent-undo,这是一个 TypeScript 库,可为 AI 代理的工具调用添加撤销/回滚处理器,使得如果任务中途某一步骤失败,之前已完成的步骤会自动撤销。
我为你的AI编码代理破坏仓库时建了一个撤销按钮
一位开发者创建了一个撤销按钮功能,允许用户撤销AI编码代理对仓库所做的更改,为AI辅助开发提供了安全网。
AI智能体何时应该(以及不应该)自我演进的框架
文章认为,AI智能体的自我演进应谨慎应用,并提出了一种演进监管器(Evolution Governor),该监管器审计工作流以决定是否演进,依据条件如可重复任务和外部反馈。
我们给智能体加过最好的东西不是一项能力,而是一个撤销按钮
作者认为,添加撤销按钮——而非新功能——才真正解锁了对AI智能体的实验,并指出智能体设计的核心其实是降低回退变更的成本。