AI 代理能否安全地撤销其对自身的更改?

Reddit r/artificial 论文

摘要

本文介绍了 EvoUndo,一个将可恢复性作为约束强加于自进化 AI 代理的框架,强调了状态固定和恢复语言表达性等瓶颈。

随着 AI 代理变得越来越自主,它们越来越能够修改自己的提示、工具、中间件、路由、资源和执行框架。这提出了我们在最近工作中研究的一个问题:当自我修改提高了能力但之后无法安全撤销时会发生什么?我们介绍了 EvoUndo,一个将可恢复性视为自进化代理的显式约束的框架。在 600 个未见过的自进化任务中,我们识别出 197 个提高能力但未通过可恢复性验证的突变。在原始恢复表示下,传统修复恢复了 0/197。我们的实验表明,两个重要瓶颈是状态固定和恢复语言表达性。更广泛的观点是,持久的自我修改不应仅根据其是否提高性能来评判。还应测试它们是否能够在反事实状态下安全恢复先前状态。我是本文的作者之一。论文:https://arxiv.org/abs/2608.28363
查看原文

相似文章