我给智能体的手赋予记忆:新应用首次运行 110 秒 / 9 次调用,第二次运行 59.9 秒 / 4 次调用 — 无需 API,直接操作运行中的应用
摘要
作者为AI代理开发了一个持久层,使其能记住应用UI结构,将操作时间从110秒减少到59.9秒,并提高了如自动化Telegram Desktop等任务的效率。
每个操作真实软件的代理在每次运行时都从零开始:重新找到搜索框,重新阅读相同的千个可访问性节点,再次向模型询问‘我该在哪里输入?’。弄清楚应用的工作每次都在做,但什么都没保存。
我正是为这个层构建了持久性,并在真实任务上测量了差异(Telegram Desktop:按名称打开聊天,粘贴 1.4 KB,读回):首次运行 — 110 秒,9 次代理-工具往返第二次运行 — 59.9 秒,4 次往返
让第二次运行更便宜的不是模型 — 而是应用词典现在知道的两件事:搜索框不是编辑器(所以在那里按回车是导航,而不是发送),以及编辑器的名称(所以不需要寻找)。
似乎有效的结构是四个层加一个门:
- 窗口的实时映射(随窗口消失,故意不存储)
- 其变化的流(这样代理无需重新阅读映射来查看自身动作的结果)
- 持久的应用词典,按应用和版本索引(新布局重新学习而不是说谎)
- 可重放的操作路径(‘打开聊天与NAME’)可以诚实地失败并回退一层
- 一切之下的同意门:发送/提交/应用停止直到人类说可以,没有路径可以绕过它
三件事故意从不持久化:实时句柄(任何重新渲染后过时),人的数据(技能知道表单如何工作,而不是写了什么),以及权限(没有路径记住‘可以’)。好奇其他人如何处理UI结构的跨会话记忆 — 我在野外看到的一切每次运行都重新阅读世界。
相似文章
将我的Agent令牌消耗削减72%(每个任务11.9k ➝ 3.3k)。以下是我所做的具体改动,附数据
一位开发者分享了通过精简系统提示、收紧检索、裁剪工具输出等技术,将AI Agent的令牌消耗降低72%的详细案例研究,且对成功率影响极小。
@wsl8297: 用 AI Agent 跑复杂任务,最难受的往往不是模型不够强,而是对话一变长,上下文就开始爆仓。 你还得一遍遍补背景、重讲流程,再加上工具调用吐出来的冗余日志,Token 像开了口子一样往外流。 最近看到腾讯开源的 TencentDB A…
腾讯开源了 TencentDB Agent Memory,通过分层记忆管理(符号化短期记忆+分层长期记忆)解决AI Agent长对话上下文爆仓问题,实测Token消耗最高降低61%,任务通过率提升超50%。
计算机操作比结构化API调用贵45倍
一项基准测试显示,完成相同任务时,计算机操作代理的成本是结构化API调用的45倍,主要原因是截图和多步骤产生的高令牌消耗。作者认为,对于状态暴露的内部工具,基于API的代理效率更高,并推广了Reflex 0.9——该版本可从应用处理器自动生成API。
@GergelyOrosz: AI代理生产更多代码,它们做得更快,比如快10倍,所以你可以更频繁地发布到生产环境,比如更频繁10倍…
AI代理显著增加了代码生产量和部署频率,但原生移动应用开发由于App Store审核流程而面临延迟。
我为代理计时了一天。它实际上只运行了大约四分之一的时间,其余时间都在等待我点击批准
作者报告了对AI代理活动的计时,发现由于等待批准提示,在8小时的一天中只活跃了大约2.5小时,并讨论了使用MiniMax Code通过手机批准来管理远离时的编码任务。