我给智能体的手赋予记忆:新应用首次运行 110 秒 / 9 次调用,第二次运行 59.9 秒 / 4 次调用 — 无需 API,直接操作运行中的应用

Reddit r/AI_Agents 工具

摘要

作者为AI代理开发了一个持久层,使其能记住应用UI结构,将操作时间从110秒减少到59.9秒,并提高了如自动化Telegram Desktop等任务的效率。

每个操作真实软件的代理在每次运行时都从零开始:重新找到搜索框,重新阅读相同的千个可访问性节点,再次向模型询问‘我该在哪里输入?’。弄清楚应用的工作每次都在做,但什么都没保存。 我正是为这个层构建了持久性,并在真实任务上测量了差异(Telegram Desktop:按名称打开聊天,粘贴 1.4 KB,读回):首次运行 — 110 秒,9 次代理-工具往返第二次运行 — 59.9 秒,4 次往返 让第二次运行更便宜的不是模型 — 而是应用词典现在知道的两件事:搜索框不是编辑器(所以在那里按回车是导航,而不是发送),以及编辑器的名称(所以不需要寻找)。 似乎有效的结构是四个层加一个门: - 窗口的实时映射(随窗口消失,故意不存储) - 其变化的流(这样代理无需重新阅读映射来查看自身动作的结果) - 持久的应用词典,按应用和版本索引(新布局重新学习而不是说谎) - 可重放的操作路径(‘打开聊天与NAME’)可以诚实地失败并回退一层 - 一切之下的同意门:发送/提交/应用停止直到人类说可以,没有路径可以绕过它 三件事故意从不持久化:实时句柄(任何重新渲染后过时),人的数据(技能知道表单如何工作,而不是写了什么),以及权限(没有路径记住‘可以’)。好奇其他人如何处理UI结构的跨会话记忆 — 我在野外看到的一切每次运行都重新阅读世界。
查看原文

相似文章

@wsl8297: 用 AI Agent 跑复杂任务,最难受的往往不是模型不够强,而是对话一变长,上下文就开始爆仓。 你还得一遍遍补背景、重讲流程,再加上工具调用吐出来的冗余日志,Token 像开了口子一样往外流。 最近看到腾讯开源的 TencentDB A…

X AI KOLs Timeline

腾讯开源了 TencentDB Agent Memory,通过分层记忆管理(符号化短期记忆+分层长期记忆)解决AI Agent长对话上下文爆仓问题,实测Token消耗最高降低61%,任务通过率提升超50%。

计算机操作比结构化API调用贵45倍

Reddit r/AI_Agents

一项基准测试显示,完成相同任务时,计算机操作代理的成本是结构化API调用的45倍,主要原因是截图和多步骤产生的高令牌消耗。作者认为,对于状态暴露的内部工具,基于API的代理效率更高,并推广了Reflex 0.9——该版本可从应用处理器自动生成API。