我把一个具有持久记忆和工具访问权限的智能体放进了实体机器人身体里。有趣的问题并不是我预料到的那些。
摘要
作者分享了将一个具有持久记忆、工具访问和反射能力的AI智能体嵌入实体机器人的经验,强调快速反射必须绕过智能体,记忆需要整合,能力需要克制,而时机是感知智能的关键。
我见过的大多数智能体项目都是文本进、文本出。我花了几个月时间把一个智能体放进了一个手掌大小的桌面机器人里,它有舵机手臂、摄像头和IMU。真正出问题的并不是我原本预料的那些。这个智能体实际拥有:跨重启的持久记忆,分为会话记录、一个它自己写入的长期事实文件,以及一份用户画像。工具访问权限,包括智能家居控制。还有一个共享会话,所以我口头进行的对话和用键盘进行的对话是同一个对话。我口头说“我左边的台灯叫Gerald”,然后打字问那盏台灯叫什么,它会回答Gerald。我学到的四件事,我认为它们也适用于机器人之外的场景。反射必须完全绕过智能体。任何经过模型调用的东西都会让人感觉死气沉沉,无论模型多快。挥手回应是一个300ms的反射,基于设备端视觉,回路中没有其他任何东西。智能体甚至根本不知道这件事发生过。将反射与思考分离是项目中最大的一次单项质量提升。记忆会积累矛盾,而且运行时间越长就越严重。几周之后,我的记忆文件里就全是冗余的事实,接着是直接相互冲突的事实。我最终运行了一个定期的整合任务,把整个记忆交给一个更强的模型,让它进行调和与压缩。没有它,质量会以你察觉不到的方式退化,等你发现时已经很糟糕了。一个有38个工具的智能体会不断地拿错工具。我不得不明确告诉它,除非被要求,否则不要碰终端、文件或网页工具,智能家居工具除外。能力从来不是限制,克制才是。时机胜过智能。身体动作由模型自己句子中内联写入的标签触发,所以一个手势会落在准确的词语上,而不是在句子结束后才出现。这比我尝试过的任何模型升级都更能提升它给人的智能感。有一个值得直说的限制:对话层在云端,而不是本地。我在板子上尝试了较小的本地模型,但延迟毁了体验。如果你们对记忆整合或反射/智能体拆分感兴趣,我很乐意深入聊聊。
相似文章
我一直在尝试自定义智能体,有趣的部分并非任务完成,而是它们拥有记忆后发生的变化
作者反思了实验自定义 AI 智能体的经历,指出长期记忆和连续性将智能体从简单的任务执行者转变为具有“稳定倾向”的持久协作伙伴。这引发了关于智能体“个性”的价值与工作流程中控制、可靠性和可审计性需求之间的矛盾的问题。
当一半的价值依赖于记忆时,你如何真正让个人代理变得有用?
关于评估价值高度依赖记忆的个人AI代理所面临挑战的反思,通过作者使用Macaron代理的经历加以说明。
尝试让智能体记忆跨会话持久化所学的经验
本文反思了AI智能体记忆的复杂性,远超简单的存储问题,强调了诸如判断真实性、优先级变化、区分决策与噪音以及何时恰当地呈现上下文等挑战。
使用AI助手几个月后,我最大的观察
个人对具有持久记忆的AI助手变革潜力的反思,认为上下文和工作流组织将比模型本身更重要。
我曾以为AI智能体在于工具,但我错了
一篇关于构建AI智能体的反思文章,指出核心挑战并非工具,而是设计人机之间的边界、信任与故障模式。