Hivemind 将我的代理轨迹转化为 19 个可复用技能,却拒绝编写文档中已覆盖的那个(实操评测)
摘要
对 Activeloop Hivemind 的实操评测:它从代理轨迹中挖掘出 19 个可复用技能,通过跳过已记录的流程展现了选择性记忆,在复杂任务上改善了跨会话回忆,但在短任务上出现回忆问题与额外开销。
我将 Activeloop 的 Hivemind(面向编码代理的持续学习/共享内存,支持 Claude Code、Cursor 和 Codex)接入我真实的工作流一天,并测了它实际表现。
诚实笔记:
- 它在大约两分钟内从我真实的代理历史中挖掘出 19 个命名技能,每个技能都能溯源到来源会话。
- 最棒的是它拒绝编写的内容:我让它处理一个仓库中已有文档的工作流,它返回 0 个候选(“已记录在案,未检测到可重复的错误模式”)。这是一个有品位的记忆层,不是囤积狂。
- 技能传播测试:同一个 bug,两个全新代理,一个范围内包含挖掘出的技能,另一个不包含。包含的那个直接给出了准确的根因;不包含的那个给出通用检查清单并漏掉了。
- 开箱即用时,我机器上的召回功能坏了。我追踪到摘要工作进程(每次会话 120 秒超时,并发 4,我的转录文件高达 18MB,导致资源匮乏),分阶段并刷新后,语义召回才生效。
- 诚实的缺点:在简短、文档完善的任务上,主动召回大约多花费 75% 的轮次。它在记忆密集型工作上表现出色(对过往精确工作的真正跨会话召回),而在简短任务上消耗你,所以需要调优而不是处处盲信。
完整文章和视频演示链接见评论区(版规)。披露:这是一次付费评测。所有测试、数据和观点都是我自己的,包括那些不吹捧产品的部分。
相似文章
activeloopai/hivemind
Hivemind 是 Activeloop/Deeplake 推出的开源工具,为 AI 编程代理提供自动学习、云支持的共享内存。它捕获痕迹、编码模式并在代理间传播技能,在 LoCoMo 基准测试上实现 25% 的成本节省和 1.7 倍的令牌减少。
我曾因这些技能引以为豪。如今,AI智能体做得更好。
作者反思了AI智能体在代码导航、调试和报告撰写方面如何超越自己,并询问他人在多智能体工作流(如MCP、Anvita Flow和Agent Protocol)方面的经验。
SkillHone:一种通过持久决策历史实现持续智能体技能演进的框架
SkillHone 是一种通过持久决策历史和练习反馈来提升研究和工具中介分析任务性能的持续智能体技能演进框架。它在 GAIA 和 WebWalkerQA-EN 基准测试上优于现有方法。
@9hills: 尝试了多种Agent Memory实现,只有两种我觉得还有点用: 1. Hermes 这种严格限制长度的条目级记忆和会话召回,用来解决个人助理所需的记忆。但是这种和Coding没关系。 2. 根据轨迹沉淀 skill 和 skill 进化…
作者分享了尝试多种Agent Memory实现后的心得,认为只有严格限制长度的条目级记忆(如Hermes)和基于轨迹沉淀的技能进化两种方法比较有用,其他图谱类或卡片类的方法效果不佳。
Agent Harness 中的记忆现状(12分钟阅读)
一项针对主要AI Agent Harness(Claude Code、Codex、Copilot等)中记忆实现的调查揭示了常见的边界故障,包括有界本地存储、关键词检索、Harness作用域、弱陈旧性处理以及57-71%的跨用户污染率,凸显了Agent记忆基础设施中尚未解决的问题。