标签
Introduces FinPerMA, an event-grounded benchmark for evaluating personalized memory in LLM agents for financial advising, showing that current models and memory systems remain far from saturated.
介绍了factwash,一个开源的写入时门控,它通过去除来源归属、模糊限制语或时间语境,确定性地捕捉将传闻变成事实的AI改写。本文分析了何时简单检查就足够、何时需要LLM见证者,并在大型标注语料库上评估了该方法。
一位开发者对8个AI智能体记忆系统运行了2,176项任务,发现由智能体自行维护的纯文本Markdown wiki胜过了所有商业产品,其中Mitosis Cortex是最佳的托管选项。
Setoka是一个基准,用于评估记忆增强的个性化智能体从异构数据中分层理解用户(语义记忆、情景记忆、行为模式、人格特质)的能力,揭示了当前记忆系统在需要跨来源整合和抽象的任务上存在困难。
Claude研究了61个智能体记忆系统的代码库(包括OpenClaw、Hermes、Pi),分析了它们记忆的工作原理,旨在帮助开发者构建自己的实现。
作者认为,预训练的LLMs在真实的公司工作中失败,是因为它们缺少一个类似hippocampus的快速学习系统来捕捉具体、分散的工作流程,这与人类大脑的互补学习系统不同。他们提出,将工作片段整合为经过批准、有版本控制的程序,并辅以治理,可能是一个解决方案。
一条推特帖子认为,强大AI代理的关键不在于更好的提示词,而在于积累的个人上下文和记忆系统,并强调Obsidian是知识复利的工具。作者预测,单独使用AI的人与结合个人上下文使用AI的人之间的差距将日益扩大。
一篇反思文章,探讨为小型企业构建AI代理所面临的挑战,将过程比喻为往漏水的杯子里倒水,错误和漏洞导致效率低下,但通过系统化的调试和规则编写,系统逐步得到改善。
前谷歌工程师发布了一小时课程,涵盖自建代理、RAG记忆和AI循环;声称比付费代理课程更好。
StateFuse是一种面向多智能体系统的冲突感知复制内存契约,它保留矛盾的观察结果而非将其合并,从而在不追求通用准确性提升的前提下,实现更安全的弃权和可审计的修正。
本文介绍了Narrative World Model(NWM),这是一个面向长篇虚构故事作者的记忆系统。它利用基于叙事学的类型化时间状态图和查询条件混合检索,来回答关于故事状态演变的复杂多跳问题。该系统在叙事学问答基准测试中显著优于现有的时间知识图谱框架(如Graphiti)。
据报道,一位年薪170万美元的Anthropic工程师认为,内存与检索架构技能是AI工程师最有价值的技能,薪资范围从提示词工程师的9万美元到系统架构师的七位数以上。
一条推文强调了为AI助手构建个人知识图谱系统的趋势,引用了一份Google PDF,解释了结构化记忆背后的架构,用于个性化AI回应,与忘记上下文的标准AI形成对比。
ComMem 提出了受生物记忆启发的互补记忆系统,以改进视觉语言模型的测试时自适应,在15个基准测试上超越了现有最先进方法。
这篇文章讨论了AI记忆系统的设计方法,主张从评估出发让好的记忆系统自然涌现,而不是从上到下设计记忆架构。作者认为记忆是系统在压力下进化出来的二阶效应,并提出纵向评估框架。
This paper from SJTU and Tsinghua systematically evaluates 12 agent memory systems from a data management perspective, decomposing memory into four modules and providing guidelines on when to use RAG, vector databases, or knowledge graphs for long-term agent memory.
一篇论文系统评估了12个LLM Agent记忆系统,将其拆分为四个模块,发现没有单一架构在所有场景下占优,并揭示了成本-性能权衡和常见问题(如“过去的幻觉”)。