标签
AutoMem 是一个文本梯度递归自我改进框架,用于LLM代理中的自动化记忆架构搜索,它发现任务自适应架构,这些架构在准确性和效率上超越了人类设计的基线。
本文提出了一种用于智能体记忆的纵向评估工具,通过在文本生成之前生成事实来避免标签错误和污染,并证明短期基准测试相比长期性能可能会错误地排序记忆架构。同时,它还发布了用于智能体记忆评估的开源库Veracium。
本文探讨了在智能代理系统中,过程的因果链是否与结果同等重要,并质疑记忆架构是否应该存储因果线索而不仅仅是原始输出。
一篇比较RNNs、Transformers和SSMs中记忆设计的技术分析,主张关键问题在于序列状态应存储于何处,而非哪种架构更优。讨论了压缩隐状态、增长的KV缓存以及模型连接中类突触记忆之间的权衡。
本文介绍了多轮Text-to-SQL基准测试EnterpriseMem-Bench,并评估了五种前沿模型在不同记忆架构下的表现,发现无状态模型在第三轮时崩溃,且工作记忆带来的提升最大。