标签
本文介绍了一种参数化多模态用户记忆系统,通过整合语音和外貌等感知数据,利用视觉语言模型和专用编码器,提升AI智能体回忆用户的能力,从而超越基于文本的方法。
EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。
本文介绍了AdaMM,一个通过分析记忆补充基于检索的多模态记忆的框架,能够对累积的观测进行过滤、聚合、排序和时间比较。在MemEye和MemGallery基准上的实验显示,性能分别提升了高达11.3%和7.3%。
ViSAGE是一个用于长视频理解的多模态智能体记忆框架,通过跨模态绑定、双向记忆精炼和多智能体交叉验证来构建自我纠正、以实体为中心的记忆,相比基线实现了5.9%的准确率提升。