标签
本文提出了ECCBench,一个用于评估视觉-语言模型记忆能力的基准和评估框架,超越准确率指标,聚焦于效率、压缩与校准三个维度。
本文介绍了MemUse,一个基准,它表明对话记忆的直接问答准确性不能预测用户满意度,而先前上下文的自然整合则可以,揭示了回忆与对话使用之间的巨大差距。
LongMINT 是一个基准测试,用于在长时域代理系统中评估多目标干扰下的记忆性能。
MEME 基准测试在多实体和动态变化的条件下评估 AI 记忆系统,揭示了即便采用先进的检索技术,在依赖关系推理方面依然存在显著挑战。