标签
作者批评了LLM记忆基准测试的可靠性,指出了诸如LoCoMo中错误黄金答案以及评分指标不一致导致巨大分数差距等问题。他们质疑从业者是否信任这些数字,并讨论了最近的改进,如LongMemEval的知识更新问题。
本文介绍了Regimes,一种基于ActiveGraph运行时的可审计、保留门控改进循环,用于自我改进代理。它通过在LongMemEval数据集上自主发现通过静态检查、沙盒执行和保留验证的提示修复,展示了适度的改进。
Regimes是一个建立在ActiveGraph事件溯源运行时上的可审计、保留样本门控的改进循环。它诊断AI智能体中的失败,提出修复方案,并仅在通过多重门控后才予以提升,将LongMemEval上的准确率最多提高了+0.10。
在我们的第二次longmemeval实验中,我们引入了基于ActiveGraph运行时的语义摄取到召回中,通过LLM摄取将平面/智能体检索的召回率从60.6%提升到83.4%/84.8%。
一个受情景记忆理论启发的新型内存检索系统,使用Gemini Flash在LongMemEval基准测试中取得了最先进的96.4% top-50准确率,通过将检索质量与模型能力分离,超越了基于Pro的大型基线。