longmemeval

标签

Cards List
#longmemeval

要满足什么条件,你才会信任记忆基准测试的数字?

Reddit r/AI_Agents · 2026-08-12

作者批评了LLM记忆基准测试的可靠性,指出了诸如LoCoMo中错误黄金答案以及评分指标不一致导致巨大分数差距等问题。他们质疑从业者是否信任这些数字,并讨论了最近的改进,如LongMemEval的知识更新问题。

0 人收藏 0 人点赞
#longmemeval

@yoheinakajima: 在 arxiv 论文 #2 中,我处理了论文 #1 中的最后一个主题:@activegraphai 作为自我改进代理的架构可供性 self-improv…

X AI KOLs Following · 2026-06-10 缓存

本文介绍了Regimes,一种基于ActiveGraph运行时的可审计、保留门控改进循环,用于自我改进代理。它通过在LongMemEval数据集上自主发现通过静态检查、沙盒执行和保留验证的提示修复,展示了适度的改进。

0 人收藏 0 人点赞
#longmemeval

Regimes:一种可审计、保留样本门控的改进循环——在ActiveGraph上对LongMemEval的演示

arXiv cs.AI · 2026-06-10 缓存

Regimes是一个建立在ActiveGraph事件溯源运行时上的可审计、保留样本门控的改进循环。它诊断AI智能体中的失败,提出修复方案,并仅在通过多重门控后才予以提升,将LongMemEval上的准确率最多提高了+0.10。

0 人收藏 0 人点赞
#longmemeval

@yoheinakajima: 我知道顺序是反的,但实验#2:

X AI KOLs Timeline · 2026-06-01 缓存

在我们的第二次longmemeval实验中,我们引入了基于ActiveGraph运行时的语义摄取到召回中,通过LLM摄取将平面/智能体检索的召回率从60.6%提升到83.4%/84.8%。

0 人收藏 0 人点赞
#longmemeval

在内存基准测试LongMemEval上以Gemini Flash(非Pro)取得第一 [R]

Reddit r/MachineLearning · 2026-05-17

一个受情景记忆理论启发的新型内存检索系统,使用Gemini Flash在LongMemEval基准测试中取得了最先进的96.4% top-50准确率,通过将检索质量与模型能力分离,超越了基于Pro的大型基线。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈