memory-evaluation

Tag

Cards List
#memory-evaluation

Good Memory Has ECC: Evaluating the Memory of Vision-Language Models Beyond Accuracy

arXiv cs.LG · 5d ago Cached

This paper introduces ECCBench, a benchmark and evaluation protocol for assessing memory in Vision-Language Models beyond accuracy, focusing on efficiency, compression, and calibration axes.

0 favorites 0 likes
#memory-evaluation

MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation

Hugging Face Daily Papers · 2026-08-25 Cached

The paper introduces MemUse, a benchmark that shows direct QA accuracy for conversational memory does not predict user satisfaction, whereas natural integration of prior context does, revealing a large gap between recall and conversational use.

0 favorites 0 likes
#memory-evaluation

@_akhaliq: LongMINT Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

X AI KOLs Following · 2026-05-21 Cached

LongMINT is a benchmark for evaluating memory under multi-target interference in long-horizon agent systems.

0 favorites 0 likes
#memory-evaluation

MEME: Multi-entity & Evolving Memory Evaluation

Hugging Face Daily Papers · 2026-05-12 Cached

The MEME benchmark evaluates AI memory systems across multiple entities and evolving conditions, revealing significant challenges in dependency reasoning that persist even with advanced retrieval techniques.

0 favorites 0 likes
← Back to home

Submit Feedback