long-horizon-evaluation

标签

Cards List
#long-horizon-evaluation

MemEvoBench:LLM 代理内存误演化基准测试

arXiv cs.CL · 2026-04-20 缓存

MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈