SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
摘要
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
我刚读了一篇新的基准论文《SWE Context Bench:编码中上下文学习的基准》(arXiv 2602.08316,2026年5月)。核心发现一旦说出来就十分明显:当前像 SWE-bench 这样的基准只测试代理能否孤立地解决问题,并不测试代理能否在相关任务中复用所学内容,从而更快速、更廉价地工作。想知道:1. 你认为这个问题将如何解决——外部记忆?框架内解决方案?模型会自行改进?2. 你目前如何尝试解决代理的“失忆”问题?3. langmem / mem0 / supermemory 等方案如果有帮助,是如何支持的?我正在开发 Greplica——一个面向编码代理的轻量级图记忆层。想法很简单:从工程会话中捕获断言、组件、流程和代码锚点,让代理跨会话查询该图,而非每次从头开始。
相似文章
SWE-bench Science:编码代理能否解决科学工程任务?
SWE-bench Science 引入了一个仓库级基准,用于评估编码代理在科学软件修复任务中的表现,揭示了失败机制和科学指导的混合效应。
SWE-Explore:编码代理仓库探索能力基准测试
SWE-Explore 引入了一个基准测试,用于评估编码代理的仓库探索能力,要求在行预算内返回相关代码区域的排序列表。实验表明,基于代理的探索优于传统检索,而行级覆盖仍然是关键区分因素。
SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话
SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。
SWE-Touch:当用户修改代码时对编码智能体的基准测试
介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。
@_akhaliq: SWE-Bench ProMax——大规模多语言代码重构的智能体基准测试 论文:https://huggingface.co/papers/…
介绍了SWE-Bench ProMax,一个包含7种编程语言、170个实例的多语言代码重构基准,用于评估AI编程智能体。前沿模型仅达到41.2%的解决率,证实这是一个具有挑战性且尚未饱和的基准。